AI 검색 노출은 어떻게 측정하는가?

AEO(AI최적화)를 하겠다고 하면 가장 먼저 막히는 곳이 측정이다. 검색 순위처럼 눈에 보이는 숫자가 없기 때문이다. 답부터 말하면, 질문 목록을 고정해 놓고 여러 엔진에 반복해서 넣은 뒤 등장률·등장 순서·정보 정확도·출처 인용 네 가지를 세면 된다. 아래는 그 네 가지가 각각 무엇이고, 어떤 측정치는 믿어도 되고 어떤 측정치는 믿으면 안 되는지에 대한 정리다.

AI 검색 노출은 무엇으로 세는가?

네 가지를 센다. 답변에 우리가 나오는가(등장률), 몇 번째로 나오는가(등장 순서), 나온 정보가 맞는가(정확도), 우리 사이트를 출처로 달았는가(출처 인용)다. 이 넷은 서로 다른 문제를 가리키므로 하나로 합쳐 부르면 원인을 못 찾는다.

실제로 자주 보이는 조합은 등장률은 0인데 경쟁 병원은 서너 곳이 나오는 상태다. 이건 홍보가 부족한 게 아니라, 그 질문에 답이 될 문서가 우리 쪽에 없다는 뜻이다.

반대로 등장은 하는데 정확도가 낮은 경우도 흔하다. 이때는 글을 더 쓰는 것보다 사실 정보를 기계가 읽는 형식으로 정리하는 쪽이 먼저다.

지표세는 방법낮으면 의미하는 것
등장률질문 100개 중 우리 이름이 나온 답변 수AI가 참고할 우리 문서 자체가 없다
등장 순서답변 안에서 몇 번째로 언급되는가언급은 되지만 근거가 약하다
정보 정확도진료 항목·위치·시간이 맞게 인용되는가옛 정보나 남의 정보가 섞여 있다
출처 인용우리 사이트 주소가 출처로 붙는가우리 글이 아니라 남의 글이 근거다

왜 한 번 물어본 결과는 믿을 수 없는가?

같은 질문을 다시 넣어도 답이 그대로 나오지 않기 때문이다. AI는 매번 문장을 새로 만들고, 로그인 상태·이전 대화·질문한 시각에 따라 인용하는 문서가 달라진다. 한 번 물어본 화면 한 장은 측정치가 아니라 표본 하나다.

그래서 원장님이 직접 ChatGPT에 병원 이름을 넣어 보고 잘 나오더라, 하는 확인은 실태 파악에 도움은 되지만 성과 근거로는 쓰기 어렵다. 특히 이전에 자기 병원 이야기를 나눈 계정에서 물으면 그 대화가 답에 영향을 준다.

측정으로 쓰려면 조건을 고정해야 한다. 로그인하지 않은 상태에서, 같은 문장으로, 같은 주기로, 여러 번 물어서 평균을 본다. 조건이 흔들리면 좋아진 것인지 그날 운이 좋았던 것인지 구분되지 않는다.

질문은 몇 개를 어떻게 고르는가?

진료과별로 100개 정도를 고정해 두고 쓴다. 개수보다 중요한 건 구성이다. 손님이 실제로 치는 문장을 유형별로 갈라 담아야 어느 쪽이 비어 있는지 보인다.

질문 목록은 한 번 정하면 함부로 바꾸지 않는다. 목록을 바꾸면 지난달 숫자와 비교가 끊긴다. 새 질문은 기존 목록에 더하되, 비교표에서는 따로 표시해 두는 편이 안전하다.

이 목록은 측정용으로 끝나지 않는다. 답변에 우리가 안 나온 질문이 그대로 다음 달에 쓸 글의 주제표가 된다.

  1. 증상형'턱에 계속 여드름이 나는데 어디 가야 하나' 처럼 병명을 모르고 묻는 말.
  2. 시술·진료명형이미 이름을 알고 묻는 말. 경쟁이 몰리는 구간이다.
  3. 지역형'해운대 OO과' 처럼 지역을 붙여 묻는 말. 위치 정보가 정확해야 잡힌다.
  4. 비교형두 가지 치료나 두 병원을 비교해 달라는 말. 답변에 이름이 끼는지가 갈린다.
  5. 비용·절차형얼마나 드는지, 몇 번 가야 하는지 묻는 말. 규정상 표현이 조심스러운 구간이다.

엔진은 몇 개를 봐야 하는가?

한 곳만 보면 판단이 흔들린다. 엔진마다 참고하는 문서와 인용 방식이 달라서, ChatGPT·Gemini·Claude·Perplexity·Grok 다섯 곳을 함께 넣고 각각 따로 기록한다. 다섯 개 값을 평균 내지 말고 엔진별로 남겨야 어디가 막혔는지 보인다.

실제로 한 엔진에서는 잘 나오는데 다른 엔진에서는 전혀 안 나오는 상태가 자주 관측된다. 이건 사이트 전체 문제가 아니라 특정 경로의 문제일 가능성이 크다.

출처 링크를 함께 보여 주는 엔진은 근거 확인이 쉬워 개선 작업의 기준점으로 쓰기 좋다. 출처를 보여 주지 않는 엔진은 등장률과 정확도 위주로 본다.

믿을 수 있는 측정과 못 믿을 측정은 무엇이 다른가?

재현 가능한가가 기준이다. 다른 사람이 같은 조건으로 다시 해서 비슷한 값이 나오면 측정이고, 나오지 않으면 일화다. 아래 다섯 가지가 지켜졌는지만 확인하면 대체로 갈린다.

잘 나온 화면만 모은 자료는 성과가 아니라 편집이다. 안 나온 질문까지 같은 형식으로 남아 있어야 다음 달에 무엇을 손댈지 정할 수 있다.

업체를 고를 때도 이 다섯 줄이 그대로 확인 항목이 된다. 질문 목록을 보여 줄 수 있는지, 안 나온 결과도 리포트에 들어가는지 물어보면 된다.

항목믿을 수 있는 측정믿기 어려운 측정
질문고정된 목록 그대로그때그때 떠오른 문장
환경로그인하지 않은 상태평소 쓰던 계정
횟수같은 질문 여러 번 반복한 번 물어본 화면 한 장
기록답변 전문과 시각을 저장잘 나온 것만 캡처
주기같은 요일·같은 방식으로 반복생각날 때 확인

숫자가 아직 안 움직일 때는 무엇을 보는가?

등장률은 늦게 움직이는 지표다. 그 전에 먼저 변하는 신호가 있다. 우리 문서가 출처로 붙기 시작했는지, 이름이 아니라 진료 내용만이라도 인용되는지, 잘못 나오던 정보가 바로잡혔는지를 본다.

이 신호들이 하나도 없는데 등장률만 오르길 기다리는 건 근거 없는 대기다. 반대로 신호가 잡히기 시작하면 순서상 등장률이 뒤따르는 경우가 대체로 많다.

얼마 만에 움직이는지는 사례에 따라 갈린다. 진료과 경쟁 밀도와 기존 사이트 상태가 다르기 때문이다.

  1. 출처 인용 시작이름은 아직 안 나와도 우리 페이지가 참고 문서로 붙는 단계.
  2. 부분 등장지역형·시술명형처럼 좁은 질문에서만 먼저 나오는 단계.
  3. 정보 교정틀리게 인용되던 진료 항목·위치가 맞게 바뀐 단계.

측정 결과로 다음 달에 무엇을 정하는가?

안 나온 질문 목록이 그대로 작업 순서가 된다. 등장률이 0인 질문 중 손님이 많이 묻는 것부터 채우고, 등장은 하는데 정보가 틀린 항목은 글이 아니라 사실 표기를 고친다.

이렇게 정리해 두면 매달 무엇을 쓸지 회의로 정할 일이 없어진다. 지난주 측정에서 비어 있던 칸이 이번 달 목록이다.

거대기획의 무료 진단(G-CHECK)은 이 방식으로 5개 엔진에 진료과별 질문 100개를 넣고 영업일 3일 안에 리포트 3종으로 남긴다. 이후 주간 측정을 붙이면 같은 표가 매주 갱신된다. 직접 하더라도 위의 다섯 가지 조건만 지키면 값 자체는 만들 수 있다.

측정에서 나온 상태다음 달에 할 일
질문에 아예 등장하지 않음그 질문에 답하는 문서를 새로 만든다
등장하지만 순서가 뒤즉답 문단과 근거를 보강한다
정보가 틀리게 인용됨진료 항목·위치·시간 표기를 정리한다
출처가 남의 글같은 내용을 우리 사이트에 원문으로 둔다

자주 묻는 질문

직접 ChatGPT에 물어보는 것으로는 부족한가?
현황을 훑는 데는 쓸 만하다. 다만 로그인 상태와 이전 대화가 답에 영향을 주고 같은 질문에도 답이 매번 달라져서, 개선 여부를 판단하는 근거로는 약하다. 조건을 고정해 반복해야 비교가 된다.
질문 100개는 어떻게 정하나?
진료과별로 증상형·시술명형·지역형·비교형·비용절차형을 갈라 담는다. 실제 접수 문의와 상담 기록에 나온 문장을 그대로 쓰는 편이 대체로 정확하다.
얼마나 자주 재는 것이 적당한가?
주 단위가 무난하다. 매일 재면 변동에 휘둘리고, 분기에 한 번이면 무엇 때문에 바뀌었는지 원인을 짚기 어렵다.
AI 답변에 병원 이름이 나오면 광고로 보나?
게시하는 문서 자체는 의료광고법 검수 대상이다. 측정 리포트에 치료 효과를 단정하는 표현이 들어가지 않도록 지표를 유입·노출 쪽으로 한정하는 편이 안전하다.
G-CHECK

지금 우리 병원은 AI가 어떻게 말하고 있을까요

5개 AI 엔진에 진료과별 100개 질문을 실제로 넣어 노출률을 셉니다. 진단은 무료이고 영업일 3일이 걸립니다.

지금 귀원의 AI 노출 상태부터 확인하십시오

홈페이지 주소만 입력하시면 3종 무료 진단 리포트를 보내드립니다. 제안서를 내밀기 전에, 데이터를 먼저 드립니다.

FREE G-CHECK REQUEST

무료 AI 마케팅 건강검진 신청

알게 된 경로 (선택)
관심 서비스 (선택 · 복수 가능)
신청 정보는 진단 리포트 발송 및 상담 목적으로만 이용됩니다.
AI 검색 노출은 어떻게 측정하는가? | 거대기획