본문 바로가기
2026-09-17 THU · 최근 갱신편집 원칙발행 정보RSS

GEO·AEO·AI 검색 실무 브리핑

분석병원마케팅

의료 질문 AI 답변의 출처, 엔진마다 달랐다…기관 편중과 롱테일

공개 논문 속 의료 답변은 미국 보건기관과 대형 의료정보 사이트에 기울었지만, 1위 출처와 꼬리 분포는 모델마다 달랐다

핵심 요약

  • Wu 외(2025)의 의료 질문 평가에서 7개 모델이 인용한 출처는 평균 92%가 미국 사이트였고, 1위 도메인과 그 비중은 모델마다 달랐다.
  • Allaham·Diakopoulos(2026)가 분석한 AI 검색 4종의 인용에서 상위 25개 도메인은 전체의 23.8%였고, 도메인의 59.1%는 한 번만 인용됐다.
  • Hu 외(2026)의 임신·육아 질문 감사에서 구글 AI 개요는 건강 분야 사이트를 가장 많이 인용했지만 중·저 신뢰도 출처도 절반 가까이였다.

의료 정보는 틀렸을 때 피해가 큰 분야라 AI 답변이 무엇을 근거로 삼는지가 더 무겁게 다뤄진다. 2025–2026년 공개된 논문들은 공공 보건기관과 대형 의료정보 사이트가 상위를 차지하는 경향과 함께, 어떤 모델과 엔진을 쓰느냐에 따라 출처 구성이 크게 달라진다는 결과를 내놓았다.

한줄 정의 · 롱테일 출처
인용 빈도 분포에서 자주 인용되는 소수 도메인 밖에 흩어져, 각각은 한두 번씩만 인용되는 다수의 출처를 가리키는 말.

GEO뉴스 편집부는 의료·건강 질문에 대한 생성형 AI와 AI 검색의 인용 출처를 분석한 공개 논문 세 편과, 의료에 한정되지 않지만 엔진 사이의 출처 차이를 잰 논문 두 편을 2026년 8월 7일 원문으로 확인했다. 다섯 편 모두 영어 질문이 중심이고, 의료 분야 논문 세 편도 미국 중심의 질문이나 이용 환경을 바탕으로 했다. 이 기사에서는 편집 원칙에 따라 논문에 실명으로 나온 병원 운영 사이트를 병원 A·병원 B로 표기했다.

의료 질문 AI 답변은 어떤 출처를 인용했나?

공개 논문에서 상위를 차지한 것은 미국 국립보건원의 논문 데이터베이스, 질병통제예방센터 같은 공공기관과 대형 의료정보 사이트였다. 그러나 1위 출처와 그 비중은 모델마다 달랐고, 한두 번만 인용된 도메인도 많았다.

기관 편중이라는 말도 한 방향으로만 읽을 수는 없다. 의료 질문만 따로 떼어 보면 공공기관 비중이 높았지만, 구글의 AI 표면은 일반 검색보다 정부·교육기관 사이트를 덜 가져온다는 연구도 함께 나왔다. 아래에서 논문별 결과를 차례로 정리했다.

모델 7종, 1위 출처가 달랐다

Wu 외(2025)는 Nature Communications에 실린 논문에서 7개 모델에 의료 질문 800개를 던지고, 답변에 달린 출처가 문장을 뒷받침하는지 자동 평가 틀(SourceCheckup)로 검사했다. 질문 절반은 환자 커뮤니티 레딧 r/AskDocs에 실제로 올라온 글에서, 나머지 절반은 병원 A의 건강정보 페이지를 바탕으로 만들었다. 웹 검색을 쓴 모델은 GPT-4o와 Gemini Ultra 1.0 두 가지였고 나머지는 검색 없이 기억에 기대 출처를 적었다.

모델 1위 도메인 2위 3위
GPT-4o(웹 검색) 병원 A 사이트(16%) ncbi.nlm.nih.gov(10%) 병원 B 사이트(9%)
Gemini Ultra 1.0(웹 검색) ncbi.nlm.nih.gov(36%) 병원 B 사이트(6%) 병원 A 사이트(5%)
GPT-4o(API) ncbi.nlm.nih.gov(20%) 병원 A 사이트(15%) cdc.gov(7%)
Claude v2.1 ncbi.nlm.nih.gov(28%) 병원 A 사이트(11%) cdc.gov(5%)
Mistral Medium 병원 A 사이트(25%) ncbi.nlm.nih.gov(18%) cdc.gov(5%)
Mixtral 8x7B ncbi.nlm.nih.gov(23%) 병원 A 사이트(21%) cdc.gov(5%)
Gemini Pro(API) 병원 A 사이트(25%) ncbi.nlm.nih.gov(14%) webmd.com(8%)

자료는 Wu 외(2025) 표 1에서 모델별 상위 세 도메인을 옮긴 것이며, 괄호 안은 그 모델이 인용한 출처 가운데 비중이다. 병원 A와 B는 미국 대형 병원이 운영하는 건강정보 사이트다.

같은 웹 검색 모델이라도 GPT-4o는 병원 A 사이트를, Gemini Ultra 1.0은 미국 국립보건원 논문 데이터베이스를 가장 많이 인용했고 1위 비중도 16%와 36%로 차이가 컸다. 4위와 5위에는 drugs.com, uptodate.com, medlineplus.gov, healthline.com 같은 의약·의료정보 사이트가 모델별로 섞여 들어왔다. 논문은 인용 URL 대부분이 건강정보 사이트나 정부 보건 사이트에서 나왔고 .org·.gov 도메인이 많았으며, 평균 92%가 미국 사이트였다고 정리했다. 미국 밖 출처 비중이 가장 높은 모델도 Gemini Ultra 1.0의 10.68%였다.

해석에는 조건이 붙는다. 질문 절반이 병원 A 페이지에서 나왔기 때문에 병원 A 비중은 부풀려졌을 수 있다. 평가한 모델도 2023–2024년에 나온 세대다. 출처가 기관 사이트라고 해서 답이 정확했다는 뜻도 아니어서, 웹 검색 GPT-4o의 응답 가운데 출처로 온전히 뒷받침된 비율은 55%였다.

AI 검색 4종의 인용은 긴 꼬리로 흩어졌다

Allaham·Diakopoulos(2026)는 2025년 3–5월 실제 이용자 질문을 모은 Search Arena 자료 등에서 정치·건강·환경 질문 712개를 골라 ChatGPT, Copilot, Gemini, Perplexity에 넣고 응답 2,848개의 인용을 분석했다. 답변당 평균 인용 수는 ChatGPT 14.68개, Copilot 8.44개, Perplexity 7.92개, Gemini 7.26개로 가장 많은 엔진과 가장 적은 엔진 사이가 약 두 배였다.

세 주제를 합친 분포는 머리가 얇고 꼬리가 길었다. 가장 많이 인용된 25개 도메인이 전체 인용의 23.8%를 차지했고, 나머지 76.2%는 수많은 도메인에 흩어졌다. 인용된 도메인의 59.1%는 한 번만, 16.5%는 두 번만 등장했다. 상위 25개 도메인 안에서는 위키백과가 단일 도메인으로 15.2%를 차지했고, 정부 사이트를 모두 합치면 33.0%, 레딧·유튜브 같은 소셜미디어는 8.8%였다.

건강 질문에서는 인용이 아예 없는 응답이 11.6%로 환경(8.2%)이나 정치(5.7%)보다 많았다. 연구진은 이를 엔진이 검색 대신 사전 학습된 지식에 기대 답하는 경우로 해석하며 답변의 시의성 문제를 제기했다. AI 텍스트 탐지 도구(Pangram)가 AI 작성으로 판정한 출처 비중도 엔진마다 달라, 건강 질문 인용에서 Copilot 7.6%, Gemini 3.6%, Perplexity 2.7%, ChatGPT 2.3%였다. 연구진은 Perplexity가 건강 질문에서 AI 작성으로 판정된 레딧 게시물에 자주 기댔다고 적었다.

구글 AI 개요와 엔진 간 비교에서 드러난 것

Hu 외(2026)는 빙 검색 기록에서 뽑은 임신·육아 질문 1,508개를 2025년 4월 미국 뉴욕 IP, 로그인하지 않은 크롬 브라우저로 구글에 검색해 AI 개요와 추천 스니펫을 감사했다. AI 개요는 질문의 84%에서 화면에 나타났다.

세 결과 영역 모두에서 건강·웰니스 분류 사이트가 가장 큰 비중을 차지했고, AI 개요와 추천 스니펫은 일반 검색 결과 링크보다 건강 관련 사이트를 통계적으로 유의하게 더 많이 인용했다. 연구진이 자주 인용된 상위 10% 도메인 144곳의 신뢰도를 직접 분류해 보니, 소셜미디어·전자상거래처럼 신뢰도가 낮은 출처가 AI 개요 인용의 17%를 차지해 일반 검색 링크(35%)보다는 낮았지만 중·저 신뢰도 출처를 합치면 AI 개요와 추천 스니펫 인용의 절반 가까이였다. 같은 화면에 함께 나온 AI 개요와 추천 스니펫의 내용이 서로 어긋난 경우가 32.3%였고, AI 개요의 89.4%에는 전문가 상담을 권하는 식의 안전 문구가 없었다.

의료에 한정하지 않은 대규모 비교에서도 엔진 사이의 출처 차이가 확인된다. Grossman 외(2026)는 질문 1만1,500개로 구글 검색, AI 개요, Gemini의 출처를 비교해 질문별 출처 겹침(자카드 유사도)이 0.11–0.18에 그쳤다고 보고했다. AI 개요와 Gemini는 일반 검색보다 인기 사이트와 정부·교육기관 사이트를 유의하게 덜 가져왔고, 구글 소유 사이트는 더 많이 가져왔다. 트랑코 순위 상위 1,000개 도메인에서 온 출처 비중은 일반 검색이 37.8%로 AI 개요보다 1.3%포인트, Gemini보다 9.9%포인트 높았다.

Kirsten 외(2025)도 구글 일반 검색과 구글·OpenAI·Perplexity의 생성형 검색 5종을 비교해, 엔진마다 내부 지식 의존도와 출처 다양성, 결과의 안정성이 크게 다르다고 정리했다. 검색 도구를 붙인 GPT-4o는 제품과 규제 조치 질문을 빼면 검색을 거의 하지 않았고, 규제 조치 질문에서는 GPT 계열 두 모델이 인기 순위가 유의하게 높은 도메인을 가져왔다고 적었다.

병원 누리집 운영자가 볼 점

논문들을 겹쳐 보면 세 가지가 읽힌다. 일반적인 질환·건강 설명 질문에서는 공공 보건기관과 대형 의료정보 사이트가 상위를 차지하는 경향이 있다. 그 비중과 1위 출처는 모델과 엔진마다 다르다. 그리고 상위권 밖으로 한두 번씩만 인용되는 도메인이 대다수다.

이를 병원 누리집에 옮기면, 기관 자료와 같은 일반 설명으로 겨루기보다 그 병원만 확인해 줄 수 있는 사실을 정확히 적는 편이 역할이 분명하다. 진료 과목과 진료 시간, 주소와 연락처, 의료진의 면허 종류와 전문의 자격처럼 공적으로 확인되는 정보다. 긴 꼬리 분포는 규모가 작은 사이트도 인용 목록에 오를 여지가 있다는 뜻으로 읽을 수 있지만, 한두 번의 인용은 실행마다 쉽게 바뀐다. 엔진별로 여러 번 확인해야 하는 이유다. 인용이 붙은 문장이 원문과 맞는지 점검하는 방법은 AI 답변 인용 정확도 기사에 정리했다.

누리집 문구는 의료법 제56조의 의료광고 규정 안에 있어야 한다. 이 조항은 인터넷을 포함한 매체로 의료기관과 의료인의 정보를 알리는 행위를 의료광고로 정의하고, 치료경험담처럼 치료 효과를 오인하게 할 우려가 있는 광고, 다른 의료기관과 비교하는 광고, 객관적 사실을 과장하는 광고 등을 금지한다. AI 답변의 출처가 되려고 다듬는 문장이라고 달리 취급한다는 규정은 없다. 조항별 점검 항목은 의료광고 규정 안에서 하는 병원 GEO 기사에서 자세히 다뤘다.

다만 이 논문들은 영어 질문과 미국 중심의 출처를 대상으로 했고, 평가한 모델 상당수는 이미 새 버전으로 바뀌었다. 한국어 의료 질문에서 국내 공공기관, 대학병원, 동네 의원 사이트가 각각 어떤 비중으로 인용되는지는 편집부가 확인한 공개 논문에서 찾지 못했다. 병원 누리집의 정보를 바로잡거나 늘렸을 때 AI 답변 인용이 늘어난다는 실험 결과도 아직 없다.

기사 정보

분류
병원마케팅 · 분석
주요 주제
작성
GEO뉴스 편집부
참고 자료
Wu 외, An automated framework for assessing how well LLMs cite relevant medical references (Nature Communications 16, 2025) 확인 2026.08.07
Allaham·Diakopoulos, Synthetic Sources?: Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources (arXiv 2605.23684) 확인 2026.08.07
Hu 외, Auditing Google's AI Overviews and Featured Snippets: A Case Study on Baby Care and Pregnancy (arXiv 2511.12920, ICWSM) 확인 2026.08.07
Grossman 외, How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews (arXiv 2604.27790, SIGIR 2026) 확인 2026.08.07
Kirsten 외, Characterizing Web Search in The Age of Generative AI (arXiv 2510.11560) 확인 2026.08.07
의료법 제56조(의료광고의 금지 등) — 국가법령정보센터 확인 2026.08.07