출처는 달렸는데 내용은 다르다…AI 답변 인용의 정확도 문제
생성형 검색 답변을 문장 단위로 원문과 대조한 연구들, 인용이 문장을 온전히 뒷받침한 비율은 절반 안팎이었다
핵심 요약
- Liu 외(2023)의 사람 평가에서 4개 생성형 검색엔진의 답변 문장 중 인용으로 온전히 뒷받침된 것은 평균 51.5%였다.
- 같은 연구에서 인용의 74.5%만 연결 문장을 뒷받침했고, 유용해 보이는 답일수록 인용 정밀도가 낮았다.
- 2024년 자동 평가의 엔진별 인용 정확도는 49.0–68.3%였고, 2025년 의료 질문 평가에서는 응답의 50–90%가 출처로 온전히 뒷받침되지 않았다.
AI 검색 답변 끝에 붙은 번호와 링크는 그 문장의 근거처럼 보인다. 링크를 따라가 원문과 한 문장씩 맞춰 본 연구들은 출처가 표시되는 것과 그 출처가 문장을 실제로 뒷받침하는 것이 서로 다른 문제라는 결과를 거듭 내놓았다.
- 한줄 정의 · 인용 정밀도(citation precision)
- 답변에 붙은 인용 가운데 연결된 문장을 실제로 뒷받침하는 인용의 비율로, Liu 외(2023)가 인용 재현율과 짝지어 정의했다.
인용 정확도 연구는 대체로 같은 절차를 밟는다. 답변을 문장 단위로 나누고, 문장마다 붙은 링크의 원문을 열어 그 문장을 뒷받침하는지 사람이나 모델이 판정한다. GEO뉴스 편집부는 이런 방식으로 생성형 검색과 대형 언어모델의 인용을 평가한 논문 네 편과 관련 서베이 한 편을 2026년 8월 11일 원문으로 확인했다.
인용이 붙은 답변 문장은 얼마나 정확했나?
지표에 따라 다르지만 절반에서 4분의 3 수준에 그쳤다. Liu 외(2023)가 진행한 사람 평가에서 인용으로 온전히 뒷받침된 답변 문장은 평균 51.5%였고, 연결된 문장을 실제로 뒷받침한 인용은 74.5%였다.
「Evaluating Verifiability in Generative Search Engines」(Findings of EMNLP 2023)는 당시 서비스되던 Bing Chat, NeevaAI, perplexity.ai, YouChat 네 곳에 질문 1,450개를 넣고 답변을 사람이 검토했다. 질문은 구글 검색 이력에서 나온 자연 질문, 레딧에 올라온 설명 요청, 에세이형 질문, 토론 주제, 방법을 묻는 키워드 등 12가지 출처에서 뽑았다. 연구진은 답변이 유창하고 유익해 보이지만 뒷받침되지 않는 문장과 부정확한 인용이 잦다고 결론 내렸다. 정보를 찾는 사람이 주된 도구로 쓸 수 있는 시스템이라는 점, 겉보기에 믿음직하다는 점을 고려하면 우려할 만큼 낮은 수치라는 평가도 덧붙였다. 논문이 든 예시처럼 해당 주제에 배경지식이 적은 이용자라면 답변 속 근거 없는 문장을 스스로 가려내기 어렵다.
재현율과 정밀도는 무엇을 재나
이 연구는 인용의 질을 두 방향에서 쟀다. 인용 재현율은 답변 문장 가운데 붙은 인용으로 온전히 뒷받침되는 문장의 비율로, 근거 없는 문장이 얼마나 섞였는지를 보여 준다. 인용 정밀도는 붙은 인용 가운데 해당 문장을 실제로 뒷받침하는 인용의 비율로, 엉뚱한 링크가 얼마나 붙었는지를 보여 준다.
| 엔진(2023년 평가 당시) | 인용 재현율 | 인용 정밀도 |
|---|---|---|
| Bing Chat | 58.7% | 89.5% |
| NeevaAI | 67.6% | 72.0% |
| perplexity.ai | 68.7% | 72.7% |
| YouChat | 11.1% | 63.6% |
| 평균 | 51.5% | 74.5% |
엔진 사이 편차가 컸다. 재현율은 perplexity.ai와 YouChat 사이에 57%포인트 넘게 벌어졌다. NeevaAI는 질문의 22.7%에 답하지 않아 다른 엔진과 그대로 견주기 어렵다는 점도 논문에 적혀 있다.
눈에 띄는 결과는 정밀도와 체감 유용성의 관계다. 인용 정밀도와 사람이 매긴 유용성 점수는 강한 역상관(r = −0.96)을 보였다. 정밀도가 가장 높은 Bing Chat은 유용성 점수가 가장 낮았고, 정밀도가 가장 낮은 YouChat은 유용성 점수가 가장 높았다. 연구진은 출처 문장을 가깝게 베끼거나 바꿔 쓰는 엔진일수록 정밀도는 올라가지만 질문과 동떨어진 내용이 섞여 체감 유용성은 떨어진다는 가설을 내놓았다. 엔진별로 생성 문장과 인용 원문의 유사도(BLEU·BERTScore)와 평균 정밀도의 상관은 0.80이었다.
2024년 이후 평가에서도 비슷했다
Narayanan Venkit 외(2024)는 21명이 답변형 검색과 기존 검색을 써 보는 사용성 연구로 답변형 검색의 한계 16가지를 추리고, 이를 8개 지표로 옮겨 You.com, BingChat, Perplexity를 자동 평가했다. 토론형 168개와 전문 지식형 135개, 모두 303개 질문을 엔진마다 넣었다.
| 지표 | You.com | BingChat | Perplexity |
|---|---|---|---|
| 인용 정확도 | 68.3% | 65.8% | 49.0% |
| 근거 없는 문장 비율 | 30.8% | 23.1% | 31.6% |
| 인용 충실도 | 24.4% | 20.5% | 23.0% |
| 답변에 인용되지 않은 출처 | 1.1% | 36.2% | 8.4% |
인용 정확도는 문장에 붙은 인용 가운데 출처 내용이 실제로 그 문장을 뒷받침하는 비율이고, 인용 충실도는 붙일 수 있었던 정확한 인용 가운데 실제로 붙은 비율이다. 연구진은 세 엔진 모두 근거가 되는 출처로 문장을 받치는 데 어려움을 겪는다고 평가했다. 토론형 질문에서는 한쪽 입장만 담은 답변이 48.7–83.4%에 달했다.
의료 분야에서는 Wu 외(2025)가 Nature Communications에 SourceCheckup이라는 자동 평가 틀을 발표했다. 7개 모델, 질문 800개, 문장과 출처 쌍 5만8천 개를 검사한 결과 응답의 50–90%가 인용한 출처로 온전히 뒷받침되지 않았고, 일부는 출처와 모순되기도 했다. 웹 검색을 쓰는 GPT-4o도 개별 문장의 약 30%가 뒷받침되지 않았고, 응답 전체가 온전히 뒷받침된 비율은 55%였다. 이 비율은 환자 커뮤니티에 실제로 올라온 열린 질문에서 31.0%로, 한 대형 병원의 건강정보 페이지를 바탕으로 만든 질문(80%에 가까움)보다 크게 낮았다. 이 모델은 출처를 달라고 명시적으로 요청해도 응답의 20% 넘게 출처를 내놓지 않았다. 자동 판정이 믿을 만한지도 따로 검증했는데, 판정 모델은 미국 의사 면허를 가진 전문가들의 합의와 88.7% 일치했고 의사끼리의 평균 일치율은 86.1%였다. 판정 모델이 뒷받침되지 않는다고 분류한 GPT-4o의 문장·출처 쌍 110개를 의사들이 다시 봤을 때 105개가 실제로 어떤 출처로도 뒷받침되지 않았다. 인용된 출처의 분포는 의료 질문 AI 답변의 출처 기사에서 따로 다뤘다.
인용 수와 반영 정도는 따로 움직인다
출처로 뽑히는 것과 그 내용이 답에 실제로 쓰이는 것을 나눠 본 연구도 있다. Zhang 외(2026)는 ChatGPT, 구글 AI 개요·Gemini, Perplexity에 넣은 602개 질문에서 인용 2만1,143건과 수집에 성공한 페이지 1만8,151개를 분석했다. Perplexity와 구글은 답변당 더 많은 출처를 달았고, ChatGPT는 출처 수는 적지만 수집된 페이지 기준으로 출처 하나가 답에 미친 평균 영향이 훨씬 컸다. 영향이 큰 페이지는 대체로 길고 구조가 잡혀 있었으며 질문과 의미가 맞닿아 있고 정의·수치·비교·절차 같은 근거가 풍부했다.
이 영향 점수는 위치, 반복, 포괄 범위, 문장 유사도를 합친 복합 지표다. Martinez(2026) 서베이는 이 점수가 인과 경로를 보여 주지는 않는다고 짚으면서도, 눈에 보이는 인용이 틀릴 수 있다는 점을 가시성 측정의 필수 제약으로 꼽았다. 상용 엔진 감사 연구들에서 출처 겹침이 낮고 실행마다 결과가 크게 흔들리며 내용 충실도 격차가 계속 확인된다는 것이 서베이의 정리다.
운영자가 점검할 것
인용 횟수는 노출을, 내용 일치는 전달의 질을 보여 준다. 병원이나 법률사무소처럼 틀린 정보가 곧바로 문의와 방문으로 이어지는 업종이라면 두 기록을 나눠 둘 만하다.
- 자기 누리집 링크가 붙은 답변 문장을 모아, 그 문장이 페이지 내용과 맞는지 대조한다. 정밀도 관점의 점검이다.
- 자기 사업장을 설명하는 답변 문장 가운데 근거 링크 없이 나온 문장이 있는지 본다. 재현율 관점의 점검이다.
- 같은 질문을 엔진별로 여러 번 묻는다. 한 번의 화면은 실행마다 달라지는 답 가운데 하나일 뿐이다.
- 틀린 문장을 찾으면 그 문장이 어느 출처에서 왔는지부터 확인한다. 자기 페이지라면 표현이 모호하거나 페이지마다 값이 다르지 않은지, 다른 사이트라면 그 정보가 낡지 않았는지 본다.
- 진료 시간, 비용, 구성원 명단처럼 바뀌는 정보는 수정일을 남기고, 이전 값이 다른 페이지에 남아 있지 않은지 함께 점검한다.
기록은 질문, 엔진, 확인 날짜, 답변 문장, 붙은 링크, 대조 결과를 한 줄씩 남기는 표 하나면 충분하다. 대조 결과를 일치, 불일치, 근거 링크 없음 세 가지로만 나눠도 인용 횟수 한 줄로는 보이지 않던 변화가 달마다 드러난다. 연구들이 쓴 재현율·정밀도·충실도 지표를 그대로 계산할 필요는 없지만, 무엇을 분자와 분모로 삼았는지는 기록에 함께 적어 두는 편이 나중에 비교하기 쉽다.
Liu 외가 관찰한 대로 출처 문장을 가깝게 옮겨 쓰는 엔진은 인용이 정확해지는 경향이 있었다. 이는 엔진 단위 상관관계라 페이지 편집의 효과로 곧장 옮길 수는 없지만, 옮겨 쓰일 원문이 틀리면 정확한 인용일수록 오류도 그대로 전해진다는 점은 분명하다. 답을 먼저 쓰는 작성법의 근거 수준은 answer-first 근거 점검 기사에서 다뤘다.
다만 여기 옮긴 수치는 평가 시점의 엔진과 질문에 묶여 있다. 평가 대상은 2023–2024년 당시의 제품이나 모델이고, Liu 외와 Wu 외의 질문은 영어 자료에서 뽑았다. 지금 서비스 중인 엔진의 정확도가 얼마인지, 한국어 답변에서도 같은 경향이 나타나는지는 이 연구들만으로 말할 수 없으며, 누리집 문장을 고치면 인용 정확도가 올라간다는 실험 결과도 아직 없다.
기사 정보
- 분류
- AEO · 분석
- 주요 주제
- 작성
- GEO뉴스 편집부
- 참고 자료
- Liu 외, Evaluating Verifiability in Generative Search Engines (arXiv 2304.09848, Findings of EMNLP 2023) 확인 2026.08.11
- Narayanan Venkit 외, Search Engines in an AI Era: The False Promise of Factual and Verifiable Source-Cited Responses (arXiv 2410.22349) 확인 2026.08.11
- Wu 외, An automated framework for assessing how well LLMs cite relevant medical references (Nature Communications 16, 2025) 확인 2026.08.11
- Zhang 외, From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms (arXiv 2604.25707) 확인 2026.08.11
- Martinez, Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026) (arXiv 2607.14035) 확인 2026.08.11