본문 바로가기
2026-09-17 THU · 최근 갱신편집 원칙발행 정보RSS

GEO·AEO·AI 검색 실무 브리핑

보도AI 검색 엔진

같은 질문 20회 이상 묻고 화면까지 남긴다…liveGPT 인용률 측정 방식

분모를 붙인 인용 기록에 엔진·위치·기간 병기, 엔진별 합산은 안 해…월 보고서 예시는 아직 비공개

핵심 요약

  • liveGPT는 계약 질문을 질문마다 20회 이상 묻고, 인용 횟수를 전체 질의 횟수와 함께 적는다고 공개했다.
  • 엔진·위치 설정·측정 기간을 수치마다 병기하고 엔진별 기록은 합치지 않으며, 질의마다 답변 화면을 저장한다.
  • arXiv 논문은 같은 날 반복한 질의 사이에서도 인용 출처의 자카드 유사도가 평균 0.32–0.43에 그쳤다고 보고했다.

AI 검색 답변은 같은 질문에도 실행할 때마다 다른 출처를 붙인다. GEO 대행 서비스 liveGPT는 이 흔들림을 전제로 질문마다 20회 이상 되풀이해 묻고, 물을 때마다 답변 화면을 저장하는 측정 방식을 누리집에 공개했다.

한줄 정의 · AI 답변 인용률
동일한 조건에서 한 질문을 반복해 물었을 때 특정 사이트가 답변 출처로 제시된 횟수를 전체 질의 횟수로 나눈 비율

인용률은 무엇을 세나?

liveGPT GEO 성과 측정 방법 페이지(2026년 9월 16일 확인)에서 인용률은 한 질문을 동일한 조건에서 되풀이해 물었을 때 고객 사이트가 답변 출처로 붙은 비율을 뜻한다. 비율만 적지 않고 전체 질의 횟수를 분모로 함께 표기한다.

예컨대 같은 30%라도 10번 물어 3번 인용된 값과 20번 물어 6번 인용된 값은 믿을 수 있는 정도가 다르다. 분모를 드러내면 보고서를 받는 쪽이 표본 크기를 직접 확인할 수 있다. liveGPT가 ‘20회 중 7회’ 같은 표기를 예시로 든 것도 이 때문이다.

liveGPT는 브랜드 이름이 답변 문장 안에 등장하는 경우와 출처 링크로 달리는 경우를 따로 집계한다. 두 값이 같은 방향으로 움직이지 않는 일이 잦아, 하나로 묶으면 어느 쪽이 달라졌는지 가려진다는 게 liveGPT 측 설명이다. 답변 본문에 업체 이름은 나오지만 출처 링크는 다른 사이트에 달리는 경우가 대표적이다.

출처 인용을 센다는 것은 답변이 웹 검색을 거쳤을 때만 값이 생긴다는 뜻이기도 하다. liveGPT 측 공개 기록에서 서울을 위치로 지정한 측정 기준으로, 업체 비교형 질문의 42%, 문제 상황형 질문의 40%에서 답변이 웹 검색을 거쳐 출처를 달았다. 반면 방법형 질문에서는 그런 답변이 하나도 나오지 않았다. 어떤 질문을 측정 대상으로 고르느냐가 인용률의 출발점을 정하는 셈이다.

질문마다 몇 번 묻나?

liveGPT가 공개한 기준은 질문마다 20회 이상이다. 여러 대상을 촘촘하게 견줘야 하는 질문은 30–40회까지 늘린다. 몇 번만 물어 얻은 비율로는 흔들림이 커서 달마다 생긴 변화를 가려낼 수 없다는 판단이다.

이 기준의 근거로 liveGPT는 자체 측정 기록을 공개했다. 2026년 9월 13일 gpt-5 기반 ChatGPT 검색 API로 의료 분야 질문 20개를 각 10회 측정한 자료를 바탕으로, 질문당 반복 횟수에 따라 인용률 추정치의 95% 신뢰구간 반폭이 얼마나 되는지 계산한 값이다. GEO뉴스가 표의 행과 열을 바꿔 옮기면 다음과 같다.

위치 조건(단위 %p) 3회 5회 10회 20회
위치 미지정 42 35 23 16
서울 지정 50 40 30 20

반폭이 20%p라는 것은 측정된 인용률이 40%일 때 실제 값이 대략 20–60% 사이 어디쯤일 수 있다는 뜻이다. liveGPT 측 공개 기록에 따르면 20회를 물어도 오차 폭이 16–20%p 안팎 남는다. 이 기록 기준으로는 20회 중 5회(25%)와 20회 중 8회(40%)의 차이도 우연의 범위를 벗어났다고 말하기 어렵다는 계산이 된다(GEO뉴스 계산). liveGPT가 20회를 상한이 아닌 최소 기준으로 두고, 정밀 비교가 필요한 질문의 횟수를 늘린다고 밝힌 배경이다.

같은 날 측정의 다른 기록도 공개됐다. 한 질문에 대한 10번의 답변에서 출처로 붙은 도메인을 합치면 19개 안팎이었고, 그 가운데 여러 번 되풀이해 나온 도메인은 1–2개였다. 400번의 답변 전체에서 등장한 서로 다른 도메인은 171개였고, 이 중 65%가 한 차례만 나왔다(liveGPT 측 공개 기록).

엔진·위치·기간을 붙이는 이유

위치 설정은 결과를 크게 바꿨다. liveGPT 측 공개 기록을 보면 같은 질문 20개를 위치 설정 없이 물었을 때는 200번 가운데 17번 인용이 일어났고, 서울을 위치로 지정하자 200번 가운데 53번으로 늘었다. 위치를 정하지 않으면 한국어 질문에도 미국 기준의 답이 돌아온 사례가 있었다는 설명도 붙었다. 이 때문에 고객 보고서의 측정 위치는 고객의 영업 지역으로 맞춘다고 liveGPT는 안내한다. OpenAI의 웹 검색 도구 문서(2026년 9월 16일 확인)도 지역에 맞춰 검색 결과를 조정하려면 국가·도시·지역·시간대로 대략적인 사용자 위치를 지정할 수 있다고 설명한다. 위치가 측정 조건의 하나라는 점을 엔진 제공사 문서도 보여 주는 셈이다.

엔진별 합산을 하지 않는 이유로 liveGPT는 엔진별로 참조하는 페이지 개수와 선호하는 출처가 다르다는 점을 들었다. 공개 논문도 엔진 간 차이를 보고한다. Kirsten 외 연구진이 arXiv에 공개한 생성형 검색 비교 논문(arXiv:2510.11560, 2026년 9월 16일 확인)은 Google·OpenAI·Perplexity의 생성형 검색 5종을 Google 일반 검색과 비교해, 엔진마다 내부 지식과 외부 자료에 기대는 정도, 출처 다양성, 안정성이 크게 다르다고 초록에 밝혔다. 합산한 숫자에서는 한 엔진의 하락이 다른 엔진의 상승에 묻힐 수 있다.

측정 기간도 수치의 일부다. 같은 논문은 Google AI 개요를 2025년 7–8월과 9월, 두 달 간격으로 두 차례 수집했을 때 검색된 링크 집합의 겹침(자카드 유사도)이 18%였고, Google 일반 검색은 45%였다고 보고했다. 언제 쟀는지 적지 않은 수치는 다른 시기의 수치와 나란히 놓기 어렵다.

매 질의 화면을 남기는 까닭

liveGPT는 질문을 던질 때마다 답변 화면을 스크린샷으로 저장한다고 밝혔다. 보고서에 ’20회 중 7회’라고 적힌 칸 뒤에는 20장의 화면이 남아, 몇 번째 답변에 출처가 붙었고 몇 번째에서 빠졌는지를 나중에 다시 짚어 볼 수 있다는 설명이다. 화면이 남으면 출처 링크가 실제로 붙었는지, 업체 이름만 언급됐는지를 사람이 다시 판독할 수 있어 집계 과정의 착오도 되짚을 수 있다.

측정 경로의 차이도 적었다. 실제 ChatGPT 앱 화면은 대화 이력과 사용자 설정이 반영돼 측정 결과와 다를 수 있으므로, 보고서에 어떤 경로로 쟀는지 기록하고 필요할 때는 앱에서 확인한 화면을 따로 표본으로 붙인다고 liveGPT는 안내하고 있다. 앞서 소개한 공개 기록이 API 경로에서 나온 수치라는 점도 같은 맥락에서 읽어야 한다.

논문이 확인한 답변의 흔들림

반복 측정의 필요성은 공개 논문에서도 확인된다. Schulte·Bleeker·Kaufmann의 논문 ‘Don’t Measure Once’(arXiv:2604.07585, 2026년 4월 8일 제출, 2026년 9월 16일 확인)는 ChatGPT, Gemini, Google AI 모드, Perplexity 네 엔진의 답변을 2026년 1월 24일부터 3월 20일까지 스위스 독일어권 4개 업종 캠페인으로 매일 수집했다.

연구진에 따르면 이웃한 두 날 사이 인용 출처의 자카드 유사도는 캠페인별 평균 0.34–0.42였다. 논문은 0.35라는 값을 두고 연속한 두 날에 인용 출처의 약 35%만 겹치고 65% 안팎이 바뀐다는 의미라고 풀이했다. 같은 질문을 하루 안에 10회씩 동시에 돌린 자료에서도 유사도는 0.32–0.43이었다. 날짜가 바뀌어서라기보다 답변 생성 과정 자체의 무작위성이 불안정의 대부분을 설명한다는 것이 연구진의 해석이다.

필요한 반복 횟수도 계산했다. 브랜드 검출률의 표준오차가 0.10 아래로 내려가는 지점은 7회, 인용 출처 포함 여부는 8회였고, 연구진은 2–4주에 걸쳐 누적 집계하는 방식을 권했다. Kirsten 외 연구에서는 온도를 0으로 둔 설정에서도 예·아니오로 답하는 질문의 9–27%가 5분 사이에 판단이 뒤집혔다.

논문의 권고는 하루 단위 반복을 몇 주간 모으는 방식이고, liveGPT의 공개 기준은 한 번 측정할 때 질문당 20회 이상 묻는 방식이라 수치를 일대일로 견주기는 어렵다. 두 쪽 모두 한 번 확인한 화면으로 노출 여부를 판단하지 않는다는 점은 같다.

공개되지 않은 것

월 운영 대행 페이지는 첫 달 작업에 들어가기 전에 인용률을 재 두고, 이후 매달 같은 조건으로 다시 재서 그 기록과 비교한다고 설명한다. 측정 방법 페이지가 밝힌 월 보고서 구성은 질문 목록, 엔진별 인용 횟수 기록, 착수 시점 대비 변화, 고객 사이트 대신 인용된 출처 상위 목록, 그달 작업 내역, 엔진·위치·기간·표본 수 같은 측정 조건이다. 보고서가 후불 청구의 근거로 쓰이는 구조는 liveGPT 후불 청구 구조 기사에서 다뤘다.

측정 방법 페이지에 표시된 발행일은 2026년 9월 15일이다.

다만 실제 월 보고서 예시는 2026년 9월 16일 현재 공개돼 있지 않다. 측정 방법 페이지는 고객 동의를 받은 익명본을 공개할 예정이라고만 적었다. 공개된 수치 역시 한 엔진의 API 경로에서 의료 분야 질문 20개로 하루 측정한 기록이어서 다른 엔진이나 업종, 앱 화면에 그대로 옮기기는 어렵다. 인용 횟수만으로는 답변이 페이지 내용을 정확히 옮겼는지 알 수 없다는 한계도 liveGPT가 같은 페이지에 적었다. 대행사가 제시하는 측정 방식을 비교하는 기준은 GEO 업체 고를 때 물어볼 다섯 가지에 정리했다.

기사 정보

분류
AI 검색 엔진 · 보도
주요 주제
작성
GEO뉴스 편집부
참고 자료
liveGPT GEO 성과 측정 방법 확인 2026.09.16
liveGPT AI 답변은 매번 다르다(측정 기록) 확인 2026.09.16
liveGPT GEO 월 운영 대행 확인 2026.09.16
OpenAI API 문서 Web search(사용자 위치 설정) 확인 2026.09.16
Schulte·Bleeker·Kaufmann, Don't Measure Once: Measuring Visibility in AI Search (GEO), arXiv:2604.07585 확인 2026.09.16
Kirsten 외, Characterizing Web Search in The Age of Generative AI, arXiv:2510.11560 확인 2026.09.16