본문 바로가기
2026-09-17 THU · 최근 갱신편집 원칙발행 정보RSS

GEO·AEO·AI 검색 실무 브리핑

분석AEO

답부터 쓰면 AI가 인용할까…answer-first, 직접 검증한 논문은 아직 없다

GEO 원 논문의 9개 기법에도, 25만2천 회 비교 실험의 18개 요인에도 답의 위치만 바꾼 조건은 없었다

핵심 요약

  • GEO 원 논문(Aggarwal 외, KDD 2024)이 시험한 9개 기법에는 답의 위치를 바꾸는 조건이 없었다.
  • 원 논문에서는 인용문·통계·출처 추가의 효과가 컸고, 질의 키워드를 반복해 넣는 방식은 기준선보다 낮았다.
  • 2026년 서베이는 질의 관련성과 컨텍스트 안 위치를 가장 재현성 높은 요인으로 꼽았고, 서식만 바꾼 편집의 효과는 작았다.

AEO 작성법으로 자주 소개되는 방식이 질문형 소제목 바로 아래에 결론부터 쓰는 answer-first다. 이 방식이 AI 답변의 인용을 늘린다는 설명에 실험 근거가 있는지, GEO뉴스 편집부가 GEO 원 논문부터 2026년 연구까지 원문을 대조했다.

한줄 정의 · answer-first
질문형 소제목이나 문단의 첫 문장에 결론을 먼저 쓰고 근거와 설명을 뒤에 붙이는 글쓰기 방식.

확인 대상은 GEO라는 이름을 처음 내건 Aggarwal 외(2024) 논문, 두 문서를 맞붙여 25만2천 회 실험한 Vishwakarma 외(2026), 기존 최적화 기법을 여러 분야에서 다시 잰 C-SEO Bench(2025), 문서 구조를 다룬 Yu 외(2026), 45편을 검토한 Martinez(2026)의 서베이다. 편집부는 2026년 8월 14일 arXiv 원문을 열어 각 연구가 무엇을 바꾸고 무엇을 쟀는지 대조했다.

answer-first를 직접 시험한 논문이 있나?

편집부가 원문을 확인한 범위에서는 찾지 못했다. 위 연구들은 인용문 추가, 가격 표기, 문단 구성, 문서 배치 순서 같은 요인을 바꿔 봤지만 페이지나 문단 안에서 답의 위치만 앞뒤로 옮겨 인용 변화를 잰 조건은 없었다.

위치라는 말이 들어간 결과는 여럿 있지만 가리키는 대상이 다르다. GEO 원 논문의 위치는 생성된 답변 안에서 출처 문장이 몇 번째로 나오는지이고, Vishwakarma 외(2026)의 위치는 모델에 입력한 두 문서 가운데 어느 쪽이 먼저 놓였는지다. Lost in the Middle 연구(Liu 외, TACL)도 여러 문서를 모델에 넣었을 때 필요한 정보가 입력의 처음이나 끝에 있을 때 성능이 대체로 가장 높고 긴 입력의 한가운데 있으면 크게 떨어진다는 결과다. 모델 입력 속 순서를 다룬 실험이지 웹페이지 문단 안의 답 배치를 다룬 실험은 아니다.

45편을 검토한 Martinez(2026) 서베이의 본문과 근거 등급표에도 페이지 안 답의 위치를 다룬 연구는 언급되지 않았다. 서베이는 원 논문의 위치 가중 지표 자체가 답변 앞부분에 사람의 주의가 더 쏠린다는 가정 위에 서 있다고 짚고, 시선 추적이나 클릭 실험으로 실제 가중치를 추정해 볼 수 있다고 제안했다.

GEO 원 논문이 실제로 잰 것

Aggarwal 외의 「GEO: Generative Engine Optimization」은 2023년 11월 arXiv에 처음 공개됐고 KDD 2024에 채택됐다. 연구진은 질문마다 구글 검색 상위 5개 문서를 가져와 GPT-3.5-turbo가 답을 쓰게 하는 생성형 엔진을 만들고, 그 가운데 한 문서만 고쳤을 때 답변 속 노출이 어떻게 달라지는지 쟀다. 질문은 9개 데이터셋에서 모은 1만 개(GEO-bench)다.

지표는 두 가지다. 위치 보정 단어 수는 답변에서 해당 출처에 연결된 문장의 분량을 세되 뒤쪽에 나올수록 가중치를 낮춘 값이고, 주관적 인상은 관련성·영향력·클릭 가능성 등 7개 항목을 GPT-3.5로 채점한 값이다. 시험한 기법은 권위적 어조, 질의 키워드 반복, 통계 추가, 출처 인용 추가, 인용문 추가, 쉬운 표현, 유창성 개선, 고유 단어, 전문 용어 9가지였다.

기법 위치 보정 단어 수 주관적 인상
수정 없음(기준선) 19.3 19.3
인용문 추가 27.2 24.7
통계 추가 25.2 23.7
유창성 개선 24.7 21.9
출처 인용 추가 24.6 21.9
권위적 어조 21.3 22.9
질의 키워드 반복 17.7 20.2

자료는 Aggarwal 외(2024) 표 1에서 일부 행을 옮긴 것이며, GEO-bench 테스트 세트 기준이다.

인용문 추가는 위치 보정 단어 수를 기준선보다 약 41% 높였고, 논문 초록이 내세운 최대 40% 개선은 이런 결과에서 나왔다. 실제 서비스인 Perplexity.ai에서 다시 시험했을 때는 인용문 추가가 위치 보정 단어 수를 22%, 통계 추가가 주관적 인상을 37% 끌어올렸고 키워드 반복은 기준선보다 10% 낮았다. 검색 순위가 낮은 문서일수록 이득이 컸다는 결과도 있다. 출처 인용 추가는 구글 검색 5위 문서의 노출을 115.1% 늘렸지만 1위 문서에서는 30.3% 줄였다.

이 설계에는 문서 안에서 답의 자리를 옮기는 조건이 없다. 9개 기법은 모두 문체를 바꾸거나 내용을 보태는 편집이고, 위치를 반영한 지표도 원문 속 위치가 아니라 생성된 답변 속 위치를 센다.

문단 구성을 바꾸면 인용이 달라졌나?

통제 실험에서는 뚜렷한 차이가 나오지 않았다. Vishwakarma 외(2026)가 25만2천 회 실험에서 빽빽한 문단과 정리된 섹션, 흩어진 정보와 한데 모은 정보를 각각 비교했지만 두 요인 모두 인용에 영향을 주지 않았다.

「What Gets Cited: Competitive GEO in AI Answer Engines」는 50개 제품군의 리뷰 글 100편으로 두 문서가 한 가지 요인만 다르도록 짝을 만들고, 6개 LLM이 첫 번째 인용 표시로 어느 문서를 고르는지 셌다. 브랜드 이름을 가리고 문서 순서를 뒤바꿔 가며 위치 효과를 따로 떼어냈다. 18개 요인 가운데 주제 관련성과 목록 위치가 가장 큰 결정 요인이었고, 가격을 명시하거나 최근 날짜를 붙인 문서도 꾸준히 유리했다. 완결성과 신뢰 단서는 이보다 작은 이득을 냈고, 18개 가운데 7개 요인은 효과가 약하거나 없었다. 두 문서만 넣은 실험이라 실제 검색 단계는 포함하지 않았다는 한계를 연구진도 적었다.

C-SEO Bench(Puerto 외, NeurIPS 2025 Datasets & Benchmarks)는 질의응답과 제품 추천 두 과제, 과제마다 세 분야에서 기존 대화형 검색 최적화 기법을 다시 쟀다. 대부분의 기법이 효과가 거의 없었고 문서 순위를 오히려 떨어뜨리는 경우도 잦았다. 대신 모델 컨텍스트 안에서 문서 순위를 끌어올리는 전통적 SEO 전략이 훨씬 효과적이었고, 같은 기법을 쓰는 참가자가 늘수록 전체 이득은 줄었다.

문서 구조를 정면으로 다룬 Yu 외(2026)는 제목 계층, 정보 덩어리 나누기, 강조 표시를 함께 손본 결과 6개 생성형 엔진에서 인용률이 45.0%에서 52.8%로 올랐다(상대 17.3%)고 보고했다. 그러나 여러 구조 요소를 한꺼번에 바꾼 실험이라 답 위치의 몫은 따로 드러나지 않는다. Martinez 서베이는 이 연구가 동료 심사 전 사전 공개 논문이고 자동 평가에 기대고 있어 신중히 읽어야 한다고 평가했다.

서베이가 매긴 근거 수준

Martinez(2026) 서베이는 원 논문의 개선 폭이 이미 컨텍스트에 들어간 문서를 전제로 한 결과이며 검색에 발견되는지나 지속적인 유입 효과까지 입증한 것은 아니라고 정리했다. 질의 관련성과 컨텍스트 안 위치가 가장 재현성 높은 요인이고, 일반적인 비법은 잘 옮겨지지 않으며, 인용을 노린 재작성이 검색 단계에서는 손해를 낼 수 있다는 것이 검토의 요지다. 서베이가 표로 매긴 근거 수준을 옮기면 다음과 같다.

요인 근거 수준 조건
질의와 문서의 관련성 통제 환경에서 강함 의도가 분명하고 내용을 지어내지 않을 때
컨텍스트 안 위치 강함 문서가 이미 검색된 경우
추출하기 쉬운 근거(수치·정의·비교) 중간–강함 사실성과 출처 표시가 함께할 때
최신성·가격·날짜 중간 시의성·상업 질의
문서 구조 중간, 연구마다 다름 단계마다 효과가 다름
유창성·쉬운 표현 약함–중간 분야와 엔진에 따라 다름
권위적 어조 약하고 불안정 신뢰도와 충돌할 수 있음
키워드 반복 없음 또는 역효과 여러 벤치마크에서 확인
서식만 변경·고정된 비법 일반화 어려움 여러 엔진 대조 실험 필요

표에 answer-first라는 항목은 없다. 문서 구조 항목에 대해 서베이는 제목, 표, 필드를 시험하되 효과의 방향을 미리 가정하지 말라고 적었다.

작성 지침으로서 answer-first의 자리

정리하면 answer-first는 인용 효과가 입증된 기법이 아니라, 읽는 사람에게 결론을 먼저 건네는 편집 원칙에 가깝다. 비용이 낮고 독자에게 해가 없으니 쓰지 말아야 할 이유는 없지만, 인용을 늘리는 수단으로 내세울 근거는 아직 부족하다.

근거가 상대적으로 두터운 쪽은 따로 있다. 질문의 주제와 핵심 용어를 제목과 본문이 정확히 담고 있는지, 가격·날짜·수치·정의처럼 떼어 옮기기 쉬운 사실이 출처와 함께 적혀 있는지, 그리고 애초에 검색 단계에서 문서가 잡히는지다. 구글은 AI 기능 안내 문서에서 AI 개요와 AI 모드에 나오기 위한 별도 기술 요건이나 특수한 최적화, 전용 구조화 데이터는 필요 없다고 밝혔다. FAQ 구조화 데이터를 둘러싼 변화는 FAQ 리치 결과 종료 기사에서, 출처 표시와 내용 일치의 문제는 AI 답변 인용 정확도 기사에서 다뤘다.

효과를 확인하고 싶다면 같은 질문을 엔진별로 여러 번 물어 기록하는 수밖에 없다. Martinez 서베이도 반복 측정, 표현을 바꾼 질문, 대조군, 사람 검증을 갖춘 측정 절차를 제안했다.

다만 근거가 없다는 말이 효과가 없다는 뜻은 아니다. 답의 위치만 따로 바꾼 실험이 없으니 효과의 방향도 크기도 확인되지 않은 상태다. 서베이가 지적했듯 대부분의 연구는 영어와 익명 계정, 적은 수의 지역에서 이뤄졌기 때문에 한국어 검색 환경에서 결과가 같을지도 따로 확인해야 한다.

기사 정보

분류
AEO · 분석
주요 주제
작성
GEO뉴스 편집부
참고 자료
Aggarwal 외, GEO: Generative Engine Optimization (arXiv 2311.09735, KDD 2024) 확인 2026.08.14
Vishwakarma 외, What Gets Cited: Competitive GEO in AI Answer Engines (arXiv 2605.25517) 확인 2026.08.14
Puerto 외, C-SEO Bench: Does Conversational SEO Work? (arXiv 2506.11097, NeurIPS 2025 Datasets & Benchmarks) 확인 2026.08.14
Yu 외, Structural Feature Engineering for Generative Engine Optimization (arXiv 2603.29979) 확인 2026.08.14
Martinez, Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026) (arXiv 2607.14035) 확인 2026.08.14
Liu 외, Lost in the Middle: How Language Models Use Long Contexts (arXiv 2307.03172, TACL) 확인 2026.08.14
Google Search Central: AI 기능과 웹사이트(AI features and your website) 확인 2026.08.14