GPTBot 막으면 ChatGPT 검색에서도 빠질까…AI 크롤러 이름별 역할
OpenAI·Anthropic·Perplexity·Google 공식 문서로 본 학습용·검색용·이용자 요청용 이름과 robots.txt 적용 범위
핵심 요약
- OpenAI 문서상 GPTBot은 생성형 AI 기반 모델 학습용이고 ChatGPT 검색 노출은 OAI-SearchBot이 맡으며, 두 설정은 서로 독립적이다.
- ChatGPT-User와 Perplexity-User처럼 이용자 요청으로 움직이는 이름은 robots.txt가 적용되지 않을 수 있다고 각 문서에 적혀 있다.
- Google-Extended는 별도 요청 user agent가 없는 robots.txt 토큰이며 Google 검색 포함 여부와 순위 신호에 영향을 주지 않는다.
AI 회사들은 크롤러를 이름 하나로 운영하지 않는다. 모델 학습용 수집, 자사 검색 색인, 이용자 질문에 따른 페이지 열람을 서로 다른 이름에 맡기고, robots.txt를 따르는 방식도 이름마다 따로 적어 두었다.
- 한줄 정의 · AI 크롤러 이름(user agent 토큰)
- AI 회사가 HTTP 요청과 robots.txt 그룹에서 자사 봇을 구별하려고 붙인 이름으로, 학습·검색·이용자 요청 같은 용도별로 나뉜다.
robots.txt에 GPTBot을 막는 한 줄을 넣기 전에 운영자가 먼저 따져야 할 것은 그 이름이 어떤 일을 하는 봇인가다. OpenAI·Anthropic·Perplexity·Google은 모두 사이트 운영자용 크롤러 안내 문서를 공개하고 있다. GEO뉴스가 2026년 9월 3일 네 회사 문서를 열어 대조한 결과, 학습용 수집과 검색 노출, 이용자 요청에 따른 열람은 대부분 서로 다른 이름으로 구분돼 있었고 robots.txt를 대하는 방식도 이름마다 달랐다.
GPTBot을 막으면 ChatGPT 검색 답변에서도 빠지나?
OpenAI 문서 기준으로는 빠지지 않는다. GPTBot은 생성형 AI 기반 모델 학습에 쓰일 수 있는 콘텐츠를 모으는 이름이고, ChatGPT 검색 기능의 결과 노출은 OAI-SearchBot이 따로 맡는다. 문서는 두 이름의 설정이 서로 독립적이라고 밝힌다.
OpenAI 크롤러 문서(2026년 9월 3일 확인)는 OAI-SearchBot, OAI-AdsBot, GPTBot, ChatGPT-User 네 가지 user agent를 표 하나로 안내한다. 문서 첫머리는 웹마스터가 OAI-SearchBot과 GPTBot의 robots.txt 태그로 사이트 콘텐츠의 활용 방식을 관리할 수 있다고 설명한다. 예시로 든 조합은 검색 결과에 나오도록 OAI-SearchBot은 허용하고, 수집한 콘텐츠가 학습에 쓰이지 않도록 GPTBot은 막는 방식이다.
OAI-SearchBot을 막은 사이트는 ChatGPT 검색 답변에 표시되지 않는다는 것이 문서 설명이다. 이 경우에도 내비게이션 링크로는 나타날 수 있다는 단서가 붙어 있다. 검색 쪽 시스템이 robots.txt 변경을 반영하는 데는 약 24시간이 걸릴 수 있다고 적혀 있고, 두 봇을 모두 허용한 사이트라면 중복 수집을 피하려고 한 번의 크롤링 결과를 두 용도에 함께 쓸 수 있다는 문장도 있다.
ChatGPT-User는 성격이 다르다. 이용자가 ChatGPT나 커스텀 GPT에 질문했을 때 웹페이지를 방문하는 데 쓰는 이름으로, 문서는 이 이름을 자동 크롤링에 쓰지 않으며 이용자가 시작한 동작이어서 robots.txt 규칙이 적용되지 않을 수 있다고 설명한다. 검색 노출 여부를 판단하는 데에도 쓰지 않으므로 검색 제외와 자동 크롤링은 OAI-SearchBot 설정으로 관리하도록 안내한다. 네 번째 이름인 OAI-AdsBot은 ChatGPT 광고로 제출된 랜딩 페이지가 정책에 맞는지 확인하는 용도이며, 문서는 이 봇이 광고로 제출된 페이지만 방문하고 수집 데이터를 기반 모델 학습에 쓰지 않는다고 적었다.
네 회사 문서로 본 이름별 용도
이 기사에서 다룬 이름은 모두 11개다. OpenAI 4개, Anthropic 3개는 각 사 문서에 실린 이름 전부이고, Perplexity 2개도 문서 목록 그대로다. Google은 특수 목적 크롤러와 이용자 요청형 fetcher까지 따로 문서화하고 있어, 표에는 검색 노출과 AI 학습에 직접 관련된 Googlebot과 Google-Extended 두 이름만 넣었다. 표의 순서는 우열과 관계없다.
| 회사 | 이름 | 문서상 용도 | robots.txt(문서 기준) |
|---|---|---|---|
| OpenAI | GPTBot |
생성형 AI 기반 모델 학습에 쓰일 수 있는 콘텐츠 수집 | 적용. 차단은 학습 제외 의사 표시 |
| OpenAI | OAI-SearchBot |
ChatGPT 검색 기능의 결과 노출 | 적용. 반영까지 약 24시간 |
| OpenAI | ChatGPT-User |
이용자 질문·GPT 동작 중 페이지 방문 | 이용자 요청이라 적용되지 않을 수 있음 |
| OpenAI | OAI-AdsBot |
광고 랜딩 페이지의 정책 준수 확인 | 해당 항목에 robots.txt 언급 없음 |
| Anthropic | ClaudeBot |
모델 학습에 쓰일 수 있는 웹 콘텐츠 수집 | 준수한다고 명시 |
| Anthropic | Claude-SearchBot |
검색 응답 품질 개선을 위한 콘텐츠 분석 | 준수한다고 명시 |
| Anthropic | Claude-User |
이용자가 Claude에 질문할 때 사이트 접근 | 준수한다고 명시, 이용자 요청 예외 언급 없음 |
| Perplexity | PerplexityBot |
Perplexity 검색 결과 노출과 링크. 기반 모델 학습용 아님 | robots.txt 태그로 관리. 반영까지 최대 24시간 |
| Perplexity | Perplexity-User |
이용자 질문에 답하려고 페이지 방문 | 대체로 무시 |
Googlebot |
Google 검색(Discover와 모든 검색 기능 포함)과 이미지·뉴스 등 | 일반 크롤러로서 자동 크롤링 시 준수 | |
Google-Extended |
Gemini 모델 학습·그라운딩 활용 여부 제어. 별도 요청 user agent 없음 | robots.txt 토큰으로만 작동 |
Anthropic과 Perplexity도 학습용과 검색용을 나눴다
Anthropic 도움말 문서(2026년 9월 3일 확인)는 공개 웹 데이터를 모으는 목적을 모델 개발, 웹 검색, 이용자 지시에 따른 콘텐츠 조회로 나누고 각각 이름을 붙였다. 사이트가 ClaudeBot 접근을 제한하면 그 사이트의 이후 자료를 모델 학습 데이터셋에서 제외하라는 신호로 본다는 설명이다.
검색용 이름 두 개에는 차단했을 때 생기는 결과도 적혀 있다. 문서에 따르면 Claude-SearchBot을 막으면 검색 최적화를 위한 색인이 이뤄지지 않아 검색 결과에서 사이트가 덜 보이거나 덜 정확하게 다뤄질 수 있다. Claude-User를 막으면 이용자 질문에 맞춰 콘텐츠를 가져오지 못해 이용자 주도 웹 검색에서 노출이 줄어들 수 있다.
Anthropic이 안내하는 제외 방법은 robots.txt다. 문서는 제외하려는 하위 도메인마다 robots.txt를 따로 수정해야 하고, 표준이 아닌 Crawl-delay 확장도 지원한다고 밝혔다. IP 주소 차단은 권하지 않았다. 봇이 robots.txt를 읽지 못하게 돼 수집 제외가 제대로, 또 지속적으로 보장되지 않을 수 있다는 이유다.
Perplexity 크롤러 문서(2026년 9월 3일 확인)는 이름 두 개를 안내한다. PerplexityBot은 Perplexity 검색 결과에 웹사이트를 띄우고 링크하는 용도이며 AI 기반 모델 학습을 위한 수집에는 쓰지 않는다고 적혀 있다. Perplexity-User는 이용자가 질문했을 때 답을 찾으려고 페이지를 방문하는 이름으로, 이용자가 요청한 조회이므로 대체로 robots.txt 규칙을 무시한다고 문서에 명시돼 있다. 설정 변경이 시스템에 반영되기까지 최대 24시간이 걸릴 수 있다는 안내도 붙어 있다.
Google-Extended를 막으면 AI 개요에서도 빠지나?
Google 문서 기준으로 Google-Extended는 AI 개요 노출을 끄는 수단이 아니다. 이 이름은 Gemini 모델 학습과 Gemini 앱 등의 그라운딩에 콘텐츠를 쓸지 정하는 robots.txt 토큰이며, 문서는 이 토큰이 Google 검색 포함 여부나 검색 순위 신호에 영향을 주지 않는다고 밝힌다.
Google 일반 크롤러 문서(2026년 7월 14일 갱신, 9월 3일 확인)에 따르면 Google-Extended에는 별도의 HTTP 요청 user agent 문자열이 없다. 크롤링은 기존 Google user agent로 이뤄지고, robots.txt의 이 토큰은 제어 용도로만 쓰인다. 서버 로그에서 Google-Extended라는 이름이 찍힌 요청을 찾을 수 없는 것도 이 때문이다. 같은 문서는 Googlebot에 대한 크롤링 설정이 Discover와 모든 검색 기능을 포함한 Google 검색, 그리고 이미지·동영상·뉴스 같은 제품에 적용된다고 설명한다.
AI 개요와 AI 모드는 Google 검색 기능이다. Google AI 기능 문서(2025년 12월 10일 갱신)는 페이지가 두 기능에 보조 링크로 나오려면 색인돼 있고 스니펫과 함께 검색에 표시될 자격을 갖춰야 한다고 적었다. 검색용 크롤링 접근을 관리하는 수단으로는 Googlebot 대상 robots.txt 지시어를 들었다.
2026년 8월 31일에는 별도 스위치가 하나 더 생겼다. Search Console 도움말에 따르면 이날 전 세계 사이트에 적용된 ’Google 검색 생성형 AI 제어’로 AI 개요, AI 모드, Discover의 생성형 AI 기능에서 사이트를 뺄 수 있다. 도움말은 이 설정이 AI 학습에는 영향을 주지 않으며 학습 제한에는 Google-Extended를 쓰도록 안내한다. 보고서와 설정 화면은 서치콘솔 생성형 AI 보고서 기사에서 따로 다뤘다.
운영자가 robots.txt를 쓸 때 확인할 것
이름을 구분해 쓰면 학습용 수집과 검색 노출을 따로 조정할 수 있다. 문서 내용을 운영 순서로 옮기면 다음과 같다.
- 학습용 수집만 거부하려면
GPTBot,ClaudeBot,Google-Extended그룹에 제한을 두고, 검색 노출과 연결된OAI-SearchBot,Claude-SearchBot,PerplexityBot,Googlebot은 따로 판단한다. - 로봇 배제 프로토콜 표준인 RFC 9309는 크롤러가 자기 이름과 맞는 그룹의 규칙을 따르고, 맞는 그룹이 없을 때만
*그룹을 따르도록 정했다. 특정 이름 그룹을 만들면*그룹 규칙이 그 봇에 이어지지 않는다는 점을 확인한다. ChatGPT-User,Perplexity-User처럼 문서상 robots.txt가 적용되지 않을 수 있는 이름이 있다. RFC 9309도 robots.txt 규칙은 접근 권한 부여 수단이 아니라고 명시한다. 요청 자체를 거부하려면 서버나 CDN 단계의 설정이 따로 필요하다.- 변경 반영에는 시간이 걸린다. OpenAI 검색은 약 24시간, Perplexity는 최대 24시간, Google 생성형 AI 제어는 적용 후 1–2일이 걸리며 캐시 때문에 더 늦어지는 콘텐츠도 있다고 각 문서가 밝혔다.
- 규칙을 적은 뒤 실제 요청이 막히는지는 서버·CDN 로그와 공개 IP 목록으로 확인한다. 방법은 AI 크롤러 차단 확인 기사에 정리했다.
다만 이 표와 목록은 각 회사가 공개 문서에 적은 운영 방침을 옮긴 것이다. 실제 봇이 문서대로 움직이는지를 외부에서 검증한 자료는 이번 확인 범위에 없었다. 이름과 분류도 계속 바뀐다. OpenAI 문서에는 갱신일 표기가 없고, Cloudflare 검증된 봇 문서는 2026년 7월 1일 분류 체계를 바꾸면서 ‘AI Search’ 범주를 일반 검색과 같은 ‘Search’ 행동으로 묶었다고 적었다. robots.txt를 한 번 써 두고 끝낼 것이 아니라 각 회사 문서를 주기적으로 다시 대조할 필요가 있다.
기사 정보
- 분류
- AI 검색 엔진 · 분석
- 주요 주제
- 작성
- GEO뉴스 편집부
- 참고 자료
- OpenAI 크롤러 문서(Overview of OpenAI Crawlers) 확인 2026.09.03
- Anthropic 도움말: 웹 데이터 수집과 사이트 소유자의 크롤러 차단 방법 확인 2026.09.03
- Perplexity 크롤러 문서(Perplexity Crawlers) 확인 2026.09.03
- Google 일반 크롤러 문서(Google's common crawlers) 확인 2026.09.03
- Google Search Central: AI 기능과 웹사이트(AI features and your website) 확인 2026.09.03
- Search Console 도움말: Google 검색 생성형 AI 제어 확인 2026.09.03
- RFC 9309 Robots Exclusion Protocol 확인 2026.09.03
- Cloudflare 문서: Verified bots 확인 2026.09.03