네이버 블로그, ChatGPT 검색 크롤러 막았다…robots.txt로 본 채널별 차이
네이버 블로그·카페는 검색용·학습용 AI 크롤러를 모두 금지했고, 브런치는 학습용만 막았다
핵심 요약
- 네이버 블로그와 카페 robots.txt는 GPTBot·OAI-SearchBot·ClaudeBot·Claude-SearchBot·PerplexityBot·Google-Extended를 모두 전체 금지했다.
- 브런치는 학습용으로 분류한 크롤러만 막고 OAI-SearchBot·Claude-SearchBot·PerplexityBot에는 글 페이지 수집을 허용했다.
- robots.txt는 접근 권한 장치가 아닌 수집 요청이며, 이용자 요청으로 페이지를 여는 에이전트에는 적용되지 않을 수 있다.
외부 블로그 채널에 글을 올려 AI 검색 노출을 노린다면 플랫폼이 공개한 robots.txt부터 볼 일이다. GEO뉴스 편집부가 국내외 블로그 채널 다섯 곳의 파일을 같은 날 열어, AI 크롤러 이름별로 무엇을 허용하고 무엇을 막았는지 대조했다.
- 한줄 정의 · robots.txt
- 사이트가 크롤러 이름별로 수집을 허용하거나 막을 경로를 적어 두는 공개 텍스트 파일로, 형식은 국제 표준 RFC 9309가 정한다.
2026년 8월 24일 편집부가 각 robots.txt 원문을 확인한 결과, 네이버 블로그와 네이버 카페는 ChatGPT 검색에 쓰이는 OAI-SearchBot을 비롯해 OpenAI·Anthropic·Perplexity·구글의 AI 관련 크롤러 이름을 하나하나 적고 사이트 전체 수집을 금지하고 있었다. 브런치는 학습용 크롤러만 막고 검색용 크롤러에는 글 페이지를 열어 두었고, 티스토리와 블로거는 AI 크롤러를 따로 지목하지 않았다.
비교 대상은 blog.naver.com, cafe.naver.com, brunch.co.kr, 티스토리 블로그 notice.tistory.com, 블로거 블로그 computationalcomplexity.blogspot.com의 파일이다. 티스토리와 블로거는 블로그마다 주소가 달라 robots.txt도 블로그 주소별로 붙기 때문에 개별 블로그의 파일을 열었다. 살펴본 크롤러는 GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended 7종이다.
네이버 블로그 robots.txt는 어떤 AI 크롤러를 막았나?
GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended 6종이다. 파일은 각 이름 아래 Disallow: / 한 줄을 두어 사이트 전체를 수집 금지로 묶었고, 이름이 없는 ChatGPT-User는 모든 크롤러에 적용되는 기본 규칙을 따른다.
파일 첫머리에는 AI 학습용 수집과 RAG(검색 증강 생성)용 수집을 모두 엄격히 금한다는 영문 주석이 달려 있다. 같은 형태의 전체 금지 줄은 meta-externalagent, Applebot-Extended, CCBot에도 붙었다. 모바일 주소인 m.blog.naver.com의 파일도 AI 크롤러에 관한 줄은 PC 주소와 같았다.
기본 규칙인 User-agent: * 그룹은 글 목록, 인쇄, 미리보기, 이웃 목록 같은 부가 경로만 막는다. 개별 글 주소는 금지 목록에 없으므로 이름이 따로 적히지 않은 크롤러에는 글 페이지 수집 금지가 걸리지 않는다. 이번에 살펴본 7종 가운데 이 경우에 해당하는 것은 ChatGPT-User 하나다.
네이버 카페는 방식이 달랐다. 파일 맨 위 User-agent: * 그룹에서 모든 크롤러에 전체 금지를 건 뒤, Googlebot·Bingbot 같은 검색 로봇과 AI 크롤러 이름을 하나씩 다시 적어 같은 금지를 되풀이했다. 허용으로 적힌 이름은 facebookexternalhit와 facebookcatalog 두 가지뿐이었다. 이름이 없는 ChatGPT-User도 기본 규칙에 따라 전체 금지를 받는다. m.cafe.naver.com의 파일 내용도 같았다.
다섯 개 채널의 AI 크롤러 규칙 비교
| 크롤러 | 네이버 블로그 | 네이버 카페 | 브런치 | 티스토리 | 블로거 |
|---|---|---|---|---|---|
| GPTBot | 금지 | 금지 | 금지 | 기본(허용) | 기본(허용) |
| OAI-SearchBot | 금지 | 금지 | 허용 | 기본(허용) | 기본(허용) |
| ChatGPT-User | 기본(허용) | 기본(금지) | 허용 | 기본(허용) | 기본(허용) |
| ClaudeBot | 금지 | 금지 | 금지 | 기본(허용) | 기본(허용) |
| Claude-SearchBot | 금지 | 금지 | 허용 | 기본(허용) | 기본(허용) |
| PerplexityBot | 금지 | 금지 | 허용 | 기본(허용) | 기본(허용) |
| Google-Extended | 금지 | 금지 | 금지 | 기본(허용) | 기본(허용) |
표에서 금지는 그 이름 아래 Disallow: /가 있다는 뜻이다. 허용은 이름이 명시돼 있고 글쓰기·검색·관리 같은 일부 경로만 막았다는 뜻이며, 기본은 이름이 없어 User-agent: * 규칙을 따른다는 뜻이다. 괄호 안은 그 기본 규칙이 개별 글 주소를 막는지를 적었다. 채널 순서는 우열과 관계없다.
브런치 파일에는 2026년 4월 22일에 갱신했다는 주석이 있고, 크롤러를 세 묶음으로 나눠 적었다. 주석에서 AI 학습용으로 분류한 16개 이름(GPTBot, ClaudeBot, Google-Extended, CCBot 등)은 전체 금지다. 우선 크롤러로 분류한 Googlebot·Yeti·Daumoa 묶음과, bingbot·OAI-SearchBot·ChatGPT-User·Claude-SearchBot·Claude-User·PerplexityBot을 묶은 기타 검색엔진·AI 검색 도우미 묶음은 글쓰기(/write), 검색(/search), 관리(/admin) 같은 경로만 막았다. 두 묶음의 차이는 수집 간격(Crawl-delay)을 1초로 두느냐 2초로 두느냐 정도다.
티스토리 블로그 파일은 방명록·관리·검색 경로를 막는 User-agent: * 규칙과 bingbot 수집 간격 20초 설정이 전부였다. 편집부가 함께 연 다른 티스토리 블로그 두 곳의 파일도 내용이 똑같았고, www.tistory.com 주소에는 robots.txt가 없었다. 블로거 블로그 파일은 Mediapartners-Google 그룹에 금지 경로를 두지 않았고, 나머지 크롤러에는 /search 등 두 경로만 막은 뒤 Allow: /를 적었다.
이름마다 맡은 일이 다르다
같은 회사 크롤러라도 용도가 갈린다. OpenAI 크롤러 문서는 GPTBot을 기반 모델 학습 자료를 모으는 크롤러로, OAI-SearchBot을 ChatGPT 검색 기능에 웹사이트를 띄우는 용도로 구분한다. Anthropic 도움말도 학습 데이터 수집용 ClaudeBot과 검색 결과 품질을 위한 Claude-SearchBot을 나눴고, Perplexity 문서는 PerplexityBot이 검색 결과에 사이트를 띄우고 링크하는 용도이며 기반 모델 학습용 수집에는 쓰이지 않는다고 적었다.
이 구분에 비춰 보면 네이버 블로그와 카페는 학습용과 검색용을 가리지 않고 막았고, 브런치는 학습용만 골라 막은 셈이다. 이름별 용도는 AI 크롤러 이름별 역할 기사에 표로 정리돼 있다.
Google-Extended는 해석에 주의가 필요하다. 구글 일반 크롤러 문서는 이 이름이 별도 요청 문자열 없이, 구글이 수집한 콘텐츠를 Gemini 모델 학습과 그라운딩에 쓸지를 정하는 용도이며 구글 검색 포함 여부와 순위에는 영향을 주지 않는다고 설명한다. 반면 Grossman 외(2026)가 1만1,500개 질문으로 구글 검색·AI 개요·Gemini의 출처를 비교한 연구에서는, 구글 검색과 AI 개요 양쪽에서 20개 이상 질문에 등장한 인기 매체 21곳이 Gemini 답변에는 한 번도 인용되지 않았고 확인해 보니 모두 Google-Extended를 막고 있었다. 연구진은 이 가운데 상당수가 AI 개요에서도 인용이 적었다고 보고했다. 이 연구는 네이버를 대상으로 하지 않았다.
금지 줄이 있으면 AI 답변에 전혀 쓰이지 않나?
그렇게 단정할 수는 없다. robots.txt는 크롤러에게 수집 범위를 요청하는 약속일 뿐 접근 자체를 차단하는 장치가 아니고, 이용자 요청으로 페이지를 여는 에이전트에는 운영사 문서상 규칙이 적용되지 않을 수도 있다.
robots.txt 형식을 정한 RFC 9309(2022년 9월)는 이 규칙이 접근 인가 수단이 아니며 보안 조치를 대신할 수 없다고 명시한다. 규칙을 지키는지는 크롤러 운영사의 방침에 달렸다. Anthropic은 자사 봇이 robots.txt 지시를 따른다고 밝혔다. OpenAI는 ChatGPT-User가 이용자가 시작한 동작이라 robots.txt 규칙이 적용되지 않을 수 있다고 적었고, Perplexity는 이용자 요청용 Perplexity-User가 대체로 robots.txt를 따르지 않는다고 적었다.
반대로 금지 줄이 없다고 인용이 보장되지도 않는다. robots.txt는 수집할 수 있느냐만 다루며, 수집한 글 가운데 무엇을 답변 출처로 고를지는 엔진이 따로 정한다. 또 이 파일은 호스트마다 적용되므로 같은 내용이 다른 사이트에 올라가 있다면 그 사이트의 규칙이 따로 적용된다.
규칙은 바뀐다. 브런치 파일의 갱신일 주석이 보여 주듯 플랫폼은 크롤러 목록을 고쳐 쓸 수 있고, OpenAI 문서는 robots.txt 변경이 검색 결과에 반영되기까지 24시간가량 걸릴 수 있다고 안내한다. 이 기사의 표는 2026년 8월 24일 기준이다.
블로그 채널을 고를 때 확인할 것
AI 검색 노출을 염두에 두고 외부 채널을 쓰는 병원·법률사무소 운영자라면 다음 순서로 점검할 수 있다.
- 채널 주소 뒤에 /robots.txt를 붙여 원문을 직접 연다. 티스토리·블로거처럼 블로그마다 주소가 다른 채널은 자기 블로그 주소로 연다.
- 확인하려는 크롤러 이름이 있는지 찾고, 없으면
User-agent: *그룹의 금지 경로가 글 주소를 포함하는지 본다. - 검색용(OAI-SearchBot, Claude-SearchBot, PerplexityBot)과 학습용(GPTBot, ClaudeBot, Google-Extended)을 나눠 판단한다.
- 확인한 날짜와 원문을 기록해 두고 주기적으로 다시 연다.
- 자기 누리집도 robots.txt와 서버·CDN 설정에서 같은 크롤러를 막고 있지 않은지 함께 본다. 실제 차단 여부를 확인하는 방법은 AI 크롤러 차단 확인 기사에서 다뤘다.
robots.txt 외에 AI 전용 파일을 두는 방식의 근거는 llms.txt 근거 점검 기사에서 따로 짚었다.
다만 robots.txt 비교만으로 채널의 쓸모를 가를 수는 없다. 네이버 블로그 글은 네이버 검색 안에서 이용자와 만나는 통로이고, 허용 줄이 있는 채널이라고 해서 해당 AI 검색이 그 글을 실제로 인용한다는 근거가 생기지도 않는다. 이 기사는 크롤러 규칙만 대조했으며 각 엔진이 채널별 글을 얼마나 인용하는지는 측정하지 않았다.
기사 정보
- 분류
- AI 검색 엔진 · 분석
- 주요 주제
- 작성
- GEO뉴스 편집부
- 참고 자료
- 네이버 블로그 robots.txt (blog.naver.com) 확인 2026.08.24
- 네이버 블로그 모바일 robots.txt (m.blog.naver.com) 확인 2026.08.24
- 네이버 카페 robots.txt (cafe.naver.com) 확인 2026.08.24
- 네이버 카페 모바일 robots.txt (m.cafe.naver.com) 확인 2026.08.24
- 브런치 robots.txt (brunch.co.kr) 확인 2026.08.24
- 티스토리 블로그 robots.txt (notice.tistory.com) 확인 2026.08.24
- 블로거 블로그 robots.txt (computationalcomplexity.blogspot.com) 확인 2026.08.24
- OpenAI 크롤러 문서(Overview of OpenAI Crawlers) 확인 2026.08.24
- Anthropic 도움말: Does Anthropic crawl data from the web, and how can site owners block the crawler? 확인 2026.08.24
- Perplexity 크롤러 문서(Perplexity Crawlers) 확인 2026.08.24
- Google 일반 크롤러 문서(Google's common crawlers) 확인 2026.08.24
- RFC 9309 Robots Exclusion Protocol 확인 2026.08.24
- Grossman 외, How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews (arXiv 2604.27790, SIGIR 2026) 확인 2026.08.24