TL;DR: AI 크롤러, 더 이상 하나의 봇이 아니다
- OpenAI는 3개 봇 체제: GPTBot(학습), OAI-SearchBot(검색 색인), ChatGPT-User(실시간 조회).
- Anthropic도 3개 봇 체제: ClaudeBot(학습), Claude-User(실시간), Claude-SearchBot(검색 색인).
- Perplexity는 학습을 하지 않습니다. PerplexityBot은 검색 색인·실시간 조회용.
- 2026년 1월 기준 Googlebot 대비 ClaudeBot 1/1.70배, GPTBot 1/1.76배, PerplexityBot 1/167배 크롤량.
- robots.txt에서 학습용만 차단, 검색용·실시간용은 허용하는 세분화 전략이 현실적 정답입니다.
왜 "AI 크롤러"를 한 덩어리로 보면 안 되는가
"AI 봇 차단할까요?"라는 질문은 2024년까지는 의미가 있었습니다. 2026년에는 질문 자체가 낡았습니다. 각 회사가 목적별로 분리된 멀티봇 체계를 운영하기 때문입니다.
출처: ALM Corp - Anthropic Claude Bots robots.txt Strategy
Anthropic은 3개의 웹 크롤러를 운영합니다. ClaudeBot(모델 학습), Claude-User(실시간 조회), Claude-SearchBot(검색 색인) — 각각 독립된 user-agent와 robots.txt 제어가 가능합니다. OpenAI도 동등한 3봇 체계(GPTBot, OAI-SearchBot, ChatGPT-User)를 운영합니다.
따라서 robots.txt 전략도 "AI 봇 일괄 허용/차단"이 아닌 목적별 분리 제어가 되어야 합니다.
OpenAI — GPTBot · OAI-SearchBot · ChatGPT-User
| 봇 | 목적 | 주 동작 |
|---|---|---|
| GPTBot | 모델 학습 | 광범위 콘텐츠 수집, 학습 후 모델에 반영 |
| OAI-SearchBot | ChatGPT 검색 색인 | ChatGPT 응답에 인용될 소스 색인 |
| ChatGPT-User | 사용자 요청 실시간 조회 | 사용자 질문 시 최신 정보 취득 |
출처: No Hacks - AI User Agents Landscape 2026
GPTBot은 "얌전한" 스크레이핑 관행을 따릅니다: robots.txt 준수, 합리적 요청 속도, 다양한 웹사이트에 걸친 광범위 수집. 차단 시에도 ChatGPT-User의 실시간 조회는 별도 제어가 가능합니다.
실무 권장:
- 학습 원치 않는 조직:
User-agent: GPTBot → Disallow: / - 검색 인용은 원하는 경우:
User-agent: OAI-SearchBot → Allow: / - 사용자 질문 실시간 조회 허용:
User-agent: ChatGPT-User → Allow: /
Anthropic — ClaudeBot · Claude-User · Claude-SearchBot
| 봇 | 목적 | 주 동작 |
|---|---|---|
| ClaudeBot | 모델 학습 | 광범위 콘텐츠 수집 |
| Claude-User | Claude 사용자 요청 실시간 조회 | 사용자 세션 중 외부 페이지 조회 |
| Claude-SearchBot | Claude 검색 색인 | 검색 답변 시 인용 후보 |
robots.txt 제어가 OpenAI와 대칭 구조입니다. 한 회사를 위해 규칙을 작성하면 다른 회사에도 같은 패턴을 적용할 수 있습니다.
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
Perplexity — PerplexityBot 중심, 학습 없음
출처: Scrunch - Guide to AI User Agents
Perplexity는 OpenAI·Meta의 파운데이션 모델을 사용하고 자체 모델을 학습시키지 않는다고 명시합니다. 따라서 PerplexityBot은 주기적 검색 색인과 실시간 콘텐츠 조회 목적으로 동작합니다. robots.txt 지시를 준수한다고 공개했습니다.
주의:
출처: Human Security - AI Ecosystem Agents Scrapers Crawlers
Cloudflare는 Perplexity가 일부 사례에서 스텔스 크롤링으로 웹사이트 제한을 우회했다고 지적한 바 있습니다. robots.txt만으로는 항상 충분하지 않으며 필요 시 WAF 룰 병행이 필요합니다.
크롤 볼륨: AI 봇은 Googlebot보다 여전히 작다
출처: Momentic Marketing - Top AI Search Crawlers User Agents
2026년 1월 기준 Cloudflare 분석: Googlebot이 ClaudeBot 대비 1.70배, GPTBot 대비 1.76배, PerplexityBot 대비 167배 더 많은 고유 URL을 크롤링합니다.
시사점:
- AI 봇의 대역폭 부담은 Googlebot에 비하면 아직 작습니다
- PerplexityBot은 볼륨이 크지 않으므로 효율적 노출이 어렵지 않습니다
- 단, 볼륨이 작다는 것은 선택적 접근을 뜻합니다. 모든 페이지를 크롤하지 않습니다
2026년 robots.txt 전략 템플릿
목적별 분리 허용/차단 조합입니다.
# 학습 차단(Opt-out)
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# 검색 색인·실시간 조회 허용
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
Google-Extended는 구글 생성형 AI(Gemini·Bard) 학습용 크롤러입니다. 별도 제어가 가능합니다.
왜 "일괄 차단"이 손해인가
조직이 "저작권 보호" 명목으로 AI 봇을 일괄 차단하면 검색 인용 기회 자체가 사라집니다. 2026년 인용 경제에서 이는 다음과 같은 손실로 이어집니다.
| 손실 | 영향 |
|---|---|
| ChatGPT 답변 미인용 | ChatGPT 유입 리퍼러 0 |
| Perplexity 답변 미인용 | Perplexity 유입 리퍼러 0 |
| Claude 답변 미인용 | Claude 기반 서비스 0 |
| Google AI Overviews 미인용 | 검색 SERP 상단 노출 감소 |
권장: 학습은 차단하더라도 검색·실시간 조회는 허용이 2026년 표준입니다.
XEO 관점: 세 채널 동시 노출의 기술 전제
| 관점 | 봇 제어의 역할 |
|---|---|
| SEO | Googlebot + Google-Extended |
| GEO | GPTBot·OAI-SearchBot·ClaudeBot·Claude-SearchBot·PerplexityBot |
| AEO | 답변 엔진의 실시간 조회 봇(ChatGPT-User·Claude-User) |
XEO 통합 원칙: AI 봇을 세분화해 제어하면 한 번의 robots.txt 정비로 3채널 동시 노출을 확보할 수 있습니다. 일괄 규칙으로 관리하면 채널별 리스크가 동일하게 커집니다.
실행 체크리스트
- robots.txt에 9개 AI 봇 개별 규칙 정의(OpenAI 3 + Anthropic 3 + Perplexity + Google-Extended + CCBot 등)
- 학습용(GPTBot·ClaudeBot·Google-Extended)과 검색용·실시간을 분리 제어
- Cloudflare·AWS WAF에서 AI 봇 일괄 차단 룰 개별 해제
- 로그 분석에서 AI 봇 방문 빈도·페이지 추적
- PerplexityBot 스텔스 우회 여부 분기 점검
-
llms.txt파일 병행해 AI에게 요약·우선 페이지 힌트 제공 - 사이트맵 노출 주소 robots.txt에 명시
- robots.txt 변경 이력을 자동화(PR 리뷰 워크플로)
자주 묻는 질문 (FAQ)
Q1. 학습만 차단하고 검색 노출은 원합니다. 가능한가요?
가능합니다. GPTBot·ClaudeBot·Google-Extended만 Disallow, 나머지 검색·실시간 조회 봇은 Allow로 두면 됩니다. 이는 2026년 다수 퍼블리셔의 표준 패턴입니다.
Q2. PerplexityBot이 robots.txt를 무시한다면 어떻게 하나요?
Cloudflare·AWS WAF 룰에서 특정 User-Agent 위조·비정상 트래픽 탐지를 활성화하면 됩니다. 단, 정상 크롤링까지 차단하지 않도록 로그 기반 파인튜닝이 필요합니다.
Q3. 언론사·구독 콘텐츠는 AI 봇을 어떻게 제어해야 하나요?
유료·회원 전용 콘텐츠는 전체 Disallow가 정답입니다. 공개 콘텐츠는 GPTBot 차단 + 검색 봇 허용이 현실적입니다. 저작권 협상 중인 퍼블리셔는 모든 AI 봇을 임시 차단하는 케이스도 있습니다.
Q4. robots.txt 변경 후 언제부터 반영되나요?
크롤러마다 수 시간~수 일 소요. 즉시 반영을 원하면 disallow 대상 경로에 서버 측 X-Robots-Tag: noindex를 병행하면 됩니다.
Q5. llms.txt는 꼭 필요한가요?
현재 표준은 아니지만 GPTBot·PerplexityBot 등 주요 AI 크롤러가 참조 가능하다는 정황이 누적되고 있습니다. 작성 비용이 낮고 부작용이 없으므로 2026년 기준 권장 자산입니다. 설치와 로깅은 XEO 테크니컬 컨설팅에서 30일 내 가능합니다.
결론
AI 크롤러는 더 이상 하나의 봇이 아니라 학습·검색·실시간 조회로 분리된 멀티봇 체계입니다. 일괄 허용/차단이 아니라 목적별 세분화 제어가 2026년 표준이며, 이 설계 하나로 SEO·GEO·AEO 세 채널의 AI 노출 기회를 동시에 지킬 수 있습니다.
robots.txt·사이트맵·llms.txt를 한 번에 정비하려면 XEO 테크니컬 컨설팅에서 30일 감사를 시작하세요. 자동화가 필요하시면 theXEO를 확인하시면 됩니다.