GPTBot·ClaudeBot 등 AI 크롤러 허용·차단하기
GPTBot·ClaudeBot 같은 AI 크롤러는 robots.txt로 제어할 수 있으며, 차단하면 그 AI의 답변에 사이트가 인용되지 않습니다. 반대로 열어두면 AI 검색에 노출될 기회가 생깁니다.
AI 크롤러란 무엇인가요?
AI 회사들이 웹 콘텐츠를 수집하기 위해 보내는 자동 프로그램입니다. 용도는 크게 둘로 나뉩니다 —① 모델 학습용과 ② 실시간 검색·열람용. 이 둘을 구분해서 다루는 것이 핵심입니다.
주요 AI 크롤러는 무엇이 있나요?
GPTBot— OpenAI 모델 학습용OAI-SearchBot— ChatGPT 검색 노출용ChatGPT-User— 사용자가 요청할 때 실시간 열람ClaudeBot— Anthropic ClaudePerplexityBot— Perplexity 검색Google-Extended— 구글 Gemini 학습CCBot— Common Crawl(다수 AI의 학습 데이터 출처)Applebot-Extended— Apple Intelligence
어떻게 허용하나요?
robots.txt에 특정 봇을 차단하는 규칙이 없으면 기본적으로 허용됩니다. 명시적으로 환영 신호를 주려면 이렇게 씁니다.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ClaudeBot
User-agent: PerplexityBot
Allow: /
Sitemap: https://example.com/sitemap.xml어떻게 차단하나요?
학습에 쓰이는 것을 원치 않으면 해당 봇만 골라 막습니다.
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /허용과 차단, 무엇을 선택해야 하나요?
정답은 목적에 따라 다릅니다. AI 검색 노출이 목표라면 최소한 검색용 봇(OAI-SearchBot·PerplexityBot 등)은 열어두세요. 저작권·콘텐츠 보호가 우선이라면 학습용(GPTBot·CCBot·Google-Extended)을 막되 검색용은 허용하는 절충도 가능합니다.
User-agent: * / Disallow: /로 모든 크롤러를 통째로 막아버리는 것입니다. 의도치 않게 전체 차단이 걸려 있지 않은지 반드시 확인하세요.봇에게 사이트의 핵심 문서를 안내하고 싶다면 llms.txt 가이드를 함께 보세요.
자주 묻는 질문
AI 크롤러를 차단하면 어떻게 되나요?
해당 AI의 학습·검색에서 사이트가 제외됩니다. 저작권·서버 부하를 이유로 차단하기도 하지만, AI 검색 노출을 원한다면 최소한 검색용 봇은 허용하는 것이 유리합니다.
학습용 봇과 검색용 봇은 다른가요?
네. 예를 들어 GPTBot은 학습용, OAI-SearchBot과 ChatGPT-User는 ChatGPT의 실시간 검색·열람용입니다. 학습은 막되 검색 노출은 허용하는 식으로 선택적으로 설정할 수 있습니다.
robots.txt로 막으면 확실히 차단되나요?
robots.txt는 강제가 아니라 규칙 준수 요청입니다. OpenAI·Anthropic·Google 등 주요 업체는 이를 존중한다고 밝혔지만 모든 봇이 지키는 것은 아닙니다. 확실한 차단은 서버·방화벽 수준에서 해야 합니다.