AI 크롤러란 무엇인가

AI 크롤러는 OpenAI, Anthropic, Perplexity 같은 AI 기업이 모델 학습이나 AI 검색 답변 생성에 쓸 웹 콘텐츠를 자동으로 수집하는 프로그램이다. GPTBot, ClaudeBot, PerplexityBot이 대표적이고, 사이트 소유자는 robots.txt로 봇별 접근을 제어한다.

규모는 빠르게 커지고 있다. 클라우드플레어 집계에서 OpenAI의 GPTBot은 2024년 5월부터 1년 사이 요청량이 305% 늘며 전체 크롤러 점유율 3위에 올랐고, 검색과 AI 크롤러를 합친 트래픽은 같은 기간 18% 증가했다 (Cloudflare, From Googlebot to GPTBot).

AI 크롤러는 검색엔진 크롤러와 무엇이 다른가?

목적이 다르다. 검색엔진 크롤러는 검색 색인을 만들려고 페이지를 수집하고, 그 대가로 검색 결과에서 방문자를 돌려보낸다. AI 크롤러의 다수는 색인이 아니라 모델 학습을 위해 수집한다.

클라우드플레어가 2025년 7월 한 달간 AI 봇 트래픽을 목적별로 분류한 결과, 학습 목적이 전체의 약 80%를 차지했다 (Cloudflare, A deeper look at AI crawlers).

학습용으로 수집된 콘텐츠는 모델 안에 녹아들 뿐 사이트로 방문자를 되돌려보내지 않는다. 이 비대칭이 크롤링 자체와 AI 크롤러 논쟁을 가르는 지점이고, 언론사와 대형 사이트가 차단에 나서는 이유다.

다만 AI 크롤러 전부가 학습용은 아니다. AI 검색에 쓰이는 검색용과 사용자 요청용 봇은 답변에 출처 링크를 남겨 AI 트래픽을 만든다.

AI 크롤러는 용도별로 어떻게 나뉘는가?

세 가지다. 주요 AI 기업은 학습용, 검색용, 사용자 요청용 봇을 분리해 운영하고, 각각을 robots.txt에서 따로 허용하거나 차단할 수 있다.

용도하는 일
학습용모델 학습에 쓸 콘텐츠 수집GPTBot, ClaudeBot
검색용AI 검색 결과에 사이트를 노출하기 위한 색인OAI-SearchBot, PerplexityBot, Claude-SearchBot
사용자 요청용사용자가 질문한 순간 해당 페이지를 실시간으로 열람ChatGPT-User, Perplexity-User, Claude-User

OpenAI는 세 설정이 서로 독립이라고 명시한다. OAI-SearchBot만 허용하고 GPTBot을 차단하면, 검색 결과에는 나오면서 학습에는 쓰이지 않는다 (OpenAI, Overview of OpenAI Crawlers).

Anthropic도 같은 구조다. ClaudeBot 차단은 이후 콘텐츠를 학습 데이터에서 제외하라는 신호이고, Claude-SearchBot과 Claude-User를 막으면 검색 노출이 줄 수 있다고 안내한다 (Anthropic, 웹 크롤링 안내).

주요 AI 크롤러에는 어떤 것이 있는가?

운영사용도
GPTBotOpenAI모델 학습
OAI-SearchBotOpenAIChatGPT 검색 노출
ChatGPT-UserOpenAI사용자 요청 시 페이지 열람
ClaudeBotAnthropic모델 학습
Claude-SearchBot, Claude-UserAnthropic검색 품질, 사용자 요청
PerplexityBotPerplexity검색 노출 (학습에 쓰지 않음)
Perplexity-UserPerplexity사용자 요청 시 페이지 열람
Google-ExtendedGoogleGemini 학습과 그라운딩 제어 토큰
Meta-ExternalAgentMeta모델 학습
BytespiderByteDance모델 학습
CCBotCommon Crawl공개 데이터셋 구축 (여러 모델이 학습에 사용)

세력 판도는 1년 만에 뒤집혔다. 클라우드플레어의 AI 크롤러 점유율 집계에서 2024년 5월 1위였던 Bytespider(42%)는 7%대로 추락했고, 5%였던 GPTBot이 30%로 올라 1위가 됐다. Meta-ExternalAgent는 19%로 새로 진입했다 (Cloudflare, From Googlebot to GPTBot).

Google-Extended는 성격이 다르다. 별도의 크롤러가 아니라 robots.txt 제어 토큰이며, 차단해도 구글 검색 포함 여부와 순위에는 영향이 없다고 구글이 명시한다 (Google 검색 센터, Google 일반 크롤러).

robots.txt로 AI 크롤러를 어떻게 제어하는가?

사이트 루트의 robots.txt에 봇 이름별로 허용과 차단을 선언한다. 학습은 거부하고 AI 검색 노출은 유지하는 전형적인 설정은 이렇다.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

반영에는 시간이 걸린다. OpenAI와 Perplexity 모두 robots.txt 변경이 시스템에 반영되기까지 24시간 정도 걸릴 수 있다고 안내한다 (Perplexity, Perplexity Crawlers).

한계도 알아야 한다. robots.txt는 강제력이 없는 약속이라 무시하는 봇을 막지는 못한다. Perplexity-User처럼 사용자가 직접 요청한 열람은 robots.txt를 대체로 따르지 않는다고 Perplexity 스스로 밝히고 있어, 완전 차단이 필요하면 WAF나 봇 관리 도구를 병행해야 한다.

AI 에이전트에게 사이트 구조를 요약해 주는 LLMs.txt는 접근 제어가 아니라 안내 파일이라는 점에서 robots.txt와 역할이 다르다.

AI 크롤러를 차단해야 하는가, 허용해야 하는가?

콘텐츠로 무엇을 얻으려는지에 달렸다. 실제로 사이트들의 선택도 갈린다. 클라우드플레어가 2025년 6월 상위 도메인의 robots.txt를 조사한 결과 약 14%가 AI 봇을 지목한 지시문을 갖고 있었고, GPTBot은 가장 많이 차단된 동시에 가장 많이 명시적으로 허용된 봇이었다 (Cloudflare, From Googlebot to GPTBot).

판단 기준은 봇의 용도다.

  • 검색용과 사용자 요청용 봇을 차단하면 AI 검색 노출을 잃는다. OpenAI는 OAI-SearchBot을 차단한 사이트는 ChatGPT 검색 답변에 표시되지 않는다고 명시한다.
  • 학습용 봇 차단은 AI 검색 노출과 별개다. GPTBot을 막아도 OAI-SearchBot을 허용하면 검색에는 나온다.
  • 콘텐츠 유료화나 저작권 보호가 우선인 언론사, 콘텐츠 판매 사이트는 학습용 봇 차단이 자연스럽다.

AI 검색에서 인용되는 것을 목표로 하는 GEO 관점에서는 검색용과 사용자 요청용 봇 허용이 전제 조건이다. 크롤러가 읽지 못하는 콘텐츠는 AI 검색 답변의 인용 후보에서 아예 빠지기 때문이다.

참고 자료

우리 브랜드는 AI 답변에 나오고 있을까?

서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.

GEO 최적화 서비스 보기