GPTBot이란 무엇인가

GPTBot은 OpenAI가 운영하는 웹 크롤러로, ChatGPT 같은 생성형 AI 파운데이션 모델의 학습에 쓰일 수 있는 웹 콘텐츠를 자동으로 수집하는 프로그램이다. 사이트 소유자는 robots.txt에 GPTBot 토큰으로 접근을 허용하거나 막을 수 있다.

OpenAI는 GPTBot을 “생성형 AI 파운데이션 모델을 더 유용하고 안전하게 만들기 위해” 쓰며, “GPTBot을 차단하는 것은 그 사이트의 콘텐츠를 생성형 AI 파운데이션 모델 학습에 쓰지 말라는 뜻”이라고 설명한다 (OpenAI, Overview of OpenAI Crawlers). 2023년 8월에 공개됐고, 2026년 10월 현재 유저 에이전트 문자열은 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot이다.

AI 크롤러 가운데 가장 많이 거론되는 이름이지만, OpenAI의 봇은 GPTBot 하나가 아니다. 막을지 말지를 정하려면 먼저 나머지 둘과의 역할 차이를 알아야 한다.

GPTBot은 OAI-SearchBot, ChatGPT-User와 어떻게 다른가?

GPTBot은 학습용이고, OAI-SearchBot은 ChatGPT 검색 노출용이며, ChatGPT-User는 사용자가 요청한 페이지를 그때그때 여는 용도다. OpenAI는 “각 설정은 서로 독립적”이라며 “OAI-SearchBot은 허용해 검색 결과에 나오게 하면서 GPTBot은 차단해 학습에 쓰지 말라고 표시할 수 있다”고 안내한다 (OpenAI, Overview of OpenAI Crawlers).

봇용도robots.txt 토큰차단하면 생기는 일
GPTBot파운데이션 모델 학습용 콘텐츠 수집GPTBot학습 데이터에서 제외. ChatGPT 검색 노출과는 무관
OAI-SearchBotChatGPT 검색 기능에 사이트를 노출하기 위한 색인OAI-SearchBotChatGPT 검색 답변에 나오지 않음 (내비게이션 링크로는 나올 수 있음)
ChatGPT-User사용자가 ChatGPT나 Custom GPT에 질문했을 때 페이지 방문ChatGPT-User사용자 요청으로 시작되므로 robots.txt 규칙이 적용되지 않을 수 있음

표의 내용은 전부 OpenAI 공식 문서의 설명이다. 특히 “OAI-SearchBot을 거부한 사이트는 ChatGPT 검색 답변에 표시되지 않는다”와 “ChatGPT-User는 자동 크롤링에 쓰이지 않으며 검색 노출 여부를 정하지 않는다”는 두 문장이 실무 판단의 기준이 된다.

둘 다 허용한 사이트는 중복 크롤링을 피하려고 한 번의 크롤 결과를 두 용도에 같이 쓸 수 있다고도 적혀 있다.

이 구조는 구글의 Google-Extended와 닮았다. 구글은 Google-Extended를 “별도의 HTTP 요청 사용자 에이전트 문자열이 없는” robots.txt 전용 토큰으로 두고, 이것이 “Google 검색에 사이트가 포함될지 여부에 영향을 미치지 않으며 순위 결정 신호로 사용되지도 않는다”고 명시한다 (Google, Google의 일반 크롤러).

학습 거부와 검색 노출을 분리하는 방식이 업계 표준이 된 셈이다.

GPTBot은 얼마나 많이 크롤링하는가?

GPTBot은 1년 만에 AI 크롤러 트래픽 점유율을 두 배 넘게 키웠다. 클라우드플레어 집계로 2024년 7월 4.7%였던 GPTBot의 AI 크롤링 트래픽 점유율은 2025년 7월 11.7%가 됐고, 같은 기간 AI 봇 활동 가운데 학습 목적 크롤링의 비중은 72%에서 “거의 80%“로 올랐다 (Cloudflare, The crawl-to-click gap).

크롤링 순위도 급등했다. 2024년 5월과 2025년 5월을 비교한 다른 클라우드플레어 조사에서 GPTBot은 요청 수가 305% 늘며 전체 크롤러 순위 9위에서 3위(구글봇, 빙봇 다음)로 올라섰다 (Cloudflare, From Googlebot to GPTBot).

크롤링한 만큼 방문자를 돌려주지는 않는다. 같은 조사에서 OpenAI의 크롤 대 참조 비율은 2025년 7월 기준 1,091 대 1, 즉 사람 한 명을 사이트로 보내는 동안 HTML 페이지 1,091개를 크롤링했다. 구글의 같은 달 비율은 5.4 대 1이었다.

2026년 10월 5일 기준 클라우드플레어 레이더의 최근 7일 AI 봇 상위 5개는 구글봇 24.8%, Meta-ExternalAgent 15.3%, ClaudeBot 11.6%, Applebot 8.4%, Bingbot 6.8%로 GPTBot은 5위 안에 없었다 (Cloudflare Radar, AI Insights). 시점에 따라 순위가 크게 흔들리는 봇이다.

GPTBot을 robots.txt로 어떻게 막거나 허용하는가?

사이트 루트의 robots.txt에 User-agent: GPTBot 그룹을 만들고 Disallow 또는 Allow 규칙을 적으면 된다. 전체 차단은 두 줄이다.

User-agent: GPTBot
Disallow: /

학습은 막고 ChatGPT 검색 노출은 유지하려면 두 봇을 따로 적는다.

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

일부 경로만 열 수도 있다. Allow: /blog/와 Disallow: / 식으로 디렉터리 단위 규칙을 섞으면 된다.

반영에는 시간이 걸린다. OpenAI는 “검색 결과의 경우 사이트의 robots.txt 변경 후 시스템이 반영하는 데 약 24시간이 걸릴 수 있다”고 밝힌다 (OpenAI, Overview of OpenAI Crawlers).

규칙을 넣은 뒤에는 서버 로그에서 GPTBot/ 문자열이 들어간 요청이 줄어드는지 확인한다. OpenAI는 robots.txt 파일을 가져올 때 유저 에이전트 문자열에 robots.txt 표식을 덧붙일 수 있다고 해서, 로그에 경로가 없어도 robots.txt 요청과 일반 페이지 요청을 구분할 수 있다.

진짜 GPTBot인지 어떻게 확인하는가?

유저 에이전트 문자열은 누구나 흉내 낼 수 있으므로, 요청 IP가 OpenAI가 공개한 대역 안에 있는지로 확인한다. OpenAI는 GPTBot의 IP 대역을 https://openai.com/gptbot.json에 공개하고 있고, 서치폴라리스가 2026년 10월 5일 받은 파일은 2026년 9월 22일 생성본으로 IPv4 대역 18개가 들어 있었다 (OpenAI, gptbot.json).

확인 순서는 셋이다.

  1. 로그에서 GPTBot/1.4 같은 문자열이 들어간 요청의 IP를 뽑는다.
  2. 그 IP가 gptbot.json의 CIDR 대역 가운데 하나에 속하는지 대조한다. OAI-SearchBot과 ChatGPT-User는 각각 searchbot.json, chatgpt-user.json으로 파일이 다르다.
  3. 대역 밖 IP에서 온 GPTBot 요청은 사칭으로 보고 서버나 CDN 단에서 차단한다.

대역 파일은 갱신되므로 차단 목록에 하드코딩하지 말고 주기적으로 다시 받는 편이 안전하다. 구글봇을 역방향 DNS와 IP 목록으로 검증하는 것과 같은 원리다.

GPTBot을 막아야 하는가?

차단 여부는 콘텐츠로 돈을 버는 구조에 따라 갈리고, 한국 주요 사이트들은 이미 둘로 나뉘어 있다. 서치폴라리스가 2026년 10월 5일 국내 포털, 언론, 커머스, 채용, 블로그 플랫폼 30곳의 robots.txt를 직접 요청해 보니 24곳이 파일을 돌려줬고, 그중 10곳이 GPTBot을 전면 차단(Disallow: /)하고 있었다.

판정사이트 수사이트
전면 차단10지마켓, 조선일보, 중앙일보, 한겨레, 매일경제, 연합뉴스, 브런치, 네이버 블로그, 사람인, 잡코리아
일부 경로 차단2무신사, 현대자동차
명시적 허용1SSG닷컴
언급 없음 (기본 규칙 적용)11네이버 메인, 다음, 11번가, 동아일보, 한국경제, 나무위키, 카카오, 예스24, 교보문고, 인터파크, 야놀자, 배달의민족

언론사와 채용 플랫폼, 사용자 생성 콘텐츠 플랫폼처럼 텍스트 자체가 자산인 곳은 막고, 커머스와 포털은 대체로 열어 둔 모양새다. 네이버 메인 도메인에는 규칙이 없지만 블로그 도메인은 전면 차단이라는 점도 눈에 띈다.

글로벌 흐름도 같다. 클라우드플레어가 2025년 6월 상위 1만 개 도메인의 robots.txt를 분석했을 때 가장 많이 차단된 봇이 GPTBot으로 312개 도메인이 막았지만, 동시에 61개 도메인이 명시적으로 허용해 가장 많이 허용된 봇이기도 했다 (Cloudflare, From Googlebot to GPTBot).

2026년 9월 28일자 레이더 스냅샷을 분석한 보고서에서는 robots.txt 파일 4,242개 중 8.11%가 GPTBot을 전면 차단했고, 1년 전 7.15%에서 소폭 늘었다 (Technology Checker, robots.txt AI crawlers blocking report).

판단 기준은 세 가지로 정리된다.

  • 콘텐츠가 유료 구독이나 저작권 수익의 원천인가. 그렇다면 GPTBot 차단이 합리적이다. 학습 데이터 제공은 직접 보상이 없다.
  • AI 검색에서 인용되고 싶은가. 그렇다면 OAI-SearchBot은 열어 둬야 한다. GPTBot 차단은 ChatGPT 검색 노출에 영향이 없으므로 둘을 분리하면 된다. GEO 관점에서 가장 흔한 실수가 “AI 봇 전부 차단”으로 검색용 봇까지 막는 것이다.
  • 서버 부하가 문제인가. robots.txt 차단은 학습 수집을 막을 뿐 트래픽 폭주의 해법은 아니다. 부하는 CDN의 봇 관리나 IP 대역 기반 제한으로 다룬다.

서치폴라리스는 AI 검색 인용을 목표로 하는 사이트이므로 robots.txt에서 GPTBot, OAI-SearchBot, ChatGPT-User, Google-Extended, ClaudeBot, PerplexityBot을 모두 허용하고 있다. 어떤 봇을 열고 닫았는지는 llms.txt와 함께 AI 가시성 점검의 첫 항목이 된다.

자주 묻는 질문

GPTBot과 ChatGPT-User는 무엇이 다른가?

GPTBot은 OpenAI가 자동으로 웹을 돌며 학습 데이터를 모으는 크롤러이고, ChatGPT-User는 사용자가 ChatGPT에 링크를 붙여 넣거나 질문했을 때 그 페이지를 한 번 여는 에이전트다. OpenAI는 ChatGPT-User가 “자동 크롤링에 쓰이지 않으며” 사용자 요청으로 시작되기 때문에 “robots.txt 규칙이 적용되지 않을 수 있다”고 밝힌다 (OpenAI, Overview of OpenAI Crawlers).

그래서 GPTBot을 막아도 사용자가 직접 요청한 페이지는 ChatGPT가 읽을 수 있다.

GPTBot에 Crawl-delay를 걸 수 있나?

OpenAI의 크롤러 공식 문서에는 Crawl-delay 지시어에 대한 언급이 없다. 요청 속도를 제한하고 싶다면 robots.txt가 아니라 서버나 CDN의 속도 제한 기능에 GPTBot의 공개 IP 대역을 지정하는 방식이 확실하다.

GPTBot은 robots.txt를 무시하지 않나?

OpenAI는 GPTBot이 robots.txt 규칙을 따른다고 문서화하고 있고, IP 대역을 공개해 사칭 요청을 가려낼 수 있게 한다. 로그에 GPTBot이라고 찍혔는데 차단 경로를 계속 요청한다면 먼저 그 IP가 gptbot.json 대역 안에 있는지 확인한다. 대역 밖이면 GPTBot을 사칭한 다른 봇이다.

참고 자료

우리 브랜드는 AI 답변에 나오고 있을까?

서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.

GEO 최적화 서비스 보기