GPTBot은 OpenAI가 운영하는 웹 크롤러로, ChatGPT 같은 생성형 AI 파운데이션 모델의 학습에 쓰일 수 있는 웹 콘텐츠를 자동으로 수집하는 프로그램이다. 사이트 소유자는 robots.txt에 GPTBot 토큰으로 접근을 허용하거나 막을 수 있다.
OpenAI는 GPTBot을 “생성형 AI 파운데이션 모델을 더 유용하고 안전하게 만들기 위해” 쓰며, “GPTBot을 차단하는 것은 그 사이트의 콘텐츠를 생성형 AI 파운데이션 모델 학습에 쓰지 말라는 뜻”이라고 설명한다 (OpenAI, Overview of OpenAI Crawlers). 2023년 8월에 공개됐고, 2026년 10월 현재 유저 에이전트 문자열은 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot이다.
AI 크롤러 가운데 가장 많이 거론되는 이름이지만, OpenAI의 봇은 GPTBot 하나가 아니다. 막을지 말지를 정하려면 먼저 나머지 둘과의 역할 차이를 알아야 한다.
GPTBot은 학습용이고, OAI-SearchBot은 ChatGPT 검색 노출용이며, ChatGPT-User는 사용자가 요청한 페이지를 그때그때 여는 용도다. OpenAI는 “각 설정은 서로 독립적”이라며 “OAI-SearchBot은 허용해 검색 결과에 나오게 하면서 GPTBot은 차단해 학습에 쓰지 말라고 표시할 수 있다”고 안내한다 (OpenAI, Overview of OpenAI Crawlers).
| 봇 | 용도 | robots.txt 토큰 | 차단하면 생기는 일 |
|---|---|---|---|
| GPTBot | 파운데이션 모델 학습용 콘텐츠 수집 | GPTBot | 학습 데이터에서 제외. ChatGPT 검색 노출과는 무관 |
| OAI-SearchBot | ChatGPT 검색 기능에 사이트를 노출하기 위한 색인 | OAI-SearchBot | ChatGPT 검색 답변에 나오지 않음 (내비게이션 링크로는 나올 수 있음) |
| ChatGPT-User | 사용자가 ChatGPT나 Custom GPT에 질문했을 때 페이지 방문 | ChatGPT-User | 사용자 요청으로 시작되므로 robots.txt 규칙이 적용되지 않을 수 있음 |
표의 내용은 전부 OpenAI 공식 문서의 설명이다. 특히 “OAI-SearchBot을 거부한 사이트는 ChatGPT 검색 답변에 표시되지 않는다”와 “ChatGPT-User는 자동 크롤링에 쓰이지 않으며 검색 노출 여부를 정하지 않는다”는 두 문장이 실무 판단의 기준이 된다.
둘 다 허용한 사이트는 중복 크롤링을 피하려고 한 번의 크롤 결과를 두 용도에 같이 쓸 수 있다고도 적혀 있다.
이 구조는 구글의 Google-Extended와 닮았다. 구글은 Google-Extended를 “별도의 HTTP 요청 사용자 에이전트 문자열이 없는” robots.txt 전용 토큰으로 두고, 이것이 “Google 검색에 사이트가 포함될지 여부에 영향을 미치지 않으며 순위 결정 신호로 사용되지도 않는다”고 명시한다 (Google, Google의 일반 크롤러).
학습 거부와 검색 노출을 분리하는 방식이 업계 표준이 된 셈이다.
GPTBot은 1년 만에 AI 크롤러 트래픽 점유율을 두 배 넘게 키웠다. 클라우드플레어 집계로 2024년 7월 4.7%였던 GPTBot의 AI 크롤링 트래픽 점유율은 2025년 7월 11.7%가 됐고, 같은 기간 AI 봇 활동 가운데 학습 목적 크롤링의 비중은 72%에서 “거의 80%“로 올랐다 (Cloudflare, The crawl-to-click gap).
크롤링 순위도 급등했다. 2024년 5월과 2025년 5월을 비교한 다른 클라우드플레어 조사에서 GPTBot은 요청 수가 305% 늘며 전체 크롤러 순위 9위에서 3위(구글봇, 빙봇 다음)로 올라섰다 (Cloudflare, From Googlebot to GPTBot).
크롤링한 만큼 방문자를 돌려주지는 않는다. 같은 조사에서 OpenAI의 크롤 대 참조 비율은 2025년 7월 기준 1,091 대 1, 즉 사람 한 명을 사이트로 보내는 동안 HTML 페이지 1,091개를 크롤링했다. 구글의 같은 달 비율은 5.4 대 1이었다.
2026년 10월 5일 기준 클라우드플레어 레이더의 최근 7일 AI 봇 상위 5개는 구글봇 24.8%, Meta-ExternalAgent 15.3%, ClaudeBot 11.6%, Applebot 8.4%, Bingbot 6.8%로 GPTBot은 5위 안에 없었다 (Cloudflare Radar, AI Insights). 시점에 따라 순위가 크게 흔들리는 봇이다.
사이트 루트의 robots.txt에 User-agent: GPTBot 그룹을 만들고 Disallow 또는 Allow 규칙을 적으면 된다. 전체 차단은 두 줄이다.
User-agent: GPTBot
Disallow: /
학습은 막고 ChatGPT 검색 노출은 유지하려면 두 봇을 따로 적는다.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
일부 경로만 열 수도 있다. Allow: /blog/와 Disallow: / 식으로 디렉터리 단위 규칙을 섞으면 된다.
반영에는 시간이 걸린다. OpenAI는 “검색 결과의 경우 사이트의 robots.txt 변경 후 시스템이 반영하는 데 약 24시간이 걸릴 수 있다”고 밝힌다 (OpenAI, Overview of OpenAI Crawlers).
규칙을 넣은 뒤에는 서버 로그에서 GPTBot/ 문자열이 들어간 요청이 줄어드는지 확인한다. OpenAI는 robots.txt 파일을 가져올 때 유저 에이전트 문자열에 robots.txt 표식을 덧붙일 수 있다고 해서, 로그에 경로가 없어도 robots.txt 요청과 일반 페이지 요청을 구분할 수 있다.
유저 에이전트 문자열은 누구나 흉내 낼 수 있으므로, 요청 IP가 OpenAI가 공개한 대역 안에 있는지로 확인한다. OpenAI는 GPTBot의 IP 대역을 https://openai.com/gptbot.json에 공개하고 있고, 서치폴라리스가 2026년 10월 5일 받은 파일은 2026년 9월 22일 생성본으로 IPv4 대역 18개가 들어 있었다 (OpenAI, gptbot.json).
확인 순서는 셋이다.
GPTBot/1.4 같은 문자열이 들어간 요청의 IP를 뽑는다.searchbot.json, chatgpt-user.json으로 파일이 다르다.대역 파일은 갱신되므로 차단 목록에 하드코딩하지 말고 주기적으로 다시 받는 편이 안전하다. 구글봇을 역방향 DNS와 IP 목록으로 검증하는 것과 같은 원리다.
차단 여부는 콘텐츠로 돈을 버는 구조에 따라 갈리고, 한국 주요 사이트들은 이미 둘로 나뉘어 있다. 서치폴라리스가 2026년 10월 5일 국내 포털, 언론, 커머스, 채용, 블로그 플랫폼 30곳의 robots.txt를 직접 요청해 보니 24곳이 파일을 돌려줬고, 그중 10곳이 GPTBot을 전면 차단(Disallow: /)하고 있었다.
| 판정 | 사이트 수 | 사이트 |
|---|---|---|
| 전면 차단 | 10 | 지마켓, 조선일보, 중앙일보, 한겨레, 매일경제, 연합뉴스, 브런치, 네이버 블로그, 사람인, 잡코리아 |
| 일부 경로 차단 | 2 | 무신사, 현대자동차 |
| 명시적 허용 | 1 | SSG닷컴 |
| 언급 없음 (기본 규칙 적용) | 11 | 네이버 메인, 다음, 11번가, 동아일보, 한국경제, 나무위키, 카카오, 예스24, 교보문고, 인터파크, 야놀자, 배달의민족 |
언론사와 채용 플랫폼, 사용자 생성 콘텐츠 플랫폼처럼 텍스트 자체가 자산인 곳은 막고, 커머스와 포털은 대체로 열어 둔 모양새다. 네이버 메인 도메인에는 규칙이 없지만 블로그 도메인은 전면 차단이라는 점도 눈에 띈다.
글로벌 흐름도 같다. 클라우드플레어가 2025년 6월 상위 1만 개 도메인의 robots.txt를 분석했을 때 가장 많이 차단된 봇이 GPTBot으로 312개 도메인이 막았지만, 동시에 61개 도메인이 명시적으로 허용해 가장 많이 허용된 봇이기도 했다 (Cloudflare, From Googlebot to GPTBot).
2026년 9월 28일자 레이더 스냅샷을 분석한 보고서에서는 robots.txt 파일 4,242개 중 8.11%가 GPTBot을 전면 차단했고, 1년 전 7.15%에서 소폭 늘었다 (Technology Checker, robots.txt AI crawlers blocking report).
판단 기준은 세 가지로 정리된다.
서치폴라리스는 AI 검색 인용을 목표로 하는 사이트이므로 robots.txt에서 GPTBot, OAI-SearchBot, ChatGPT-User, Google-Extended, ClaudeBot, PerplexityBot을 모두 허용하고 있다. 어떤 봇을 열고 닫았는지는 llms.txt와 함께 AI 가시성 점검의 첫 항목이 된다.
GPTBot은 OpenAI가 자동으로 웹을 돌며 학습 데이터를 모으는 크롤러이고, ChatGPT-User는 사용자가 ChatGPT에 링크를 붙여 넣거나 질문했을 때 그 페이지를 한 번 여는 에이전트다. OpenAI는 ChatGPT-User가 “자동 크롤링에 쓰이지 않으며” 사용자 요청으로 시작되기 때문에 “robots.txt 규칙이 적용되지 않을 수 있다”고 밝힌다 (OpenAI, Overview of OpenAI Crawlers).
그래서 GPTBot을 막아도 사용자가 직접 요청한 페이지는 ChatGPT가 읽을 수 있다.
OpenAI의 크롤러 공식 문서에는 Crawl-delay 지시어에 대한 언급이 없다. 요청 속도를 제한하고 싶다면 robots.txt가 아니라 서버나 CDN의 속도 제한 기능에 GPTBot의 공개 IP 대역을 지정하는 방식이 확실하다.
OpenAI는 GPTBot이 robots.txt 규칙을 따른다고 문서화하고 있고, IP 대역을 공개해 사칭 요청을 가려낼 수 있게 한다. 로그에 GPTBot이라고 찍혔는데 차단 경로를 계속 요청한다면 먼저 그 IP가 gptbot.json 대역 안에 있는지 확인한다. 대역 밖이면 GPTBot을 사칭한 다른 봇이다.
서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.