GPTBot이란? OpenAI 크롤러 완전 가이드

GPTBot은 OpenAI가 AI 모델 학습 데이터를 수집하는 공식 웹 크롤러입니다. OAI-SearchBot·ChatGPT-User와의 차이, robots.txt 허용·차단 설정, 진짜 봇 검증법까지 공식 문서 기준으로 정리했습니다.

강세연 | Jul 25 2026
GEO • 8 min read
GPTBot이란 무엇인가 썸네일. OpenAI가 운영하는 크롤러는 GPTBot 하나가 아니라 학습, 검색 인덱싱, 실시간 방문, 광고 검수 4종으로 나뉜다는 핵심 구분법을 담은 가이드. 서치폴라리스 2026.07
AI Summary Nugget: GPTBot은 OpenAI가 GPT 계열 AI 모델의 학습 데이터를 수집하는 공식 웹 크롤러다. OpenAI 크롤러는 GPTBot 외에 OAI-SearchBot(챗GPT 검색 노출), ChatGPT-User(사용자 요청 시 실시간 방문), OAI-AdsBot(광고 검수)까지 총 4종으로 나뉜다. GPTBot을 robots.txt로 차단해도 OAI-SearchBot을 허용하면 챗GPT 검색 인용은 유지된다. robots.txt 변경 반영에는 약 24시간이 걸린다.

GPTBot(지피티봇)은 OpenAI가 챗GPT 같은 AI 모델의 학습 데이터를 수집하려고 운영하는 공식 웹 크롤러입니다. 구글의 Googlebot이 검색 색인을 만들 듯, GPTBot은 다음 세대 GPT 모델이 읽을 웹 텍스트를 모아요.

핵심은 세 가지입니다. OpenAI 크롤러는 GPTBot 하나가 아니라 역할이 다른 4종이다. GPTBot을 차단해도 챗GPT 검색 노출은 별개로 움직인다. 그리고 robots.txt 변경이 실제 반영되기까지 약 24시간이 걸린다.

서치폴라리스가 OpenAI 공식 봇 문서를 기준으로, 한국어 자료에 빠져 있는 부분까지 채워서 정리했습니다.


OpenAI 크롤러는 GPTBot 하나가 아니다

대부분 GPTBot만 알지만, OpenAI는 2026년 기준 역할이 다른 크롤러 4종을 운영합니다(OpenAI 공식 봇 문서). 어떤 봇을 허용하느냐에 따라 내 사이트가 AI 학습에 들어갈지, 챗GPT 검색에 노출될지가 따로 결정돼요.

넷은 하는 일이 전부 다릅니다.

크롤러 역할 robots.txt 식별자
GPTBot 파운데이션 모델 학습용 데이터 수집 GPTBot
OAI-SearchBot 챗GPT 검색 결과 노출용 인덱싱 OAI-SearchBot
ChatGPT-User 사용자가 링크를 주면 실시간 방문 ChatGPT-User
OAI-AdsBot 챗GPT 광고 랜딩페이지 안전성 검증 OAI-AdsBot

서버 로그에서 GPTBot은 이 User-Agent 문자열로 나타납니다. 현재 버전은 1.4예요.

Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko);
compatible; GPTBot/1.4; +https://openai.com/gptbot

주의할 점이 하나 있어요. ChatGPT-User는 사용자가 직접 요청한 방문이라 robots.txt 규칙이 적용되지 않을 수 있다고 OpenAI가 공식 문서에 명시했습니다. 사람이 브라우저에 주소를 치는 행동에 가깝게 취급하는 거예요. OAI-AdsBot이 수집한 데이터는 모델 학습에 쓰이지 않는다는 것도 공식 확인된 내용입니다.

AI 크롤러 전체 그림이 필요하면 AI 크롤러란? GPTBot, PerplexityBot 완전 정리에서 다른 회사 봇까지 비교할 수 있어요.

OpenAI 크롤러 4종의 역할 분기 구조. GPTBot은 모델 학습 데이터 수집, OAI-SearchBot은 챗GPT 검색 인덱싱, ChatGPT-User는 사용자 요청 실시간 방문, OAI-AdsBot은 광고 랜딩페이지 검증을 담당한다. OpenAI 공식 봇 문서 기준, 서치폴라리스 2026.07

차단해도 챗GPT에서 사라지지 않는다

GPTBot 차단을 고민하는 운영자가 가장 많이 오해하는 지점이 여기입니다. GPTBot을 막으면 챗GPT에서 우리 사이트가 사라진다고 생각하지만, 사실 학습과 검색은 별도 봇이 담당합니다. GPTBot을 Disallow해도 OAI-SearchBot을 허용하면 챗GPT 검색 인용은 유지돼요.

그래서 robots.txt 전략은 세 갈래로 나뉩니다.

# 1. 전부 허용 (AI 검색 노출이 목표일 때)
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

# 2. 학습만 거부, 검색 노출은 유지
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

# 3. 전부 차단 (콘텐츠 보호가 최우선일 때)
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

변경했다고 바로 적용되는 건 아닙니다. OpenAI 공식 문서 기준으로 robots.txt 수정이 시스템에 반영되기까지 약 24시간이 걸려요. 어제 막았는데 오늘 로그에 GPTBot이 찍혀 있어도 이상한 게 아닙니다.

~~트래픽은 안 주면서 데이터만 가져간다는 불만, 이해는 갑니다.~~

서치폴라리스는 셋 중 전부 허용을 선택합니다. AI 검색에서 인용되는 것이 목표인 사이트라면 학습 데이터에 들어가는 것 자체가 브랜드 노출 경로라서요. 다만 유료 구독 콘텐츠나 독점 데이터가 핵심 자산인 사이트에는 전부 허용을 추천하지 않습니다. 이 경우 2번처럼 GPTBot만 막고 OAI-SearchBot을 열어두는 절충이 현실적이에요.

한 가지는 아직 확실하지 않아요. GPTBot을 장기간 차단한 사이트가 미래 모델의 브랜드 지식에서 얼마나 흐려지는지는 검증된 데이터가 없습니다. 다만 학습에서 빠진 브랜드가 모델 답변에서 유리해질 이유는 없다고 봅니다.

지시문 문법과 크롤러별 세부 설정은 AI 크롤러 robots.txt 설정법에서 코드째 가져갈 수 있습니다. 챗GPT 검색 노출 자체를 늘리는 방법은 ChatGPT 검색 최적화 가이드가 담당이에요.

GPTBot 정책 결정 4단계 체크리스트. 노출 목표 결정, robots.txt 시나리오 선택, 적용 후 반영까지 약 24시간 대기, openai.com/gptbot.json IP 대역 대조로 가짜 봇 검증까지의 순서. 서치폴라리스 2026.07

로그에 찍힌 봇이 진짜 GPTBot인지 확인하는 법

User-Agent는 명함 같은 거라 아무나 흉내 낼 수 있습니다. 신분증 역할은 IP 주소가 해요. 악성 스크래퍼가 GPTBot 이름을 달고 들어오는 경우가 실제로 있어서, 차단이든 허용이든 판단 전에 진짜인지부터 확인하는 게 순서입니다.

OpenAI는 크롤러별 IP 대역을 JSON으로 공개합니다.

https://openai.com/gptbot.json
https://openai.com/searchbot.json
https://openai.com/chatgpt-user.json

확인 절차는 단순합니다. 서버 로그에서 GPTBot User-Agent가 찍힌 요청의 IP를 뽑고, 위 JSON의 대역과 대조하면 끝이에요. 대역 밖 IP인데 GPTBot을 자칭하면 스푸핑이니 서버나 방화벽에서 IP 단위로 막으면 됩니다. robots.txt는 신사협정이라 규칙을 무시하는 가짜 봇에는 효과가 없거든요.

크롤 부하가 걱정이라면 로그에서 GPTBot 요청 빈도를 먼저 재보세요. 서치폴라리스가 운영 채널에서 관찰한 바로는, 일반 블로그 규모에서 OpenAI 크롤러의 방문 빈도가 서버 부하를 걱정할 수준인 경우는 드물었습니다. 부하 때문에 차단을 고민했다면 대부분 다른 원인이에요.

결국 GPTBot 정책은 기술 설정이 아니라 콘텐츠 전략의 표현입니다. 내 콘텐츠가 AI 답변에 인용되는 게 이득인지, 보호가 이득인지를 먼저 정하면 robots.txt는 따라옵니다. 다른 AI 검색 용어가 궁금하면 GEO 용어사전에서 이어서 볼 수 있어요.


자주 묻는 질문

Q: GPTBot을 차단하면 챗GPT 검색에서 우리 사이트가 사라지나요?

아니요. GPTBot은 모델 학습용이고, 챗GPT 검색 노출은 OAI-SearchBot이 담당합니다. GPTBot을 Disallow해도 OAI-SearchBot을 허용하면 챗GPT 검색 인용은 유지됩니다.

Q: GPTBot robots.txt 설정은 어떻게 하나요?

사이트 루트의 robots.txt에 User-agent: GPTBot을 선언하고 Allow: / 또는 Disallow: /를 지정하면 됩니다. 학습만 거부하고 검색 노출을 유지하려면 GPTBot은 Disallow, OAI-SearchBot은 Allow로 나눠 적습니다.

Q: robots.txt를 수정하면 언제부터 적용되나요?

OpenAI 공식 문서 기준 약 24시간이 걸립니다. 수정 직후 하루 정도는 이전 규칙대로 크롤링될 수 있으니, 로그에 봇이 계속 보여도 하루는 기다린 뒤 판단하는 게 맞습니다.

Q: GPTBot이 수집한 데이터는 어디에 쓰이나요?

OpenAI의 파운데이션 모델, 즉 GPT 계열 모델의 학습 데이터로 쓰입니다. 페이월 뒤 콘텐츠, 개인정보 수집 페이지, 정책 위반 콘텐츠는 필터링한다고 OpenAI가 밝히고 있습니다. 광고 검수용 OAI-AdsBot이 수집한 데이터는 모델 학습에 사용되지 않습니다.

AI 검색에서 내 브랜드, 보이고 있나요?

1:1 무료 진단 · Google Meet

무료 진단받기