지식 컷오프(Knowledge Cutoff)는 ChatGPT, 클로드, 제미나이 같은 대형 언어 모델(LLM)이 학습한 데이터의 마지막 시점으로, 그 날짜 이후에 생긴 사건과 정보는 모델의 내장 지식에 들어 있지 않다. 데이터 컷오프, 학습 컷오프라고도 부른다.
위키백과는 지식 컷오프를 “대형 언어 모델이 새로운 데이터를 학습하지 않은 기준 시점”으로 정의하고, 모델은 사전 학습을 거치기 때문에 “지식은 배포 전 학습한 내용으로 고정된다”고 설명한다 (위키백과, 지식 컷오프). 컷오프 이후의 정보는 RAG나 웹 검색 같은 외부 조회가 붙어야만 답에 반영된다.
컷오프는 모델마다 다르고, 같은 회사 안에서도 모델마다 다르다. 그래서 “지식 컷오프”를 검색하는 사람 대부분이 실제로 알고 싶은 것은 지금 쓰는 모델의 날짜가 언제인지다.
2026년 10월 5일 기준 세 회사의 공식 문서에 적힌 날짜는 아래와 같다. 서치폴라리스가 각 모델 문서를 직접 열어 대조한 값이며, 회사마다 표기 방식이 달라 비고를 함께 봐야 한다.
| 회사 | 모델 | 공식 문서의 지식 컷오프 | 비고 |
|---|---|---|---|
| OpenAI | GPT-6 Astra | 2026년 4월 30일 | 최상위 모델 |
| OpenAI | GPT-6.1 Sol | 2026년 4월 30일 | |
| OpenAI | GPT-6 Luna | 2026년 5월 18일 | 세 모델 중 가장 최신 |
| Anthropic | Claude Fable 5.1, Opus 5.5, Sonnet 5.5 | 2026년 6월 | 신뢰 컷오프와 학습 데이터 컷오프가 같음 |
| Anthropic | Claude Haiku 4.5 | 2025년 2월 (신뢰) / 2025년 7월 (학습 데이터) | 두 날짜를 따로 표기 |
| Gemini 3.8 Flash | 2026년 3월 | 일부 도메인은 2025년 1월까지만 |
OpenAI는 모델 페이지마다 “Knowledge cutoff”를 날짜 단위로 적는다 (OpenAI, Models). Anthropic은 “모델의 지식이 가장 폭넓고 신뢰할 수 있는 날짜”인 신뢰 컷오프(reliable knowledge cutoff)와 “학습에 쓰인 데이터의 더 넓은 범위”인 학습 데이터 컷오프(training data cutoff)를 나눠 적는다 (Anthropic, Models overview). 구글은 Gemini 3.8 Flash 모델 카드에 컷오프를 2026년 3월로 적으면서 “일부 도메인에서는 모델의 지식이 2025년 1월까지로 제한될 수 있다”고 단서를 달았다 (Google DeepMind, Gemini 3.8 Flash Model Card).
세 회사 모두 날짜 하나로 끝내지 않고 단서를 붙이는 쪽으로 가고 있다. 컷오프가 왜 단순한 날짜 하나가 아닌지는 아래에서 다룬다.
LLM은 인터넷과 책에서 특정 시점까지 모은 정적인 데이터 스냅샷으로 학습되기 때문에 컷오프가 생긴다. 학습이 끝난 뒤 평가, 안전성 검증, 배포 준비에 몇 달이 걸리므로 출시일은 늘 컷오프보다 늦다.
이 간격은 공식 문서에서 바로 확인된다. Claude Haiku 4.5의 API 모델 ID는 claude-haiku-4-5-20251001로 2025년 10월 1일 스냅샷인데 신뢰 컷오프는 2025년 2월이어서, 출시 시점에 이미 8개월 전 세상을 알고 있던 셈이다 (Anthropic, Models overview). 그래서 “최신 모델”이 곧 “최신 정보를 아는 모델”은 아니다.
문서에 적힌 날짜까지 모델이 골고루 알고 있는 것도 아니다. 존스홉킨스대 연구진은 보고된 컷오프와 별개로 자료별, 주제별로 모델이 실제로 아는 시점인 “유효 컷오프(effective cutoff)“를 정의하고, “유효 컷오프는 보고된 컷오프와 자주 다르다”는 결과를 냈다 (Cheng et al., Dated Data: Tracing Knowledge Cutoffs in Large Language Models (COLM 2024)).
원인은 둘이다. 첫째, 최신 CommonCrawl 덤프 안에 오래된 데이터가 상당량 섞여 있다. 논문은 2023년 위키백과 덤프를 포함한 RedPajama 데이터셋에서 “위키백과 문서의 80% 이상이 이전 버전(2023년 이전)“이었다고 보고한다.
둘째, 의미는 같고 표현만 다른 중복 문서를 걸러내는 중복 제거가 완벽하지 않아 옛 버전이 살아남는다. 논문의 예시처럼 컷오프가 2023년이라고 광고된 모델에게 세법을 물어도 “세법의 유효 컷오프는 2022년”일 수 있다.
모델에게 직접 물어봐도 답이 맞다는 보장이 없다. 2026년 4월 OpenAI 개발자 커뮤니티에는 gpt-5.4가 자기 컷오프를 “2024-06”이라고 답한다는 버그 보고가 올라왔고, 문서상 컷오프는 2025년 8월 31일이었다.
OpenAI 지원팀은 2026년 9월 “모델이 자기 자신에 대해 하는 답은 부정확할 수 있다”고 확인했다 (OpenAI Developer Community, gpt-5.4 system prompt contains invalid cutoff). 14개월이 어긋난 사례다. 컷오프를 알고 싶으면 모델이 아니라 공식 문서를 봐야 한다.
가장 큰 문제는 모른다고 답하는 대신 옛 지식으로 자신 있게 틀리는 것이다. 위키백과는 지식 컷오프가 “모델이 자신감 있게 (하지만 틀린) 답변을 생성하는 환각 현상, 정보의 공백, 변화하는 지식에 대한 정확도 저하”를 초래한다고 정리한다 (위키백과, 지식 컷오프).
실무에서 자주 걸리는 영역은 날짜가 바뀌면 결론도 바뀌는 정보다.
이런 질문에서는 모델의 내장 지식만으로 답한 결과를 “어느 시점까지의 지식으로 쓴 초안”으로 다루고 1차 출처로 확인해야 한다. 자세한 메커니즘은 할루시네이션 문서에 있다.
질문이 들어온 순간에 외부 자료를 찾아 모델의 입력에 넣어 주면, 모델은 학습하지 않은 정보로도 답을 만들 수 있다. 이것이 RAG와 검색 그라운딩이고, ChatGPT 검색, 퍼플렉시티, 구글 AI 모드 같은 AI 검색이 전부 이 방식으로 컷오프를 넘는다.
다만 보완이지 해결은 아니다. 위키백과가 지적하듯 “일부 모델은 검색 도구를 통해 더 최신의 정보를 검색할 수 있지만, 모델의 판단은 여전히 학습된 데이터에 의해 형성된다”. 검색 결과를 읽고 해석하는 기준 자체가 컷오프 시점의 지식이라서, 새 개념을 옛 개념의 틀로 오독할 수 있다.
다른 보완책인 증분 학습(모델을 주기적으로 추가 학습)은 비용 때문에 상용 모델에서는 새 버전 출시로 대체되는 것이 보통이다.
컷오프 이후에 발행한 콘텐츠는 어떤 모델의 내장 지식에도 없으므로, AI 답변에 인용되는 길은 검색 그라운딩뿐이다. 서치폴라리스 위키의 발행 캘린더로 확인하면 2026년 10월 5일 기준 발행된 122편의 첫 발행일이 2026년 8월 12일이어서, 위 표의 어떤 현행 모델 컷오프보다도 뒤다.
이 위키가 AI 답변에 인용된다면 전부 실시간 검색을 거친 결과라는 뜻이다.
여기서 GEO의 실행 원칙 셋이 나온다.
OpenAI 문서 기준 2025년 8월 31일이다. 모델 자신은 2024년 6월이라고 답한 사례가 있으므로 모델의 답을 믿지 말고 문서를 본다 (OpenAI Developer Community).
2026년 9월에 공개된 Gemini 3.8 Flash 모델 카드 기준 2026년 3월이며, 일부 도메인은 2025년 1월까지만 알 수 있다고 적혀 있다 (Google DeepMind, Gemini 3.8 Flash Model Card). 모델 카드마다 다르므로 쓰는 모델의 카드를 확인한다.
같은 개념이다. 구글이 영문 문서를 기계 번역할 때 knowledge cutoff를 “지식 단절”, “지식 차단점”, “지식 마감일”로 옮기는 경우가 있어 표기가 갈릴 뿐이다.
한국어 위키백과와 각 회사 문서는 “지식 컷오프”를 쓴다.
서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.