컨텍스트 윈도우(Context Window)는 ChatGPT나 클로드 같은 대규모 언어 모델(LLM)이 응답을 생성할 때 한 번에 참조할 수 있는 텍스트의 최대량이며, 단어가 아니라 토큰 단위로 센다.
앤트로픽 문서는 “언어 모델이 응답을 생성할 때 참조할 수 있는 모든 텍스트를 의미하며, 응답 자체도 포함”된다고 정의하고, 학습 데이터와 구분해 모델의 “작업 메모리”라고 부른다 (Anthropic, 컨텍스트 윈도우). IBM은 “모델이 한 번에 고려하거나 기억할 수 있는 텍스트의 양”으로 설명하며 컨텍스트 길이라고도 부른다 (IBM, 컨텍스트 창이란 무엇인가요?).
시스템 프롬프트, 대화 이력, 첨부한 문서, 도구 정의, 그리고 모델이 지금 쓰고 있는 답까지 전부 이 윈도우 안에 들어가야 한다. 윈도우에 무엇을 넣을지 설계하는 일이 컨텍스트 엔지니어링이다.
토큰으로 잰다. 토큰은 모델이 텍스트를 쪼개는 단위로, 영어 기준 1토큰은 약 4글자 또는 단어의 4분의 3이고 100토큰이 약 75단어다 (OpenAI, Understanding and counting tokens).
언어에 따라 같은 내용이 더 많은 토큰을 먹는다. 상용 LLM 22개 언어를 분석한 연구는 같은 정보를 전달하는 데 어떤 언어는 다른 언어보다 5배 많은 토큰이 필요하다고 보고했다 (Ahia 외, Do All Languages Cost the Same?).
한국어 문서를 넣을 때 영어 기준 어림셈보다 여유를 둬야 하는 이유다.
입력과 출력이 윈도우를 나눠 쓴다. 앤트로픽 문서는 시스템 프롬프트, 메시지의 도구 결과와 이미지, 도구 정의, 그리고 그 턴에 생성하는 출력과 사고 토큰까지 전부 윈도우에 계산된다고 설명한다 (Anthropic, 컨텍스트 윈도우, 위 인용).
프롬프트 캐싱을 써도 마찬가지다. 캐시된 접두사는 “지불하는 비용을 바꿀 뿐, 계산 여부를 바꾸지는 않는다” (Anthropic, 컨텍스트 윈도우, 위 인용).
2026년 기준 주요 모델은 100만 토큰 안팎이다. 앤트로픽은 2023년 초 컨텍스트 윈도우가 약 4,000토큰이었는데 지금은 100만 토큰 이상이라고 적는다 (Anthropic, Many-shot jailbreaking).
| 모델 | 컨텍스트 윈도우 | 최대 출력 | 출처 |
|---|---|---|---|
| Claude Sonnet 4.6, Opus 4.6 이후 모델 | 1M 토큰 (기본값) | 128K 토큰 | Anthropic 문서 |
| Claude Sonnet 4.5 등 그 밖의 Claude | 200K 토큰 | 모델별 | Anthropic 문서, 위 인용 |
| GPT-4.1 | 1,047,576 토큰 | 32,768 토큰 | OpenAI 모델 문서 |
| Gemini (다수 모델) | 100만 토큰 이상 | 모델별 | Google, 긴 컨텍스트 |
100만 토큰이 어느 정도인지 구글은 “80자 기준 코드 5만 줄”, “평균 길이 영어 소설 8권”, “200분 넘는 팟캐스트 대본”에 견준다 (Google, 긴 컨텍스트, 위 인용). OpenAI는 GPT-4.1을 2025년 4월 14일 공개하며 “최대 100만 토큰 컨텍스트”와 개선된 긴 문맥 이해를 내세웠다 (OpenAI, Introducing GPT-4.1 in the API).
크기는 계속 바뀌므로 각 사의 모델 비교 표를 확인하는 편이 안전하다. IBM이 2024년 10월에 적은 표만 해도 GPT-4o 128,000, Claude 3.5 Sonnet 약 200,000, Gemini 1.5 Pro 2,000,000이었다 (IBM, 위 인용).
트랜스포머 구조 때문이다. 모든 토큰이 다른 모든 토큰에 주의를 기울이는 셀프 어텐션 방식이라 토큰 n개에 n² 쌍의 관계가 생긴다 (Anthropic, Effective context engineering for AI agents).
IBM은 이를 “입력 토큰이 2배가 되면 4배의 처리 능력이 필요하다”고 풀어 쓴다 (IBM, 위 인용). 트랜스포머 자체는 2017년 논문 “Attention Is All You Need”가 제안한 구조로, 순환과 합성곱을 버리고 어텐션만으로 시퀀스를 처리한다 (Vaswani 외, Attention Is All You Need).
그래서 윈도우는 API 설정값이 아니라 모델이 학습된 길이와 연산 비용이 정하는 구조적 한계다. 윈도우를 늘리면 메모리와 지연 시간, 비용이 함께 는다.
아니다. 앤트로픽 문서는 “컨텍스트가 많다고 해서 자동으로 더 좋은 것은 아니”며 토큰 수가 늘수록 정확도와 재현율이 떨어지는 현상을 컨텍스트 부패(context rot)라고 부른다 (Anthropic, 컨텍스트 윈도우, 위 인용).
크로마가 GPT-4.1, 클로드 4, 제미나이 2.5, Qwen3 등 18개 모델을 실험한 결과, 단순한 과제에서도 입력이 길어질수록 성능이 “점점 더 신뢰할 수 없게” 됐다 (Chroma, Context Rot).
위치도 문제다. 스탠퍼드 연구진은 관련 정보가 입력의 처음이나 끝에 있을 때 성능이 가장 높고, 긴 컨텍스트의 중간에 있으면 크게 떨어진다고 보고했다 (Liu 외, Lost in the Middle).
| 연구 | 대상 | 결과 |
|---|---|---|
| NoLiMa (2025) | 128K 이상을 지원한다는 모델 13개 | 32K 길이에서 11개가 짧은 컨텍스트 기준선의 50% 아래로. GPT-4o는 99.3%에서 69.7%로 (Modarressi 외) |
| Databricks (2024) | 모델 13개, 실험 2,000회 이상 | 대부분 일정 길이 이후 성능 하락. Llama 3.1 405b 32K, GPT-4 64K, Claude 3 Sonnet 16K부터 (Databricks) |
| Chroma (2025) | 모델 18개 | 반복 단어 같은 단순 과제에서도 길이에 따라 성능 불안정 (Chroma, 위 인용) |
보안 면에서도 넓은 윈도우는 공격면이다. 앤트로픽은 가짜 대화를 최대 256개까지 채워 넣는 다중 샷 탈옥이 긴 컨텍스트 덕에 가능해졌다고 밝히고, 한 가지 완화책으로 공격 성공률을 61%에서 2%로 낮췄다 (Anthropic, Many-shot jailbreaking, 위 인용).
API에서는 오류가 나거나 생성이 멈춘다. 앤트로픽 API는 입력만으로 윈도우를 넘으면 400 오류(“prompt is too long”)를 돌려주고, Claude 4.5 이후 모델은 생성 중 한도에 닿으면 model_context_window_exceeded 사유로 멈춘다 (Anthropic, 컨텍스트 윈도우, 위 인용).
채팅 앱은 다르게 처리한다. 같은 문서는 claude.ai 같은 채팅 인터페이스가 “선입선출 방식의 롤링 기반”으로 윈도우를 관리할 수 있다고 적는다.
오래된 대화가 밀려나면서 모델이 앞부분을 잊은 것처럼 보이는 이유다.
이때 흔한 대응이 셋이다.
윈도우를 다 채우지 않고 필요한 정보만 골라 넣는 것이 원칙이다. 앤트로픽은 컨텍스트를 “한계 효용이 체감하는 유한한 자원”으로 다루라고 권한다 (Anthropic, Effective context engineering, 위 인용).
| 방법 | 하는 일 | 언제 |
|---|---|---|
| RAG | 외부 문서에서 관련 부분만 검색해 넣음 | 지식 베이스가 윈도우보다 클 때 |
| 청킹 | 긴 문서를 작은 단위로 잘라 필요한 조각만 투입 | RAG의 전처리 |
| 압축과 요약 | 이전 대화를 요약본으로 대체 | 장기 대화, 에이전트 작업 |
| 도구 결과 정리 | 오래된 도구 출력을 삭제 | 에이전트 워크플로 |
| 배치 | 앞뒤에 중요한 정보를 두고 중간을 비움 | Lost in the Middle 대응 |
Databricks 실험에서 최근 모델은 긴 컨텍스트에서 성능 저하가 거의 없었지만, 그 이전 모델은 16K에서 64K 사이에서 하락이 시작됐다 (Databricks, 위 인용). 모델을 고를 때는 윈도우 크기 숫자보다 실제 긴 입력에서의 성능 곡선을 봐야 한다.
구글 키워드 플래너 기준 “컨텍스트 윈도우”는 월 평균 480회이고 2025년 9월 210회에서 2026년 8월 880회로 늘었다 (서치폴라리스, 구글 키워드 플래너 2026-09-29 조회). “컨텍스트 윈도우 뜻”은 70회, “context window”는 320회다.
네이버 검색광고 기준 PC 60회, 모바일 40회이고 자동완성은 “뜻”과 “비교”뿐이다. 구글 자동완성은 뜻, 제한, 클로드, 비교, 압축, 크기, 초기화, 정리, 토큰 순이고 관련 검색어에 “클로드 컨텍스트 윈도우 다 차면”과 “제미나이 컨텍스트 윈도우”가 있다.
구글 1페이지 9건 중 정의와 토큰 설명은 전원이 다뤘고, 모델별 크기 비교가 5건, Lost in the Middle 같은 한계가 5건, 관리 방법이 4건이었다. 그래서 이 문서는 정의와 토큰 뒤에 모델 비교 표를 두고 한계와 다 찼을 때의 동작을 따로 뒀다.
AI 모델이 답을 만들 때 한 번에 볼 수 있는 텍스트의 최대량이다. 질문, 이전 대화, 첨부 문서, 답변까지 모두 이 한도 안에 들어가야 한다.
학습 데이터는 모델이 훈련 때 본 자료이고 컨텍스트 윈도우는 지금 이 요청에서 보는 자료다. 앤트로픽은 이를 장기 지식과 작업 메모리의 차이로 설명한다.
API는 400 오류나 model_context_window_exceeded 중지로 알려 주고, 채팅 앱은 오래된 대화를 밀어낼 수 있다. 압축 기능을 켜거나 새 대화를 시작하면 된다.
영어는 1토큰이 약 4글자, 100토큰이 약 75단어다. 한국어는 더 많은 토큰이 들므로 각 사의 토큰 카운팅 API나 토크나이저로 실측하는 편이 정확하다.
숫자만 보면 안 된다. NoLiMa 실험에서 128K를 지원한다는 13개 모델 중 11개가 32K에서 성능이 반토막 났으므로, 실제 긴 입력에서의 정확도 곡선을 함께 봐야 한다.
서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.