컨텍스트 윈도우란 무엇인가

컨텍스트 윈도우(Context Window)는 ChatGPT나 클로드 같은 대규모 언어 모델(LLM)이 응답을 생성할 때 한 번에 참조할 수 있는 텍스트의 최대량이며, 단어가 아니라 토큰 단위로 센다.

앤트로픽 문서는 “언어 모델이 응답을 생성할 때 참조할 수 있는 모든 텍스트를 의미하며, 응답 자체도 포함”된다고 정의하고, 학습 데이터와 구분해 모델의 “작업 메모리”라고 부른다 (Anthropic, 컨텍스트 윈도우). IBM은 “모델이 한 번에 고려하거나 기억할 수 있는 텍스트의 양”으로 설명하며 컨텍스트 길이라고도 부른다 (IBM, 컨텍스트 창이란 무엇인가요?).

시스템 프롬프트, 대화 이력, 첨부한 문서, 도구 정의, 그리고 모델이 지금 쓰고 있는 답까지 전부 이 윈도우 안에 들어가야 한다. 윈도우에 무엇을 넣을지 설계하는 일이 컨텍스트 엔지니어링이다.

컨텍스트 윈도우는 무엇으로 측정하는가?

토큰으로 잰다. 토큰은 모델이 텍스트를 쪼개는 단위로, 영어 기준 1토큰은 약 4글자 또는 단어의 4분의 3이고 100토큰이 약 75단어다 (OpenAI, Understanding and counting tokens).

언어에 따라 같은 내용이 더 많은 토큰을 먹는다. 상용 LLM 22개 언어를 분석한 연구는 같은 정보를 전달하는 데 어떤 언어는 다른 언어보다 5배 많은 토큰이 필요하다고 보고했다 (Ahia 외, Do All Languages Cost the Same?).

한국어 문서를 넣을 때 영어 기준 어림셈보다 여유를 둬야 하는 이유다.

입력과 출력이 윈도우를 나눠 쓴다. 앤트로픽 문서는 시스템 프롬프트, 메시지의 도구 결과와 이미지, 도구 정의, 그리고 그 턴에 생성하는 출력과 사고 토큰까지 전부 윈도우에 계산된다고 설명한다 (Anthropic, 컨텍스트 윈도우, 위 인용).

프롬프트 캐싱을 써도 마찬가지다. 캐시된 접두사는 “지불하는 비용을 바꿀 뿐, 계산 여부를 바꾸지는 않는다” (Anthropic, 컨텍스트 윈도우, 위 인용).

주요 모델의 컨텍스트 윈도우는 얼마나 큰가?

2026년 기준 주요 모델은 100만 토큰 안팎이다. 앤트로픽은 2023년 초 컨텍스트 윈도우가 약 4,000토큰이었는데 지금은 100만 토큰 이상이라고 적는다 (Anthropic, Many-shot jailbreaking).

모델컨텍스트 윈도우최대 출력출처
Claude Sonnet 4.6, Opus 4.6 이후 모델1M 토큰 (기본값)128K 토큰Anthropic 문서
Claude Sonnet 4.5 등 그 밖의 Claude200K 토큰모델별Anthropic 문서, 위 인용
GPT-4.11,047,576 토큰32,768 토큰OpenAI 모델 문서
Gemini (다수 모델)100만 토큰 이상모델별Google, 긴 컨텍스트

100만 토큰이 어느 정도인지 구글은 “80자 기준 코드 5만 줄”, “평균 길이 영어 소설 8권”, “200분 넘는 팟캐스트 대본”에 견준다 (Google, 긴 컨텍스트, 위 인용). OpenAI는 GPT-4.1을 2025년 4월 14일 공개하며 “최대 100만 토큰 컨텍스트”와 개선된 긴 문맥 이해를 내세웠다 (OpenAI, Introducing GPT-4.1 in the API).

크기는 계속 바뀌므로 각 사의 모델 비교 표를 확인하는 편이 안전하다. IBM이 2024년 10월에 적은 표만 해도 GPT-4o 128,000, Claude 3.5 Sonnet 약 200,000, Gemini 1.5 Pro 2,000,000이었다 (IBM, 위 인용).

왜 컨텍스트 윈도우에 한계가 있는가?

트랜스포머 구조 때문이다. 모든 토큰이 다른 모든 토큰에 주의를 기울이는 셀프 어텐션 방식이라 토큰 n개에 n² 쌍의 관계가 생긴다 (Anthropic, Effective context engineering for AI agents).

IBM은 이를 “입력 토큰이 2배가 되면 4배의 처리 능력이 필요하다”고 풀어 쓴다 (IBM, 위 인용). 트랜스포머 자체는 2017년 논문 “Attention Is All You Need”가 제안한 구조로, 순환과 합성곱을 버리고 어텐션만으로 시퀀스를 처리한다 (Vaswani 외, Attention Is All You Need).

그래서 윈도우는 API 설정값이 아니라 모델이 학습된 길이와 연산 비용이 정하는 구조적 한계다. 윈도우를 늘리면 메모리와 지연 시간, 비용이 함께 는다.

컨텍스트 윈도우가 크면 무조건 좋은가?

아니다. 앤트로픽 문서는 “컨텍스트가 많다고 해서 자동으로 더 좋은 것은 아니”며 토큰 수가 늘수록 정확도와 재현율이 떨어지는 현상을 컨텍스트 부패(context rot)라고 부른다 (Anthropic, 컨텍스트 윈도우, 위 인용).

크로마가 GPT-4.1, 클로드 4, 제미나이 2.5, Qwen3 등 18개 모델을 실험한 결과, 단순한 과제에서도 입력이 길어질수록 성능이 “점점 더 신뢰할 수 없게” 됐다 (Chroma, Context Rot).

위치도 문제다. 스탠퍼드 연구진은 관련 정보가 입력의 처음이나 끝에 있을 때 성능이 가장 높고, 긴 컨텍스트의 중간에 있으면 크게 떨어진다고 보고했다 (Liu 외, Lost in the Middle).

연구대상결과
NoLiMa (2025)128K 이상을 지원한다는 모델 13개32K 길이에서 11개가 짧은 컨텍스트 기준선의 50% 아래로. GPT-4o는 99.3%에서 69.7%로 (Modarressi 외)
Databricks (2024)모델 13개, 실험 2,000회 이상대부분 일정 길이 이후 성능 하락. Llama 3.1 405b 32K, GPT-4 64K, Claude 3 Sonnet 16K부터 (Databricks)
Chroma (2025)모델 18개반복 단어 같은 단순 과제에서도 길이에 따라 성능 불안정 (Chroma, 위 인용)

보안 면에서도 넓은 윈도우는 공격면이다. 앤트로픽은 가짜 대화를 최대 256개까지 채워 넣는 다중 샷 탈옥이 긴 컨텍스트 덕에 가능해졌다고 밝히고, 한 가지 완화책으로 공격 성공률을 61%에서 2%로 낮췄다 (Anthropic, Many-shot jailbreaking, 위 인용).

컨텍스트 윈도우가 다 차면 어떻게 되는가?

API에서는 오류가 나거나 생성이 멈춘다. 앤트로픽 API는 입력만으로 윈도우를 넘으면 400 오류(“prompt is too long”)를 돌려주고, Claude 4.5 이후 모델은 생성 중 한도에 닿으면 model_context_window_exceeded 사유로 멈춘다 (Anthropic, 컨텍스트 윈도우, 위 인용).

채팅 앱은 다르게 처리한다. 같은 문서는 claude.ai 같은 채팅 인터페이스가 “선입선출 방식의 롤링 기반”으로 윈도우를 관리할 수 있다고 적는다.

오래된 대화가 밀려나면서 모델이 앞부분을 잊은 것처럼 보이는 이유다.

이때 흔한 대응이 셋이다.

  1. 새 대화를 시작한다. 가장 확실하지만 이력이 사라진다.
  2. 압축한다. 앤트로픽은 서버 측 압축으로 이전 대화를 자동 요약해 한도를 넘어서도 이어가게 하고, 오래된 도구 결과나 사고 블록만 지우는 컨텍스트 편집도 제공한다 (Anthropic, 컨텍스트 윈도우, 위 인용).
  3. 남은 양을 미리 잰다. 토큰 카운팅 API로 요청 전에 사용량을 추정하고, 일부 모델은 남은 토큰 예산을 시스템 프롬프트로 전달받는 컨텍스트 인식 기능이 있다 (Anthropic, 컨텍스트 윈도우, 위 인용).

컨텍스트 윈도우는 어떻게 관리하는가?

윈도우를 다 채우지 않고 필요한 정보만 골라 넣는 것이 원칙이다. 앤트로픽은 컨텍스트를 “한계 효용이 체감하는 유한한 자원”으로 다루라고 권한다 (Anthropic, Effective context engineering, 위 인용).

방법하는 일언제
RAG외부 문서에서 관련 부분만 검색해 넣음지식 베이스가 윈도우보다 클 때
청킹긴 문서를 작은 단위로 잘라 필요한 조각만 투입RAG의 전처리
압축과 요약이전 대화를 요약본으로 대체장기 대화, 에이전트 작업
도구 결과 정리오래된 도구 출력을 삭제에이전트 워크플로
배치앞뒤에 중요한 정보를 두고 중간을 비움Lost in the Middle 대응

Databricks 실험에서 최근 모델은 긴 컨텍스트에서 성능 저하가 거의 없었지만, 그 이전 모델은 16K에서 64K 사이에서 하락이 시작됐다 (Databricks, 위 인용). 모델을 고를 때는 윈도우 크기 숫자보다 실제 긴 입력에서의 성능 곡선을 봐야 한다.

한국에서 컨텍스트 윈도우는 얼마나 검색되는가?

구글 키워드 플래너 기준 “컨텍스트 윈도우”는 월 평균 480회이고 2025년 9월 210회에서 2026년 8월 880회로 늘었다 (서치폴라리스, 구글 키워드 플래너 2026-09-29 조회). “컨텍스트 윈도우 뜻”은 70회, “context window”는 320회다.

네이버 검색광고 기준 PC 60회, 모바일 40회이고 자동완성은 “뜻”과 “비교”뿐이다. 구글 자동완성은 뜻, 제한, 클로드, 비교, 압축, 크기, 초기화, 정리, 토큰 순이고 관련 검색어에 “클로드 컨텍스트 윈도우 다 차면”과 “제미나이 컨텍스트 윈도우”가 있다.

구글 1페이지 9건 중 정의와 토큰 설명은 전원이 다뤘고, 모델별 크기 비교가 5건, Lost in the Middle 같은 한계가 5건, 관리 방법이 4건이었다. 그래서 이 문서는 정의와 토큰 뒤에 모델 비교 표를 두고 한계와 다 찼을 때의 동작을 따로 뒀다.

컨텍스트 윈도우에 대해 자주 묻는 질문은 무엇인가?

컨텍스트 윈도우가 뭐야?

AI 모델이 답을 만들 때 한 번에 볼 수 있는 텍스트의 최대량이다. 질문, 이전 대화, 첨부 문서, 답변까지 모두 이 한도 안에 들어가야 한다.

컨텍스트 윈도우와 학습 데이터는 무엇이 다른가?

학습 데이터는 모델이 훈련 때 본 자료이고 컨텍스트 윈도우는 지금 이 요청에서 보는 자료다. 앤트로픽은 이를 장기 지식과 작업 메모리의 차이로 설명한다.

클로드 컨텍스트 윈도우가 다 차면 어떻게 되는가?

API는 400 오류나 model_context_window_exceeded 중지로 알려 주고, 채팅 앱은 오래된 대화를 밀어낼 수 있다. 압축 기능을 켜거나 새 대화를 시작하면 된다.

컨텍스트 윈도우 토큰 수는 어떻게 세는가?

영어는 1토큰이 약 4글자, 100토큰이 약 75단어다. 한국어는 더 많은 토큰이 들므로 각 사의 토큰 카운팅 API나 토크나이저로 실측하는 편이 정확하다.

컨텍스트 윈도우를 비교할 때 무엇을 봐야 하는가?

숫자만 보면 안 된다. NoLiMa 실험에서 128K를 지원한다는 13개 모델 중 11개가 32K에서 성능이 반토막 났으므로, 실제 긴 입력에서의 정확도 곡선을 함께 봐야 한다.

참고 자료

우리 브랜드는 AI 답변에 나오고 있을까?

서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.

GEO 최적화 서비스 보기