컨텍스트 엔지니어링이란 무엇인가

컨텍스트 엔지니어링(Context Engineering)은 LLM이 답을 생성하는 시점에 컨텍스트 윈도우에 들어가는 정보 전체, 곧 시스템 프롬프트, 대화 이력, 검색 문서, 도구, 메모리를 골라 배치하는 설계 작업이다.

프롬프트 한 줄을 다듬는 일이 아니라 모델이 보는 정보 환경 전체를 다룬다. 앤트로픽은 이를 “추론 시점에 최적의 토큰 집합을 골라 유지하는 전략의 집합”으로 정의했다 (Anthropic, Effective context engineering for AI agents).

2025년 7월에는 관련 논문 1,400편 이상을 분석한 서베이 논문이 나와 학술 용어로도 자리 잡았다 (Mei et al., A Survey of Context Engineering for Large Language Models).

용어를 퍼뜨린 사람은 안드레이 카파시다. 2025년 6월 그는 “프롬프트 엔지니어링보다 컨텍스트 엔지니어링이라는 말이 낫다”며 이를 “다음 단계에 꼭 맞는 정보로 컨텍스트 윈도우를 채우는 섬세한 기술이자 과학”이라고 불렀다 (LangChain, Context Engineering for Agents).

쇼피파이 CEO 토비 뤼트케는 같은 달 “LLM이 과제를 그럴듯하게 풀 수 있도록 모든 맥락을 제공하는 기술”이라고 썼다 (Philipp Schmid, The New Skill in AI is Not Prompting, It’s Context Engineering).

컨텍스트 엔지니어링은 프롬프트 엔지니어링과 무엇이 다른가?

프롬프트 엔지니어링이 “어떻게 물을까”를 다룬다면, 컨텍스트 엔지니어링은 “무엇을 쥐여줄까”를 다룬다. 앤트로픽은 컨텍스트 엔지니어링을 “프롬프트 엔지니어링의 자연스러운 다음 단계”라고 부르고, 일래스틱은 프롬프트 엔지니어링을 컨텍스트 엔지니어링의 부분집합으로 본다 (Elastic, What is context engineering?).

구분프롬프트 엔지니어링컨텍스트 엔지니어링
다루는 것지시문 한 덩어리컨텍스트 윈도우에 들어가는 정보 전체
시점한 번의 요청여러 턴, 여러 도구 호출에 걸친 흐름
핵심 질문어떻게 물을까어떤 정보를 어떤 형식으로 언제 넣을까
구성 요소지시, 예시, 출력 형식시스템 프롬프트, 이력, 검색 결과, 도구, 메모리
주된 적용처챗봇 단발 질의AI 에이전트, RAG, 장기 작업

카파시가 지적한 대로 일상에서 프롬프트는 짧은 과제 설명을 뜻하지만, 실제 서비스에서는 프롬프트 바깥의 정보가 답의 질을 좌우한다. 그래서 프롬프트 엔지니어링을 버리는 것이 아니라 그 위에 한 층을 더 얹는 개념이다.

컨텍스트는 무엇으로 구성되는가?

컨텍스트 윈도우에 들어가는 재료는 크게 일곱이다. 필립 슈미드가 정리한 목록이 업계에서 널리 쓰인다 (Philipp Schmid, 위 인용).

구성 요소내용예
시스템 프롬프트역할, 규칙, 말투”당신은 SEO 감사 도우미다”
사용자 프롬프트이번 턴의 요청”이 페이지 title 태그 고쳐줘”
대화 이력단기 메모리앞선 10턴의 질문과 답
장기 메모리세션을 넘어 남는 정보사용자 선호, 과거 결정
검색된 정보RAG로 가져온 문서사내 가이드 문서 조각
도구호출 가능한 함수와 그 결과크롤러 API 응답
구조화된 출력답의 형식 정의JSON 스키마

일래스틱은 여기에 검색 단계의 세부 기술인 시맨틱 청킹, 하이브리드 검색, 리랭킹을 더해 아홉 개 블록으로 나눈다 (Elastic, 위 인용).

컨텍스트 엔지니어링은 왜 필요한가?

컨텍스트 윈도우가 커져도 모델이 그 안의 정보를 고르게 쓰지 못하기 때문이다. 크로마가 GPT-4.1, 클로드 4, 제미나이 2.5, Qwen3 등 18개 모델을 실험한 결과, 단순한 과제에서도 입력이 길어질수록 성능이 떨어졌고 이 현상을 “컨텍스트 부패(context rot)“라고 이름 붙였다 (Chroma Research, Context Rot).

같은 실험에서 약 300토큰짜리 압축 프롬프트와 약 11만 3천 토큰짜리 전체 프롬프트의 성능 차이는 모든 모델 계열에서 크게 벌어졌다 (Chroma Research, 위 인용).

위치도 문제다. 스탠퍼드 연구진은 관련 정보가 입력의 앞이나 끝에 있을 때 성능이 가장 높고 중간에 있으면 크게 떨어진다는 “Lost in the Middle” 현상을 보고했다 (Liu et al., Lost in the Middle: How Language Models Use Long Contexts).

대화가 길어져도 무너진다. 세일즈포스와 마이크로소프트 연구진이 주요 공개, 비공개 모델을 다중 턴으로 테스트하자 6개 생성 과제에서 평균 39% 성능이 떨어졌고, 초반에 잘못 짚은 모델은 이후 회복하지 못했다 (Laban et al., LLMs Get Lost In Multi-Turn Conversation).

데이터브릭스의 RAG 실험에서는 모델마다 성능이 꺾이는 지점이 달랐다. Llama 3.1 405B는 3만 2천 토큰, GPT-4 0125는 6만 4천 토큰, Claude 3 Sonnet은 1만 6천 토큰 뒤부터 떨어졌다 (Databricks, Long Context RAG Performance of LLMs).

컨텍스트는 어떤 방식으로 망가지는가?

드루 브루니그는 긴 컨텍스트의 실패를 네 가지로 나눴다 (Drew Breunig, How Long Contexts Fail).

실패 유형무슨 일이 생기는가예
오염(Poisoning)환각이나 오류가 컨텍스트에 들어가 계속 참조됨잘못 요약한 목표를 에이전트가 반복 추구
산만(Distraction)컨텍스트가 커져 모델이 학습 지식 대신 이력에 의존10만 토큰을 넘긴 에이전트가 과거 행동을 되풀이
혼동(Confusion)불필요한 정보가 답의 질을 떨어뜨림도구 46개를 주면 실패, 19개면 성공
충돌(Clash)새 정보가 기존 정보와 모순초반 가정과 뒤늦은 정보가 부딪혀 추론 이탈

브루니그가 인용한 버클리 함수 호출 리더보드에서는 모든 모델이 도구를 많이 줄수록 성능이 나빠졌다 (Drew Breunig, 위 인용).

컨텍스트 엔지니어링에는 어떤 기법이 있는가?

랭체인은 기법을 쓰기, 선택, 압축, 격리 네 묶음으로 정리했다 (LangChain, 위 인용).

  1. 쓰기(Write): 컨텍스트 윈도우 밖에 정보를 저장한다. 스크래치패드와 메모리가 여기 속한다.
  2. 선택(Select): 필요한 정보만 컨텍스트로 끌어온다. 메모리 검색, 도구 설명 선택, 지식 검색이 해당한다.
  3. 압축(Compress): 요약과 트리밍으로 필요한 토큰만 남긴다.
  4. 격리(Isolate): 서브 에이전트, 샌드박스, 상태 객체로 컨텍스트를 쪼갠다.

앤트로픽은 장기 작업용으로 세 가지 구체적 방법을 든다. 한계에 가까워지면 이력을 요약해 새로 시작하는 압축(compaction), 에이전트가 외부 메모리에 메모를 남기는 구조화 노트, 하위 에이전트가 요약만 돌려주는 서브 에이전트 구조다 (Anthropic, 위 인용).

목표는 하나로 요약된다. 앤트로픽은 “원하는 결과의 확률을 최대로 높이는 가장 작은 고신호 토큰 집합을 찾으라”고 말한다 (Anthropic, 위 인용).

실제 에이전트는 컨텍스트를 어떻게 설계하는가?

에이전트 서비스 마누스는 프레임워크를 네 번 다시 만들었는데, 매번 컨텍스트를 더 잘 다루는 방법을 찾았기 때문이었다 (Manus, Context Engineering for AI Agents: Lessons from Building Manus).

마누스가 공개한 수치가 컨텍스트 설계의 무게를 보여준다. 평균 입력 대 출력 토큰 비율은 약 100대 1이고, 한 과제에 도구 호출이 평균 50회 들어간다 (Manus, 위 인용).

그래서 첫 원칙이 KV 캐시 적중률이다. 캐시된 입력 토큰은 캐시되지 않은 토큰보다 10배 싸므로, 시스템 프롬프트 앞부분을 고정하고 타임스탬프 같은 가변 값을 넣지 않는다 (Manus, 위 인용).

코딩 에이전트 데빈을 만든 코그니션은 컨텍스트 엔지니어링을 “에이전트를 만드는 엔지니어의 1번 업무”라고 부르고, 하위 에이전트끼리 메시지 조각이 아니라 전체 흔적을 공유하라는 원칙을 세웠다 (Cognition, Don’t Build Multi-Agents).

한국에서 컨텍스트 엔지니어링은 얼마나 검색되는가?

한글 표기가 영문 표기를 넘어섰다. 구글 키워드 플래너 기준 “컨텍스트 엔지니어링”은 2025년 9월 월 720회에서 2026년 4월 1,300회로 올랐다가 8월 720회이고, “context engineering”은 같은 기간 880회에서 260회로 내려갔다 (서치폴라리스, 구글 키워드 플래너 2026-09-28 조회).

네이버 검색광고 기준 월 검색량은 PC 50회, 모바일 50회로 구글의 10분의 1 수준이다. 아직 개발자와 AI 실무자가 구글에서 찾는 용어다.

구글 자동완성에는 예시, 뜻, 기법, 구성요소, 책, 프롬프트 엔지니어링과의 비교가 붙는다. 구글 1페이지 9건 중 7건이 프롬프트 엔지니어링과의 차이를 다루는 이유다.

컨텍스트 엔지니어링에 대해 자주 묻는 질문은 무엇인가?

컨텍스트 엔지니어링은 RAG와 같은 것인가?

아니다. RAG는 외부 문서를 검색해 컨텍스트에 넣는 기법 하나이고, 컨텍스트 엔지니어링은 RAG를 포함해 시스템 프롬프트, 메모리, 도구까지 컨텍스트 전체를 설계하는 상위 개념이다.

컨텍스트는 많이 넣을수록 좋은가?

아니다. 크로마의 18개 모델 실험과 데이터브릭스의 13개 모델 실험 모두 일정 길이를 넘기면 성능이 떨어졌다.

앤트로픽의 기준은 “가장 작은 고신호 토큰 집합”이다.

컨텍스트 엔지니어링의 구성 요소는 무엇인가?

시스템 프롬프트, 사용자 프롬프트, 대화 이력, 장기 메모리, 검색된 정보, 도구, 구조화된 출력의 일곱이다. 위 구성 요소 표를 보면 된다.

컨텍스트 엔지니어링 예시로는 무엇이 있는가?

마누스의 KV 캐시 우선 설계, 앤트로픽의 압축과 구조화 노트, 코그니션의 전체 흔적 공유가 공개된 사례다. 클로드 코드나 커서 같은 코딩 도구가 프로젝트 규칙 파일과 코드베이스 인덱스를 자동으로 넣는 것도 같은 원리다.

개발자가 아니어도 알아야 하는가?

마케터와 기획자에게도 해당한다. AI 검색이 어떤 문서를 컨텍스트로 가져가는지가 곧 LLM 인용 여부를 가르므로, 문서를 기계가 읽기 쉽게 구조화하는 일이 컨텍스트 엔지니어링의 출발점이다.

참고 자료

우리 브랜드는 AI 답변에 나오고 있을까?

서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.

GEO 최적화 서비스 보기