한줄 요약: GEO는 챗GPT 같은 생성형 AI가 답변을 만들 때 우리 콘텐츠를 인용하도록 설계하는 작업입니다. 새로운 파일을 만들거나 특별한 마크업을 넣는 일이 아니라, 크롤러 접근을 열고 답이 되는 문서를 쓰는 일에 가깝습니다.
GEO(Generative Engine Optimization)는 챗GPT나 구글 AI Overviews 같은 생성형 AI가 답변을 만들 때 우리 콘텐츠를 인용하도록 설계하는 작업입니다. 검색 결과 목록에서 순위를 올리는 일과는 목표가 다르고, 측정하는 숫자도 다릅니다.
처음 시작할 때 세 가지만 정리하면 방향이 잡힙니다. 안 해도 되는 일이 생각보다 많고, 진짜 첫 관문은 콘텐츠가 아니라 크롤러 접근이고, 국내에서는 이미 업무 목적 검색이 옮겨가는 중입니다.
서치폴라리스가 구글과 오픈AI의 공식 문서, 그리고 GEO라는 용어를 만든 원논문을 직접 확인해 정리했습니다.
이 글에서 다루는 내용 - GEO라는 말이 어디서 나왔는가 - 구글이 직접 부정한 것들 - 크롤러는 하나가 아니라 역할이 나뉜다 - 논문이 알려준, 통한 방법과 안 통한 방법 - 지금 한국에서 이게 얼마나 급한가 - 첫 30일에 무엇을 하는가
GEO라는 말은 마케팅 업계가 아니라 논문에서 나왔다
용어부터 정리하고 갑니다. GEO는 지역(geography)의 약자가 아니에요. 국내에서 지역 타겟 마케팅과 혼동되는 일이 잦은데 전혀 다른 말입니다.
출처가 분명한 용어입니다. 프린스턴대와 조지아텍, 앨런AI연구소 연구진이 2023년 논문으로 공개하고 KDD 2024에 발표하면서 정의했어요. 연구진은 GEO-bench라는 벤치마크를 만들었습니다. 9개 데이터셋에서 모은 쿼리 1만 개에 각각 상위 검색결과 본문을 붙인 구조예요.
논문은 콘텐츠를 어떻게 쓰느냐만 바꿔도 생성형 엔진 답변 안에서의 가시성이 최대 40%까지 올라간다고 보고했습니다. 다만 저자들이 직접 단서를 달았어요. 효과는 도메인마다 다르다고요. 2023년 세대 엔진 기준이라 지금 모델에 그대로 적용된다는 보장도 없습니다.
숫자보다 중요한 게 있어요.
이 논문은 가시성을 단순 노출 횟수로 세지 않았습니다. 답변에서 얼마나 앞에 나오는지, 얼마나 많은 분량을 차지하는지, 품질 평가가 어떤지를 합친 지표로 정의했어요. GEO의 목표가 "링크가 걸리는 것"이 아니라 "답변 문장에 우리 내용이 들어가는 것"인 이유가 여기 있습니다. 용어 자체를 더 파려면 GEO와 SEO 비교에 차이를 나눠뒀어요.
구글이 직접 아니라고 말한 것들
초보자가 가장 많이 시간을 버리는 구간이 여기입니다. 업계 콘텐츠가 "GEO 필수"라고 말하는 항목 상당수를 구글은 공식 문서에서 부정했어요.
구글은 생성형 AI 기능 최적화 가이드에서 구글 검색 관점의 생성형 AI 검색 최적화는 곧 검색 경험을 위한 최적화이며 따라서 여전히 SEO라고 규정했습니다. AI를 위해 특별한 방식으로 글을 쓸 필요도, AI가 이해하기 쉽게 콘텐츠를 잘게 쪼갤 필요도 없다고 덧붙였어요.
llms.txt에 대한 서술은 더 직접적입니다. 구글은 검색에 노출되기 위해 새로운 기계 판독용 파일이나 AI 텍스트 파일, 별도 마크다운을 만들 필요가 없으며 구글 검색은 그것들을 무시한다고 적었어요. llms.txt가 사이트 가시성이나 순위에 도움도 해도 되지 않는다고 명시했습니다.
구조화 데이터도 마찬가지예요. 생성형 AI 검색에 구조화 데이터는 필수가 아니고 추가해야 할 특별한 schema.org 마크업도 없다고 했습니다. 다만 리치 결과 노출 자격 확보 같은 기존 SEO 목적으로는 계속 유효하다고 권고했어요.
한 가지는 분명히 해둡니다. 이건 전부 구글 한정 진술입니다.
챗GPT나 퍼플렉시티가 llms.txt를 읽는다는 공식 약속은 지금까지 나온 적이 없어요. Anthropic이나 Stripe 같은 회사가 자사 문서 사이트에 llms.txt 파일을 발행하는 것과, AI 엔진이 그 파일을 읽는다는 것은 완전히 다른 이야기입니다. 두 가지가 국내 콘텐츠에서 자주 섞여요. 파일 형식 자체가 궁금하면 llms.txt 설정 가이드에 배경을 정리해뒀습니다.
그래서 우리는 신규 고객사 온보딩에서 llms.txt를 1순위 과제로 넣지 않습니다. 만들지 말라는 뜻은 아니고, 그것보다 먼저 할 일이 확실히 있다는 뜻이에요.
크롤러는 하나가 아니고 역할이 다르다
진짜 첫 관문은 콘텐츠가 아니라 접근 권한입니다. 크롤러가 못 들어오는 사이트는 아무리 잘 써도 후보에 못 듭니다.

오픈AI는 공식 봇 문서에서 크롤러를 역할별로 나눠 운영한다고 밝혔습니다. GPTBot은 모델 학습용 수집이에요. OAI-SearchBot은 챗GPT 검색 기능에 사이트를 노출시키기 위한 인덱싱입니다. ChatGPT-User는 사용자가 질문했을 때 그 페이지를 실시간으로 방문하는 쪽이고요.
여기서 자주 나는 사고가 있어요. 학습에 쓰이는 게 싫어서 오픈AI 관련 봇을 통째로 막으면 챗GPT 검색 노출까지 같이 닫힙니다. GPTBot만 막고 OAI-SearchBot을 열어두는 선택이 가능한데, 이걸 모르고 와일드카드로 처리하는 경우가 많아요.
오픈AI 문서에는 더 중요한 단서도 있습니다. ChatGPT-User는 사용자가 개시한 행동이라 robots.txt 규칙이 적용되지 않을 수 있다고 적혀 있어요. 퍼플렉시티도 자사 봇 문서에서 Perplexity-User에 대해 같은 구조를 설명합니다.
robots.txt로 AI를 완전히 통제할 수 있다는 말은 사실이 아닙니다.
구글 쪽에는 헷갈리기 쉬운 항목이 하나 더 있어요. Google-Extended는 크롤러가 아니라 제미나이 모델 학습 사용 여부만 제어하는 토큰입니다. 구글은 이 토큰이 검색 노출이나 순위에 영향을 주지 않는다고 문서에 적었어요. 뒤집어 말하면 Google-Extended를 차단해도 AI Overviews 노출은 막지 못합니다. AI Overviews는 일반 Googlebot 인덱싱에 기반하니까요. 그쪽을 통제하려면 nosnippet 계열 지시자를 써야 합니다.
크롤러별 정리는 AI 크롤러 완전 정리에 표로 뒀어요.
크롤링이 인용으로 바로 이어지는 것도 아닙니다. 클라우드플레어(Cloudflare)가 2025년 7월 자사 네트워크의 AI 봇 트래픽을 목적별로 분류했더니 약 80%가 모델 학습 목적이었고, 검색 인덱싱과 사용자 요청 크롤링은 각각 5% 미만이었어요. 많이 긁어간다고 많이 인용되는 게 아니라는 뜻입니다.
논문이 알려준, 통한 방법과 안 통한 방법
무엇을 쓸지의 문제로 넘어가면 원논문이 가장 쓸모 있습니다. 실험으로 갈라놨거든요.
효과가 확인된 쪽은 세 가지였습니다. 출처 인용을 붙이고, 직접 인용문을 넣고, 통계 수치를 보강하는 방법이에요. 논문 지표 기준으로 위치 가중 노출량에서 30~40%, 주관적 인상 평가에서 15~30%의 상대적 개선을 기록했습니다.
안 통한 쪽이 더 흥미로워요.
키워드 스터핑은 거의 또는 전혀 개선 효과가 없었습니다. 전통 SEO에서 오래 통했던 반복 삽입이 생성형 엔진에서는 힘을 잃었다는 뜻이에요. 10년 쌓은 SEO 습관을 그대로 옮기면 안 되는 이유가 실험으로 나온 셈입니다.
작은 사이트에 유리한 결과도 있었어요. 검색결과 5위권 사이트가 출처 인용 전술을 적용했을 때 답변 내 가시성이 115.1% 늘어난 반면, 최상위 사이트는 오히려 줄었습니다. 논문 본문 표에서 나온 수치이고 단일 실험 결과라 일반화는 조심해야 해요.
~~그래도 이 결과를 보고 마음이 좀 놓였습니다.~~
방향은 단순합니다. 남들이 쓴 말을 다시 쓰는 대신, 우리만 가진 숫자와 확인 가능한 출처를 붙이는 쪽이 유리해요. 실행 순서 전체는 GEO 최적화 완벽 가이드에 단계별로 정리돼 있습니다.
지금 한국에서 이게 얼마나 급한가
"아직 이른 거 아니냐"는 질문이 가장 많이 나옵니다. 국내 통계로 답할 수 있어요.
과학기술정보통신부와 한국지능정보사회진흥원의 2025 인터넷이용실태조사에서 생성형 AI 이용 경험률은 44.5%였습니다. 전년 33.3%에서 11.2%포인트 올랐어요. 전국 22,671가구, 만 3세 이상 50,750명을 방문 면접한 국가승인통계입니다.
직업별로 쪼개면 B2B 마케터에게 의미가 달라집니다. 사무직 경험률이 71.9%였어요. 서비스별로는 챗GPT 41.8%, 제미나이 9.8%, 코파일럿 2.2%, 클로바X 2.0% 순이었습니다.
우리가 설득해야 할 담당자 10명 중 7명이 이미 쓰고 있다는 뜻이에요.
검색 채널 자체는 아직 네이버가 지킵니다. 오픈서베이가 2026년 7월 전국 1,000명을 조사한 결과 뉴스와 생활정보 검색에서는 네이버 주 이용률이 60%대를 유지했어요. 다만 업무와 학습 목적 검색에서는 36.5%가 생성형 AI를 쓴다고 답했습니다. 자사 패널 조사라 국가 통계와 무게가 다르다는 점은 감안해야 해요.
용도에 따라 갈리는 중입니다. 그리고 먼저 넘어간 쪽이 하필 업무 목적이에요. B2B 구매 검토가 정확히 그 영역입니다.
솔직하게 덧붙이면, 국내 사이트 기준으로 AI 검색 때문에 유입이 얼마나 변했는지 실측한 공개 데이터를 찾지 못했습니다. 국내 수치를 제시하는 자료 대부분이 미국 조사를 옮겨온 것이에요. 아직 확실하지 않은 영역입니다.
첫 30일에 실제로 하는 것
순서를 잡는 게 전부입니다. 앞 단계가 막혀 있으면 뒤 단계는 의미가 없어요.

1주차는 접근 점검입니다. robots.txt에서 OAI-SearchBot, Claude-SearchBot, PerplexityBot이 허용돼 있는지 봅니다. 학습용 봇을 막을지는 회사 정책이니 따로 결정하되, 검색 노출용 봇까지 같이 닫혀 있는지를 반드시 확인해요. 클라우드플레어 같은 방화벽의 AI 봇 카테고리도 별도로 봐야 합니다. robots.txt를 풀어도 그쪽에서 막히면 소용이 없어요.
2주차는 질문 정리입니다. 우리 제품과 관련해 사람들이 실제로 던지는 질문 20개를 뽑고, 각 질문에 대응하는 문서의 첫 문단을 곧바로 답이 되게 고칩니다. 서론과 인사말로 시작하는 문서는 인용할 청크가 없어요.
3주차는 근거 보강입니다. 논문에서 효과가 확인된 쪽으로 갑니다. 각 문서에 1차 출처 링크를 두 개 이상 붙이고, 우리만 가진 숫자를 하나씩 넣어요. 남의 요약을 옮긴 문장은 인용 대상이 되기 어렵습니다.
4주차는 기준선 확보예요. 지금 상태를 기록해두는 단계입니다. 이걸 안 하면 두 달 뒤에 나아졌는지 아닌지를 말할 수 없어요.
측정에서 초보자가 가장 많이 오해하는 지점을 하나 짚어둡니다. GA4에 2026년 5월 AI 어시스턴트 기본 채널이 추가됐는데, 구글 애널리틱스 공식 문서는 이 채널이 구글의 AI Overviews와 AI Mode를 제외한다고 명시했어요. 이 숫자를 "우리 AI 성과 전체"로 읽으면 틀립니다.
서치폴라리스가 국내 팀들과 일하면서 본 첫 달 실패 패턴은 대부분 순서 문제였어요. 콘텐츠부터 손대고 크롤러 점검을 마지막에 하는 경우입니다. 그러면 한 달치 작업이 통째로 안 잡힌 채로 지나갑니다.
이런 경우엔 GEO를 뒤로 미루세요.
전환 대부분이 오프라인 지역 방문에서 나오는 사업이라면 지도와 지역 검색이 먼저입니다. 생성형 답변은 아직 로컬 추천에서 약해요. 사이트가 색인조차 안 되는 상태여도 순서가 다릅니다. 색인과 크롤링을 먼저 정리해야 합니다. 브랜드 메시지가 아직 안 잡힌 초기 단계 서비스도 마찬가지예요. 무엇으로 알려질지가 정해지지 않으면 인용될 문장 자체가 없습니다.
GEO를 처음 접하면 새로 배워야 할 게 많아 보입니다. 실제로 해보면 반대예요. 버려야 할 습관을 가려내는 일에 더 가깝습니다.
키워드를 더 넣는 습관, 서론으로 문서를 여는 습관, 남들이 쓴 내용을 정리해 다시 쓰는 습관. 셋 다 예전 검색에서는 비용이 크지 않았는데 지금은 그대로 손해가 됩니다. 반대로 출처를 밝히고 우리 숫자를 내놓는 일은 예전에 품이 많이 든다는 이유로 미뤄졌던 작업이에요.
다음 질문이 이어집니다. 우리 사이트에서 검색 노출용 AI 봇이 실제로 열려 있나, 핵심 질문 20개 중 첫 문단이 곧바로 답인 문서는 몇 개인가, 그리고 오늘 챗GPT에 우리 회사를 물으면 뭐라고 답하나. 마지막 질문은 지금 바로 해볼 수 있고, 대개 그 답이 출발점이 됩니다.
자주 묻는 질문
GEO가 정확히 무엇인가요? SEO와 어떻게 다른가요?
GEO는 생성형 AI가 답변을 만들 때 우리 콘텐츠를 인용하도록 설계하는 작업입니다. 지역(geography)과는 무관하며 Generative Engine Optimization의 약자입니다. SEO가 검색 결과 목록에서의 순위를 목표로 한다면 GEO는 답변 문장 안에 들어가는 것을 목표로 합니다. 다만 구글은 공식 문서에서 구글 검색 관점의 생성형 AI 최적화는 결국 검색 경험 최적화이며 여전히 SEO라고 규정했으므로, 완전히 별개의 작업으로 보기보다 목표 지표가 다른 확장으로 이해하는 편이 정확합니다.
llms.txt 파일을 꼭 만들어야 하나요?
필수가 아닙니다. 구글은 공식 문서에서 검색 노출을 위해 새로운 기계 판독용 파일을 만들 필요가 없으며 구글 검색은 그런 파일을 무시한다고 명시했고, llms.txt가 사이트 가시성이나 순위에 도움도 해도 되지 않는다고 적었습니다. 다른 주요 AI 기업 중 llms.txt를 읽겠다고 공식적으로 약속한 곳도 확인되지 않습니다. 일부 기업이 자사 문서 사이트에 llms.txt를 발행하는 것과 AI 엔진이 그것을 읽는 것은 다른 이야기입니다.
구조화 데이터를 넣으면 AI 답변에 인용될 확률이 올라가나요?
구글 기준으로는 필수가 아닙니다. 구글은 생성형 AI 검색에 구조화 데이터가 필요하지 않으며 추가해야 할 특별한 schema.org 마크업도 없다고 밝혔습니다. 다만 리치 결과 노출 자격 등 기존 SEO 목적으로는 계속 유효하다고 권고합니다. 이는 구글 검색에 한정된 진술이며 챗GPT나 퍼플렉시티에 대한 언급은 아닙니다.
AI 크롤러를 막아야 하나요, 열어줘야 하나요?
역할을 나눠서 판단해야 합니다. 오픈AI 공식 문서 기준으로 GPTBot은 모델 학습용 수집이고 OAI-SearchBot은 챗GPT 검색 노출을 위한 인덱싱입니다. 학습 이용이 부담스러우면 GPTBot만 제한하고 검색 노출용 봇은 열어두는 선택이 가능합니다. 한꺼번에 차단하면 검색 노출 경로까지 닫힙니다. 또한 ChatGPT-User와 Perplexity-User는 사용자가 개시한 요청이라 robots.txt 규칙이 적용되지 않을 수 있습니다.
Google-Extended를 차단하면 AI Overviews에 안 나오나요?
아닙니다. Google-Extended는 제미나이 모델 학습 사용 여부만 제어하는 토큰이며 구글은 이것이 검색 노출이나 순위에 영향을 주지 않는다고 문서에 적었습니다. AI Overviews는 일반 Googlebot 인덱싱에 기반하므로 Google-Extended 차단으로는 막을 수 없고, nosnippet이나 max-snippet 같은 스니펫 제어 지시자를 써야 합니다.
GEO를 시작하면 기존 SEO는 그만둬야 하나요?
아닙니다. 구글 공식 문서는 생성형 AI 검색을 위한 최적화가 여전히 SEO라고 규정했고, 색인되지 않은 페이지는 AI 기능에도 노출되지 않습니다. 다만 원논문 실험에서 키워드 스터핑은 생성형 엔진 답변에서 거의 효과가 없었으므로, 반복 삽입 같은 일부 전통적 습관은 옮겨오지 않는 편이 낫습니다.
국내에서 GEO가 지금 급한 상황인가요?
업무 목적 검색에서는 이미 이동이 시작됐습니다. 과학기술정보통신부 2025 인터넷이용실태조사에서 생성형 AI 이용 경험률은 44.5%였고 사무직은 71.9%였습니다. 오픈서베이가 2026년 7월 1,000명을 조사한 결과 뉴스와 생활정보 검색은 네이버 주 이용률이 60%대를 유지했지만 업무와 학습 목적 검색의 36.5%는 생성형 AI로 이동했습니다. 다만 국내 사이트 기준 AI 검색 유입 변화를 실측한 공개 데이터는 아직 없습니다.