크롤러빌리티(Crawlability)는 구글봇 같은 검색엔진 크롤러가 웹사이트의 페이지를 발견하고 접근해 내용을 가져올 수 있는 상태를 뜻하는 테크니컬 SEO 용어다.
robots.txt 차단, 서버 오류, 로그인 요구, 끊긴 내부 링크처럼 크롤러의 접근을 막는 요인이 없을수록 크롤러빌리티가 높다.
크롤링이 크롤러가 페이지를 가져오는 행위라면, 크롤러빌리티는 그 행위가 가능한 상태인지를 가리킨다. 구글은 검색의 첫 단계로 크롤링을 들면서 “크롤링 여부는 Google 크롤러가 사이트에 액세스할 수 있는지에 따라 다릅니다”라고 적는다 (Google 검색 센터, Google 검색의 작동 방식).
크롤러빌리티는 크롤러가 페이지에 들어갈 수 있는가를, 인덱서빌리티는 들어간 페이지를 색인에 저장할 수 있는가를 따진다. 크롤링은 됐는데 색인이 안 되는 페이지가 흔하기 때문에 둘은 따로 점검한다.
| 구분 | 크롤러빌리티 | 인덱서빌리티 |
|---|---|---|
| 질문 | 크롤러가 URL을 발견하고 가져올 수 있는가 | 가져온 페이지를 색인에 넣을 수 있는가 |
| 막는 요인 | robots.txt 차단, 5xx 오류, 로그인, 방화벽 차단, 링크 없음 | noindex, 캐노니컬 지정, 중복 콘텐츠, 품질 미달 |
| 확인 보고서 | 크롤링 통계 보고서, 서버 로그 | 페이지 색인 생성 보고서 |
| 순서 | 먼저 통과해야 함 | 크롤링 뒤에 판정됨 |
구글은 검색에 노출되기 위한 기술 요구사항을 “Googlebot이 차단되지 않음, 페이지가 작동함, 페이지에 색인 생성 가능한 콘텐츠가 있음” 세 가지로 정리한다 (Google 검색 센터, Google 검색의 기술 요구사항). 앞의 둘이 크롤러빌리티, 마지막이 인덱서빌리티에 해당한다.
robots.txt는 자주 혼동되는 지점이다. robots.txt는 크롤링만 막을 뿐 색인을 막는 장치가 아니어서, 구글은 “robots.txt에서 허용되지 않은 페이지라도 다른 사이트에서 연결된 경우 여전히 색인이 생성될 수 있습니다”라고 경고한다 (Google 검색 센터, robots.txt 소개). 검색에서 페이지를 빼고 싶으면 크롤링을 막는 대신 noindex를 쓴다.
크롤러가 가져오지 못한 페이지는 색인도 순위도 받을 수 없기 때문이다. 콘텐츠 품질이나 백링크는 크롤링이 된 다음에야 평가된다.
구글은 “일반 사용자가 액세스할 수 있으며 크롤러 Googlebot이 페이지를 크롤링하지 못하도록 차단하지 않는 웹상의 페이지만 색인을 생성합니다”라고 밝히고, 로그인해야 볼 수 있는 페이지는 크롤링하지 않는다고 적는다 (Google 검색 센터, Google 검색의 기술 요구사항).
크롤러빌리티는 크롤링 속도에도 영향을 준다. 구글은 사이트가 일관되게 응답하고 응답 시간이 안정적이면 크롤링 용량 한도를 올리고, 느려지거나 서버 오류가 나면 한도를 내린다고 설명한다 (Google 검색 센터, 크롤링 예산 최적화). 접근이 불안정한 사이트는 들어오는 크롤러 수 자체가 줄어든다.
크롤러가 URL을 모르거나, 알아도 못 들어가거나, 들어가도 내용을 못 읽는 세 가지 경우로 나뉜다. 구글은 Googlebot의 접근 문제로 서버 문제, 네트워크 문제, robots.txt 규칙 문제 셋을 꼽는다 (Google 검색 센터, Google 검색의 작동 방식).
| 단계 | 저해 요인 | 구글의 처리 |
|---|---|---|
| 발견 | 내부 링크가 없는 고아 페이지, 사이트맵 누락 | 링크나 사이트맵으로 발견되지 않은 URL은 크롤링 대상에 들지 못함 |
| 접근 | robots.txt의 Disallow 규칙 | 차단된 URL은 크롤링하지 않음 |
| 접근 | robots.txt 자체가 5xx 응답 | 처음 12시간 동안 사이트 크롤링을 중단하고 파일 가져오기만 재시도 |
| 접근 | 페이지 5xx 서버 오류, 429 | 크롤링 속도를 낮추고, 오류가 계속되면 색인에서 삭제 |
| 접근 | 로그인, 방화벽이나 CDN의 봇 차단 | 비공개 페이지는 크롤링하지 않음 |
| 접근 | 리디렉션 체인 | 기본적으로 최대 10개 홉까지만 따라감 |
| 읽기 | 자바스크립트로만 렌더링되는 본문, 차단된 CSS와 JS 리소스 | 렌더링에 필요한 리소스가 막히면 페이지를 제대로 분석하지 못함 |
robots.txt 서버 오류는 한 파일이 사이트 전체를 멈추는 경우라 따로 봐야 한다. 구글은 robots.txt를 찾았지만 가져올 수 없으면 처음 12시간 동안 크롤링을 중단하고, 이후 30일 동안은 마지막으로 유효했던 버전을 쓰며, 캐시된 버전이 없으면 크롤링 제한이 없는 것으로 간주한다고 밝힌다 (Google 검색 센터, Google에서 robots.txt 사양을 해석하는 방법). 반대로 404 같은 4xx는 유효한 robots.txt가 없는 것으로 처리해 제한 없이 크롤링한다.
페이지의 서버 오류는 크롤링 속도를 깎는다. 구글은 5xx와 429 오류를 받으면 크롤링 속도를 낮추고, 감소 폭은 오류를 반환하는 URL 수에 비례하며, 지속적으로 서버 오류를 반환하는 URL은 색인에서 삭제한다고 적는다 (Google 검색 센터, HTTP 상태 코드가 Google 크롤러에 미치는 영향). 같은 문서는 크롤링 속도를 줄이려고 401이나 403을 쓰지 말라고도 적는다.
리소스 차단도 흔한 실수다. 구글은 robots.txt로 스크립트나 스타일 파일을 막아도 되지만, “이러한 리소스가 없이는 Google 크롤러가 페이지를 이해하기 어렵다면 차단해서는 안 됩니다”라고 적는다 (Google 검색 센터, robots.txt 소개).
크롤러가 실제로 받은 응답을 보는 것이 기준이다. 브라우저에서 잘 열리는 것과 크롤러에게 열리는 것은 다를 수 있다.
https://도메인/robots.txt가 200으로 열리는지, 색인하고 싶은 경로가 Disallow에 걸려 있지 않은지 본다. 5xx가 나면 가장 먼저 고친다.curl -A "Googlebot/2.1" URL처럼 봇 이름을 달아 요청해 방화벽이나 CDN이 403을 돌려주지 않는지 본다. 브라우저에서는 200인데 봇에게만 403이면 보안 설정이 크롤러를 막고 있는 것이다.사이트 전체를 훑으려면 Screaming Frog, Ahrefs Site Audit 같은 크롤러를 구글봇 설정으로 돌려 응답 코드와 차단 URL 목록을 받는다. 다만 이 도구들은 구글이 아니므로 최종 판정은 서치콘솔과 로그로 한다.
막는 요인을 없애고, 발견 경로를 넓히고, 응답을 안정시키는 순서다. 구글이 크롤링 예산 문서에서 권하는 방법이 그대로 적용된다 (Google 검색 센터, 크롤링 예산 최적화).
필요하다. ChatGPT, 클로드, 퍼플렉시티 같은 AI 검색이 페이지를 인용하려면 각 서비스의 AI 크롤러가 먼저 페이지를 가져와야 하고, 이 크롤러들도 robots.txt와 서버 응답, 방화벽 규칙의 영향을 똑같이 받는다.
구글 검색용 크롤러빌리티와 AI 크롤러용 크롤러빌리티는 따로 관리된다. GPTBot, ClaudeBot, Google-Extended 같은 봇을 robots.txt에서 이름으로 막는 사이트가 많아서, 구글에는 열려 있어도 AI 검색에는 닫혀 있는 사이트가 생긴다.
2026년 10월 8일 네이버, 다음, 쿠팡, 11번가, G마켓, 조선일보, 중앙일보, 한겨레, 나무위키, 무신사, 컬리, 예스24, 한국경제, 매일경제, 동아일보, 올리브영, SSG, 다나와, 인벤, 디시인사이드의 robots.txt를 일반 브라우저 유저 에이전트로 받아 봇별 규칙을 읽었다.
| 항목 | 결과 |
|---|---|
| robots.txt가 403으로 막혀 읽지 못한 사이트 | 2곳 (쿠팡, 올리브영) |
| Googlebot을 전체 차단한 사이트 | 0곳 |
| GPTBot을 전체 차단한 사이트 | 7곳 (이름을 지정해 차단 6곳, 와일드카드 규칙으로 차단 1곳) |
| ClaudeBot을 전체 차단한 사이트 | 6곳 |
구글봇을 전부 막은 곳은 없었지만 세 곳 중 한 곳꼴로 ChatGPT의 크롤러를 전면 차단하고 있었다. 언론사 4곳(조선, 중앙, 한겨레, 매경)과 커뮤니티(디시인사이드), 오픈마켓(G마켓)이 여기 들었다.
robots.txt 자체가 403인 두 곳은 봇 관리 서비스가 일반 요청까지 걸러낸 경우다. 구글은 4xx robots.txt를 제한 없음으로 처리하지만, 같은 방화벽이 페이지 요청까지 막으면 크롤러는 아무것도 가져가지 못한다.
같은 날 이 사이트의 /wiki/geo/를 Googlebot, GPTBot, ClaudeBot 유저 에이전트로 각각 요청했을 때는 셋 다 200으로 본문이 내려왔다. AI 검색 인용을 목표로 하는 사이트라면 이 확인을 발행 절차에 넣어 두는 편이 안전하다.
구글이 보는 결과가 기준이므로 서치콘솔의 URL 검사와 크롤링 통계 보고서가 1순위다. 사이트 전체를 한 번에 훑으려면 Screaming Frog SEO Spider, Ahrefs Site Audit, Semrush Site Audit 같은 크롤러를 쓰고, robots.txt 규칙은 구글의 robots.txt 보고서로 확인한다.
크롤러빌리티를 먼저 본다. 크롤링이 안 된 페이지는 색인 판정 자체를 받지 못하므로, 서치콘솔 페이지 색인 생성 보고서에서 “발견됨, 현재 색인이 생성되지 않음”이나 “크롤링됨, 현재 색인이 생성되지 않음” 같은 사유를 읽기 전에 robots.txt와 서버 응답부터 확인한다.
서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.