크롤링이란? 구글봇이 페이지를 모으는 방식과 색인과의 차이

크롤링 (Crawling) 뜻 썸네일

크롤링(Crawling)은 검색엔진이 크롤러라는 자동화된 프로그램으로 웹을 돌아다니며 새 페이지나 변경된 페이지를 찾아 그 내용을 내려받는 과정입니다. 검색이 이뤄지는 세 단계 중 첫 번째이고, 여기서 발견되지 않은 페이지는 이후 어떤 단계에도 들어가지 못합니다.

크롤링 뜻

크롤러는 이미 알고 있는 주소에서 출발해 그 페이지 안의 링크를 따라가며 새 주소를 발견합니다. 사이트맵을 제출하면 링크를 타지 않고도 주소를 알려줄 수 있습니다. 구글 검색 센터 문서는 이 과정을 “크롤러가 웹을 검색해 신규 또는 업데이트된 페이지를 찾는 것”으로 설명합니다.

크롤러는 텍스트뿐 아니라 이미지·동영상 파일도 함께 내려받습니다. 구글의 크롤러는 Googlebot, 네이버는 Yeti, AI 서비스는 GPTBot·ClaudeBot처럼 각자 다른 이름으로 다닙니다. 이름이 다르므로 어느 크롤러를 허용할지 따로 정할 수 있습니다.

크롤러가 알고 있는 페이지에서 링크를 따라 새 페이지를 발견하고, 사이트맵으로 주소를 전달받는 과정 도식
크롤러는 이미 알고 있는 주소에서 출발해 링크를 따라 새 주소를 찾고, 사이트맵은 링크 없이도 주소를 알려줍니다.

크롤링과 색인은 다른 일입니다

둘을 같은 말로 쓰는 경우가 많은데 단계가 다릅니다. 크롤링된 페이지가 전부 색인되는 것도 아닙니다. 내용이 얇거나 다른 페이지와 중복되면 크롤링은 됐어도 색인에서 빠집니다.

크롤링색인 생성
목적페이지를 발견하고 내려받기내용을 분석해 저장하기
결과페이지 원문 확보검색 대상에 포함
막는 방법robots.txtnoindex 메타 태그

이 차이가 실무에서 중요한 이유가 있습니다. robots.txt로 크롤링을 막으면 오히려 색인에서 빼기 어려워집니다. 크롤러가 페이지에 들어오지 못하면 그 안의 noindex 지시문도 읽지 못하기 때문입니다. 색인에서 빼고 싶다면 크롤링은 허용하고 noindex를 읽게 해야 합니다.

robots.txt로 차단한 경우 noindex를 읽지 못하고, 크롤링을 허용한 경우 noindex를 읽어 색인에서 빠지는 두 경우 비교 도식
robots.txt로 크롤링을 막으면 크롤러가 페이지 안의 noindex를 읽지 못해, 색인에서 빼려면 크롤링은 허용해야 합니다.

웹 스크래핑과는 무엇이 다른가

일상에서 “크롤링”은 웹사이트에서 가격, 게시글, 리뷰 같은 데이터를 자동으로 긁어 모으는 일을 가리키는 말로도 자주 쓰입니다. 그래서 이 단어를 찾아보면 검색엔진 이야기와 데이터 수집 이야기가 섞여 나옵니다. 데이터 수집 쪽은 엄밀히 웹 스크래핑(Web Scraping)이라고 부르고, 이 글에서 다루는 검색엔진의 크롤링과는 목적이 다릅니다.

구분검색엔진 크롤링웹 스크래핑
목적검색에 쓸 페이지를 발견하고 색인하기특정 데이터를 뽑아내기
주체Googlebot 같은 검색엔진 크롤러누구나 만든 스크립트나 도구
범위링크를 따라 웹 전체로 넓게정해 둔 페이지의 정해 둔 항목만
robots.txt따르는 것이 일반적무시하는 경우도 있음

두 작업 모두 자동화된 프로그램이 페이지를 내려받는다는 점은 같아서, 스크래핑 도구도 여러 페이지를 돌기 위해 링크를 따라가는 크롤링 과정을 거치기도 합니다. 차이는 내려받은 뒤에 있습니다. 검색엔진 크롤러는 페이지 전체를 가져가 검색 결과에 보여줄 후보로 삼고, 스크래핑은 페이지에서 필요한 칸의 값만 골라 따로 저장합니다.

사이트 운영자가 크롤러에게 접근 범위를 알리는 표준 수단은 robots.txt입니다. Googlebot처럼 잘 관리되는 크롤러는 이 규칙을 따르지만, robots.txt는 접근을 기술적으로 막는 장치가 아니라 요청에 가까워서 스크래핑 스크립트가 따르지 않을 수도 있습니다.

구글은 얼마나 자주, 얼마나 많이 크롤링하나

구글은 사이트마다 크롤링 빈도와 분량을 알고리즘으로 정하고, 돈을 받고 더 자주 크롤링해 주지는 않습니다. 검색 센터 문서는 “Googlebot은 알고리즘 과정을 통해 어느 사이트를, 얼마나 자주, 사이트마다 몇 페이지를 가져올지 정한다”고 설명하고, 발견한 페이지를 전부 크롤링하지도 않는다고 적습니다.

이 한도를 흔히 크롤 예산(크롤 버짓)이라고 부릅니다. 구글의 크롤 예산 관리 문서는 이를 “구글이 크롤링할 수 있고, 크롤링하고 싶어 하는 URL의 집합”으로 정의하고 두 요소로 나눕니다.

요소뜻무엇에 따라 달라지나
크롤링 용량 한도서버에 부담을 주지 않는 선에서 구글이 쓸 수 있는 최대 연결량응답 속도, 오류 비율, 구글 쪽 자원
크롤링 수요구글이 그 사이트를 크롤링하고 싶어 하는 정도사이트 규모, 업데이트 빈도, 콘텐츠 품질·인기도

대부분의 사이트는 크롤 예산을 걱정할 필요가 없습니다. 같은 문서는 이 관리가 필요한 경우를 고유 페이지 100만 개 이상이면서 내용이 주 1회 정도 바뀌는 대형 사이트, 1만 개 이상이면서 매일 크게 바뀌는 사이트, URL 상당수가 ‘발견됨 – 현재 색인이 생성되지 않음’ 상태인 사이트로 한정합니다. 새 글이 발행 당일 크롤링된다면 읽지 않아도 된다고까지 적고 있습니다.

한 번에 가져가는 양에도 한도가 있습니다. Googlebot 문서(2026년 2월 갱신)에 따르면 Googlebot은 지원하는 파일 형식의 앞부분 2MB, PDF는 앞부분 64MB까지만 크롤링하고, 평균적으로 몇 초에 한 번보다 자주 사이트에 접근하지 않도록 설계돼 있습니다. HTML 하나가 2MB를 넘는 경우는 드물지만, 본문 뒤쪽에 중요한 내용이 있는 아주 긴 페이지라면 확인해 볼 만합니다.

서버가 크롤링 속도에 영향을 주기도 합니다. 구글 문서는 서버가 500, 503, 429 응답을 돌려주면 Googlebot이 크롤링 속도를 낮춘다고 설명합니다. 다만 같은 URL에서 이 응답이 여러 날 이어지면 색인에서 빠질 수 있어, 1~2일 넘게 쓰지 말라고 권합니다.

AI 크롤러는 무엇이 다른가

AI 크롤러는 자바스크립트를 실행하지 않는 경우가 많고, 가져가는 양에 비해 돌려주는 방문이 훨씬 적습니다. 구글은 크롤링 과정에서 최신 버전의 Chrome으로 페이지를 렌더링하고 자바스크립트를 실행한다고 검색 센터 문서에 밝히고 있습니다. 반면 호스팅 업체 Vercel이 2024년 12월 자사 네트워크의 크롤러 요청을 분석한 결과, GPTBot·ClaudeBot 등 주요 AI 크롤러는 자바스크립트 파일을 내려받기는 해도 실행하지는 않았습니다. 같은 조사에서 한 달 동안 GPTBot 요청은 5억 6,900만 건, Claude 크롤러는 3억 7,000만 건으로 Googlebot(45억 건)의 10분의 1 안팎이었고, 두 AI 크롤러 모두 요청의 약 34%가 404 페이지로 향했습니다.

자바스크립트로 본문을 그리는 사이트라면 구글에는 보이는 내용이 AI 크롤러에는 빈 페이지로 보일 수 있다는 뜻입니다. 핵심 내용은 서버에서 완성된 HTML로 내려주는 편이 안전합니다.

크롤링과 유입의 교환 비율도 다릅니다. Cloudflare가 2025년 8월 자사 네트워크 데이터로 발표한 분석에서 2025년 7월 기준 방문 1회를 보내는 동안 가져간 페이지 수(크롤링 대비 유입 비율)는 구글 5.4, OpenAI 1,091, Anthropic 38,066이었습니다. AI 크롤링의 79%는 모델 학습 목적이었고 검색 목적은 17%였습니다. Cloudflare는 이 지표를 처음 공개한 2025년 7월 글에서 앱에서 들어오는 방문은 출처 정보가 남지 않아 AI 쪽 비율이 과장됐을 수 있다고 스스로 밝혔습니다. 숫자의 크기보다 차이의 방향으로 읽는 것이 맞습니다. 앞에서 본 것처럼 크롤러별로 허용 여부를 따로 정할 수 있으므로, 학습용 크롤러와 검색·답변용 크롤러를 구분해 판단할 수 있습니다.

크롤링 대비 유입 비율 막대그래프(로그 눈금): 구글 5.4, OpenAI 1,091, Anthropic 38,066
2025년 7월 기준, 방문 1회를 보내는 동안 가져간 페이지 수는 구글 5.4, OpenAI 1,091, Anthropic 38,066이었습니다(앱 유입 미집계로 AI 쪽이 과장됐을 수 있음). 출처: Cloudflare

크롤링되지 않는 흔한 이유

  • 어디에서도 링크되지 않은 페이지입니다. 만들어 두고 메뉴나 목록에 연결하지 않으면 크롤러가 갈 길이 없습니다. 사이트맵에도 없으면 사실상 존재하지 않는 페이지입니다.
  • robots.txt가 막고 있습니다. 개발 중에 전체를 차단해 두고 오픈 후 푸는 것을 잊는 경우가 특히 흔합니다.
  • 로그인해야 볼 수 있습니다. 크롤러는 로그인하지 않으므로 회원 전용 페이지는 보지 못합니다.
  • 자바스크립트로만 링크가 만들어집니다. 클릭해야 주소가 생기는 구조라면 크롤러가 따라가기 어렵습니다.
  • 서버가 느리거나 자주 오류를 냅니다. 크롤러는 사이트에 부담을 주지 않으려고 속도를 조절하므로, 응답이 느리면 방문 빈도가 줄어듭니다.

크롤링됐는지 확인하는 법

가장 확실한 것은 서버 로그입니다. 어떤 크롤러가 언제 어느 주소를 요청했는지 그대로 기록돼 있습니다. 구글 서치 콘솔의 URL 검사 기능으로도 특정 페이지의 마지막 크롤링 시점을 볼 수 있습니다.

사이트 전체의 크롤링 추세는 서치 콘솔의 크롤링 통계 보고서(설정 → 크롤링 통계)에서 봅니다. 구글 고객센터 문서에 따르면 이 보고서는 최근 90일 동안의 데이터를 보여줍니다.

  • 총 크롤링 요청 수·다운로드 크기·평균 응답 시간: 응답 시간이 늘어나는 시기에 요청 수가 줄었다면 서버 속도를 의심해 볼 수 있습니다.
  • 호스트 상태: robots.txt를 가져오지 못했거나 DNS·서버 연결에 문제가 있었는지 표시합니다.
  • 응답별 분류: 200, 301, 404, 5XX 등 상태 코드별로 요청이 얼마나 되는지 나눠 보여줍니다.
  • 목적별 분류: 처음 크롤링한 ‘발견’과 이미 아는 페이지를 다시 가져간 ‘새로고침’으로 나뉩니다. 새 글을 올려도 ‘발견’ 비중이 거의 없다면 새 주소가 크롤러에게 잘 전달되지 않을 가능성을 생각해 볼 수 있습니다.
  • Googlebot 유형별 분류: 스마트폰·데스크톱·이미지 등 어떤 크롤러가 왔는지 보여줍니다.
구글 서치 콘솔 크롤링 통계 보고서 화면: 총 크롤링 요청 수, 총 다운로드 크기, 평균 응답 시간 카드와 크롤링 요청 추이 그래프
서치 콘솔 크롤링 통계 보고서는 총 크롤링 요청 수, 총 다운로드 크기, 평균 응답 시간을 기간별 추이와 함께 보여줍니다(2020년 11월 공개 당시 화면). 출처: Google 검색 센터 (CC BY 4.0)

구글은 이 보고서를 고급 사용자용으로 분류하고, 페이지가 1,000개 미만인 사이트는 대개 이 수준의 분석이 필요 없다고 안내합니다. 작은 사이트라면 개별 페이지의 URL 검사로 충분한 경우가 많습니다.

컨설턴트의 실전 팁

“크롤링이 안 된다”는 문의를 받으면 가장 먼저 구글 서치 콘솔의 페이지 색인 생성 보고서에서 “페이지가 색인되지 않은 이유”를 봅니다. 크롤링 문제인지 색인 문제인지, 구글이 이미 사유를 붙여 분류해 두었기 때문입니다.

그다음은 소거법입니다. 사유 하나에도 원인이 될 수 있는 경우가 여러 가지라서, 가능한 경우를 모두 펼쳐 놓고 아닌 것을 하나씩 지워 나갑니다. 사유를 확인하지 않고 robots.txt부터 고치기 시작하면 원인이 다른 곳에 있을 때 시간만 쓰게 됩니다.

양용준
양용준
서치나인을 운영하며 체인시프트(Chainshift)에서 SEO·GEO 전략가로 활동하고 있습니다. 인하우스 데이터 마케터로 시작해 어센트코리아 검색데이터 애널리스트를 거쳤고, 메트라이프생명·안랩·이랜드 등과 네이버·구글 SEO, AI 검색 최적화(GEO) 프로젝트를 진행했습니다.

한국 공식 글로벌 SEO/GEO 컨퍼런스 Search SEOul을 공동 주최하고, 소상공인시장진흥공단·아카마이·요즘IT 세미나 등에서 GEO를 주제로 발표해 왔습니다. 측정할 수 있는 것만 약속하는, 가장 보수적이고 진정성 있는 GEO 컨설팅을 지향합니다.
목차
다른 용어 보기
성과 기반 SEO 컨설팅 포트폴리오 궁금하세요?
서치나인 로고
상호 : 서치나인 | 대표 : 양용준
이메일 : yongjoonyang@search-nine.com
사업자번호 : 241-16-01921