구글 인덱싱(색인)이란? 페이지가 색인에서 빠지는 이유

인덱싱·색인 (Indexing) 뜻 썸네일

인덱싱(Indexing, 색인 생성)은 검색엔진이 크롤링해 온 페이지의 내용을 분석해 무엇에 관한 문서인지 파악하고, 검색에 쓸 수 있도록 거대한 데이터베이스에 저장하는 과정입니다. 이 데이터베이스를 색인이라 부르고, 색인에 없는 페이지는 어떤 검색어로도 나타나지 않습니다.

인덱싱 뜻

구글 검색 센터 문서는 색인 생성을 “페이지의 콘텐츠·이미지·동영상 파일을 분석해 어떤 페이지인지 파악하고 그 정보를 구글 색인에 저장하는 것”으로 설명합니다. 도서관에 비유하면 크롤링이 책을 사 오는 일이고, 색인 생성은 그 책을 분류해 목록 카드를 만들어 서가에 꽂는 일입니다.

중요한 것은 크롤링됐다고 자동으로 색인되지는 않는다는 점입니다. 검색엔진은 저장할 가치가 있는지 판단하고, 그렇지 않다고 보면 내용을 읽고도 색인에 넣지 않습니다. 구글 문서도 “색인 생성은 보장되지 않으며, 구글이 처리한 모든 페이지가 색인되는 것은 아니다”라고 적고 있습니다.

색인의 규모는 구글이 직접 밝히고 있습니다. 구글의 검색 작동 방식 안내 페이지에 따르면 구글 검색 색인은 수천억 개의 웹페이지를 담고 있고 크기는 1억 기가바이트를 훌쩍 넘습니다. 구글은 이를 책 뒤편의 찾아보기에 비유하며, 색인한 웹페이지에 나온 단어마다 항목이 있다고 설명합니다. 검색어를 입력한 순간 웹 전체를 읽는 것이 아니라, 미리 만들어 둔 이 목록에서 찾아 꺼내는 구조입니다.

색인 단계에서는 중복 판단도 함께 이뤄집니다. 구글 검색 센터의 검색 작동 방식 문서에 따르면 구글은 내용이 비슷한 페이지를 한 묶음으로 모은 뒤 그중 가장 대표성 있는 페이지를 캐노니컬(대표 URL)로 고르고, 검색 결과에 나올 수 있는 것은 이 대표 페이지입니다. 페이지의 언어, 대상 지역, 사용성 같은 신호도 이때 함께 수집됩니다.

책 뒤편 찾아보기처럼 단어별로 문서 목록을 정리한 색인에서 검색어에 맞는 문서를 꺼내는 개념도
검색엔진은 검색어가 들어온 순간 웹 전체를 읽는 것이 아니라, 단어마다 항목을 만들어 둔 색인에서 문서를 찾아 꺼냅니다.

크롤링·렌더링·색인·랭킹은 무엇이 다른가

크롤링은 페이지를 가져오는 일, 렌더링은 자바스크립트를 실행해 사람이 보는 모습을 만드는 일, 색인 생성은 그 결과를 분석해 저장하는 일, 랭킹은 저장된 것 중에서 골라 순서를 매기는 일입니다. 네 단계는 앞 단계가 끝나야 다음 단계로 넘어가므로, 어디에서 멈췄는지에 따라 증상이 다르게 나타납니다.

단계하는 일여기서 멈추면
크롤링링크·사이트맵으로 URL을 찾아 내용을 내려받음검색엔진이 페이지 내용을 알지 못함
렌더링헤드리스 크로미움으로 자바스크립트를 실행해 최종 HTML을 만듦스크립트로만 그려지는 본문이 비어 있는 것으로 보일 수 있음
색인 생성텍스트·태그·이미지를 분석하고, 중복을 묶어 대표 URL을 정한 뒤 저장어떤 검색어로도 나타나지 않음
랭킹(게재)검색어에 맞는 문서를 색인에서 찾아 순서를 매김색인돼 있어도 노출이 거의 일어나지 않음

렌더링은 국내 글에서 잘 다루지 않는 단계입니다. 구글의 자바스크립트 SEO 기본 문서에 따르면 200 상태 코드를 돌려주는 페이지는 자바스크립트가 있든 없든 모두 렌더링 대기열에 들어가고, 이 대기열에 “몇 초 머물 수도 있지만 그보다 오래 걸릴 수도 있습니다”. 색인에 쓰이는 것은 렌더링을 마친 HTML입니다.

Googlebot의 처리 흐름 도식: Crawl Queue, Crawler, Processing, Render Queue, Renderer를 거쳐 Index로 이어짐
Googlebot은 크롤링 대기열의 URL을 가져와 처리한 뒤 렌더링 대기열을 거쳐 렌더링된 HTML을 색인에 반영합니다. 출처: Google 검색 센터 (CC BY 4.0)

색인과 노출도 같은 말이 아닙니다. 같은 구글 문서는 색인된 페이지라도 내용이 검색어와 관련이 없거나 품질이 낮거나 robots 메타 규칙이 게재를 막으면 검색 결과에 나오지 않을 수 있다고 설명합니다. 색인은 검색 결과에 오를 후보 명단에 들어가는 것이고, 실제 순서는 다음 단계인 랭킹에서 정해집니다.

색인에서 빠지는 이유

  • 다른 페이지와 내용이 겹칩니다. 같은 내용이 여러 주소에 있으면 검색엔진이 대표 하나만 고릅니다. 나머지는 “중복 페이지”로 분류돼 색인에서 빠집니다.
  • 내용이 너무 얇습니다. 목록만 있고 본문이 거의 없는 페이지, 자동 생성된 태그 페이지가 대표적입니다.
  • noindex가 걸려 있습니다. 의도한 경우도 있지만, 테마나 플러그인이 특정 페이지 유형에 자동으로 넣어 두는 경우가 있어 확인이 필요합니다.
  • 캐노니컬이 다른 주소를 가리킵니다. 이 페이지가 원본이 아니라고 스스로 신고한 셈이 됩니다.
  • 자바스크립트 없이는 내용이 비어 있습니다. 렌더링 전 HTML에 본문이 없으면 검색엔진이 빈 페이지로 볼 수 있습니다.

색인되지 않은 페이지는 얼마나 흔한가

사이트 페이지 일부가 색인되지 않는 것은 정상입니다. Search Console 고객센터의 페이지 색인 생성 보고서 문서는 “사이트의 모든 URL이 색인될 것이라고 기대하지 말라”며, 일부 URL은 중복이거나 의미 있는 정보가 없을 수 있으니 핵심 페이지가 색인돼 있는지만 확인하라고 안내합니다.

구글의 존 뮬러(John Mueller)도 2021년 8월 공개 영상 질의응답에서 “페이지가 100개인데 80개가 색인돼 있다면 고쳐야 할 문제로 보지 않는다”고 말했습니다(Search Engine Journal 보도). 몇 퍼센트부터 문제라는 공식 기준은 없습니다.

실측 자료로는 색인 모니터링 도구 Indexing Insight를 만든 애덤 젠트(Adam Gent)의 조사가 있습니다. 해외 사이트 18곳이 사이트맵으로 제출한 페이지 약 170만 개를 구글의 URL 검사 API로 매일 추적했고(2025년 3월 31일 기준 데이터), 결과는 다음과 같습니다.

  • 색인되지 않은 사례의 88%가 조사자가 ‘품질’ 유형으로 분류한 사유였습니다. 기술적 차단보다 구글이 색인할 가치를 낮게 본 경우가 훨씬 많았다는 뜻입니다.
  • 색인되지 않은 50만여 개 페이지 중 67%는 “Google에 알려지지 않은 URL” 또는 “발견됨 – 현재 색인이 생성되지 않음” 상태였습니다. 절반 이상이 크롤링조차 되지 않은 단계에 머물러 있었습니다.

다만 사이트 18곳이라는 작은 표본이고, 조사 직전인 2025년 3월 13일 구글 코어 업데이트가 있어 수치에 영향을 받았을 수 있다고 조사자 스스로 밝히고 있습니다. 한국어 사이트를 대상으로 한 국내 공개 조사는 아직 없습니다.

Indexing Insight 조사 결과 도넛 차트 두 개: 색인 제외 사유 중 품질 유형 88%, 색인되지 않은 페이지 중 알려지지 않음·발견됨 상태 67%
해외 사이트 18곳의 제출 페이지 약 170만 개를 추적한 결과, 색인되지 않은 사례의 88%가 '품질' 유형 사유였고, 색인되지 않은 50만여 개 페이지의 67%는 크롤링 전 단계에 머물렀습니다(2025년 3월 31일 기준). 출처: Indexing Insight(Adam Gent)

색인 여부를 확인하는 법

구글 서치 콘솔의 페이지 색인 생성 보고서가 기준입니다. 색인된 페이지 수와 색인되지 않은 페이지를 이유별로 나눠 보여줍니다. “크롤링됨 – 현재 색인이 생성되지 않음”, “발견됨 – 현재 색인이 생성되지 않음” 같은 항목이 앞에서 말한 원인들과 대응합니다.

보고서에 자주 나오는 사유를 구글 공식 문서의 설명대로 정리하면 다음과 같습니다.

보고서 사유공식 문서가 설명하는 뜻
발견됨 – 현재 색인이 생성되지 않음구글이 URL을 찾았지만 아직 크롤링하지 않은 상태. 대개 크롤링하려 했으나 사이트에 과부하가 걸릴 것으로 예상돼 일정을 미룬 경우
크롤링됨 – 현재 색인이 생성되지 않음크롤링은 했지만 색인하지 않은 상태. 앞으로 색인될 수도, 되지 않을 수도 있음
중복 페이지, 사용자가 선택한 표준이 없음다른 페이지와 중복인데 대표 URL이 지정돼 있지 않아 구글이 다른 페이지를 대표로 고른 상태
중복 페이지, Google에서 사용자와 다른 표준을 선택함이 페이지를 대표로 지정했지만 구글은 다른 URL이 더 나은 대표라고 판단한 상태
적절한 표준 태그가 포함된 대체 페이지대표 페이지를 올바르게 가리키고 있고 그 대표 페이지가 색인돼 있는 상태
‘noindex’ 태그에 의해 제외됨색인하려 했으나 noindex 지시를 만나 색인하지 않은 상태
소프트 404사용자에게는 ‘찾을 수 없음’ 안내를 보여주지만 404 상태 코드는 돌려주지 않는 페이지
리디렉션이 포함된 페이지다른 주소로 리디렉션되는 비표준 URL이라 색인 대상이 아닌 상태

같은 사유 이름이라도 그렇게 판정된 원인은 사이트마다 다릅니다. 또한 구글은 색인 생성이 즉시 이뤄지지 않으며, 크롤링·색인된 페이지가 보고서에 반영되기까지도 시간이 걸린다고 밝히고 있습니다.

특정 페이지 하나만 급히 확인하려면 URL 검사 기능을 쓰거나, 검색창에 site: 뒤에 주소를 붙여 검색해 봅니다. 다만 site: 검색 결과의 개수는 정확한 수치가 아니라 대략적인 추정치입니다.

컨설턴트의 실전 팁

색인된 페이지 수는 많을수록 좋은 숫자가 아닙니다. 진단할 때 먼저 보는 것은 “색인된 수”가 아니라 “색인돼야 할 페이지 수와 실제 색인 수의 차이”입니다.

실제로 문제가 되는 쪽은 반대인 경우가 많습니다. 상품 목록의 정렬·필터 주소, 검색 결과 페이지, 페이지네이션이 각각 색인돼 수천 개가 쌓여 있는 상태입니다. 이렇게 되면 검색엔진이 사이트의 중심 주제를 판단하기 어려워지고, 정작 중요한 페이지가 자기 사이트의 얇은 페이지들과 경쟁하게 됩니다. 색인을 늘리기 전에 빼야 할 것부터 정리하는 편이 대개 효과가 큽니다.

색인에 대한 흔한 오해

색인은 사이트 운영자가 요청하는 대로 이뤄지는 것이 아니라 검색엔진이 판단해 결정하는 일입니다. 이 점을 놓치면 아래와 같은 오해가 생깁니다.

  • “색인 요청을 여러 번 누르면 빨라진다.” 구글 문서는 개별 URL 제출에는 할당량이 있고, 같은 URL을 여러 번 요청해도 더 빨리 크롤링되지 않는다고 밝힙니다. 크롤링 자체도 며칠에서 몇 주가 걸릴 수 있습니다.
  • “색인 요청이나 사이트맵을 제출하면 색인된다.” 같은 문서는 크롤링을 요청해도 검색 결과 포함이 즉시, 또는 아예 보장되지 않는다고 적고 있습니다. 사이트맵은 URL을 발견하도록 돕는 수단입니다.
  • “robots.txt로 막으면 색인에서 빠진다.” 구글의 noindex 문서에 따르면 robots.txt로 크롤링을 막은 페이지는 구글이 noindex 지시를 읽을 수 없고, 다른 페이지가 링크하고 있으면 검색 결과에 나타날 수 있습니다. 크롤링 차단과 색인 차단은 다른 장치입니다.
  • “Indexing API로 아무 페이지나 빠르게 색인시킬 수 있다.” 구글 Indexing API 문서는 이 API를 채용 공고(JobPosting)나 라이브 방송(VideoObject 안의 BroadcastEvent) 구조화 데이터가 있는 페이지에만 쓸 수 있다고 명시합니다.
  • “색인되면 곧 검색 결과에 나온다.” 색인은 후보 명단에 오르는 단계일 뿐이고, 어떤 검색어에서 몇 번째로 보여줄지는 랭킹에서 따로 정해집니다.

AI 검색에서는 어떻게 작동하나

구글의 AI 개요(AI Overviews)와 AI 모드에 출처로 인용되려면 먼저 구글 색인에 들어가 있어야 합니다. 구글 검색 센터의 AI 기능 문서는 AI 개요나 AI 모드에 참고 링크로 표시될 자격을 “색인돼 있고, 구글 검색에서 스니펫과 함께 표시될 수 있는 페이지”로 정하고, 이 밖에 추가 기술 요건이나 별도의 최적화는 필요 없다고 밝힙니다.

즉 구글의 AI 답변은 별도의 문서 저장소가 아니라 기존 검색 색인 위에서 출처를 고릅니다. 색인되지 않은 페이지는 일반 검색 결과뿐 아니라 AI 답변의 인용 후보에서도 빠지고, 색인돼 있더라도 스니펫 표시를 막아 두었다면 인용 대상이 되지 못합니다. AI 검색 시대에도 색인은 가장 먼저 확인해야 하는 입장권입니다.

전체 웹페이지 중 색인된 페이지, 그중 스니펫 표시가 가능한 페이지가 AI 개요·AI 모드 참고 링크 후보가 되는 포함 관계 도식
구글 AI 개요·AI 모드의 참고 링크는 별도 저장소가 아니라 기존 검색 색인에 있고 스니펫 표시가 가능한 페이지 중에서 나옵니다.
양용준
양용준
서치나인을 운영하며 체인시프트(Chainshift)에서 SEO·GEO 전략가로 활동하고 있습니다. 인하우스 데이터 마케터로 시작해 어센트코리아 검색데이터 애널리스트를 거쳤고, 메트라이프생명·안랩·이랜드 등과 네이버·구글 SEO, AI 검색 최적화(GEO) 프로젝트를 진행했습니다.

한국 공식 글로벌 SEO/GEO 컨퍼런스 Search SEOul을 공동 주최하고, 소상공인시장진흥공단·아카마이·요즘IT 세미나 등에서 GEO를 주제로 발표해 왔습니다. 측정할 수 있는 것만 약속하는, 가장 보수적이고 진정성 있는 GEO 컨설팅을 지향합니다.
목차
다른 용어 보기
성과 기반 SEO 컨설팅 포트폴리오 궁금하세요?
서치나인 로고
상호 : 서치나인 | 대표 : 양용준
이메일 : yongjoonyang@search-nine.com
사업자번호 : 241-16-01921