What I Do

SEO 기초, 구글 크롤링·색인·검색 결과 노출 과정 정리

16분 읽기

구글 검색은 크롤링, 색인, 검색 결과 제공의 세 단계로 움직이는데요. 구글이 새 페이지를 어떻게 찾고, 어떤 페이지를 색인하며, 검색 결과를 어떻게 정하는지 Google Search Central 공식 문서 기준으로 정리하고 색인 여부를 확인하는 방법도 담았습니다.

SEO 기초, 구글 크롤링·색인·검색 결과 노출 과정 정리

구글 검색은 크롤링, 색인, 검색 결과 제공의 세 단계로 움직입니다. 크롤러가 웹에서 페이지를 찾아 내려받고, 구글이 그 내용을 분석해 색인에 저장한 뒤, 사용자가 검색하면 색인에서 관련 있는 페이지를 골라 보여 주는 구조인데요. 이 글에서는 세 단계가 각각 어떻게 동작하는지 Google Search Central 공식 문서 기준으로 정리하고, 내 페이지가 색인됐는지 확인하는 방법까지 살펴보겠습니다.

새 글을 올리고 나서 "왜 구글에서 검색해도 안 나오지?" 하고 기다려 보신 적 있으신가요? SEO라고 하면 키워드나 제목부터 떠올리기 쉬운데, 구글이 페이지를 아직 찾지 못했거나 색인에 넣지 않았다면 키워드를 아무리 다듬어도 검색 결과에 나올 수 없죠. 그래서 SEO를 공부할 때는 구글이 페이지를 어떤 순서로 다루는지부터 알아 두는 것이 좋은데요, 이번 글에서는 이 기본 흐름을 차근차근 정리해 보겠습니다.

1. 구글 검색은 어떤 단계로 움직일까요?

Google 검색의 작동 방식 가이드는 구글 검색을 세 단계로 설명하고, 모든 페이지가 모든 단계를 통과하지는 않는다고 밝힙니다.

단계공식 문서의 설명한 줄로 말하면
크롤링크롤러라는 자동 프로그램이 인터넷에서 찾은 페이지의 텍스트, 이미지, 동영상을 내려받음페이지를 찾아 가져온다
색인페이지의 텍스트, 이미지, 동영상 파일을 분석해 대규모 데이터베이스인 Google 색인에 저장내용을 이해하고 정리해 둔다
검색 결과 제공사용자가 검색하면 검색어와 관련 있는 정보를 돌려줌질문에 맞는 페이지를 골라 보여 준다

도서관에 비유하면 이해가 쉬운데요. 사서가 새로 들어온 책을 찾아 서고로 가져오는 일이 크롤링이고, 책을 읽고 분류해 목록 카드에 적어 두는 일이 색인이며, 이용자가 질문했을 때 목록에서 알맞은 책을 골라 건네는 일이 검색 결과 제공이라고 볼 수 있죠.

같은 가이드는 구글이 크롤링 빈도나 순위를 높여 주는 대가로 돈을 받지 않는다는 점과, Google 검색 필수 요소를 지키더라도 크롤링·색인·노출을 보장하지 않는다는 점을 먼저 짚고 넘어갑니다.

2. 크롤링: 구글은 새 페이지를 어떻게 찾을까요?

웹에는 모든 페이지를 모아 둔 중앙 등록부가 없어서, 구글은 새 페이지와 바뀐 페이지를 계속 찾아 알려진 페이지 목록에 더하는데요. 이 과정을 URL 발견이라고 부릅니다. 공식 문서가 드는 발견 경로는 세 가지입니다.

  • 이미 방문한 페이지: 구글이 전에 크롤링해서 알고 있는 페이지
  • 링크: 카테고리 페이지처럼 이미 알고 있는 페이지에서 새 글로 걸린 링크를 따라 발견
  • 사이트맵: 사이트 운영자가 크롤링해 달라고 제출한 페이지 목록

이 중 중심이 되는 것은 링크인데요. SEO 기본 가이드도 구글이 주로 이미 크롤링한 다른 페이지의 링크를 통해 페이지를 찾는다고 설명하고, 사이트맵 제출은 필수가 아니라고 안내합니다.

URL을 찾으면 Googlebot이라는 프로그램이 페이지를 방문해 내려받는데요. Googlebot은 어떤 사이트를 얼마나 자주, 몇 페이지나 가져올지 알고리즘으로 정하고, 사이트에 부담을 주지 않도록 속도를 조절합니다. 예를 들어 서버가 HTTP 500 오류를 돌려주면 속도를 늦추라는 신호로 받아들이죠. 크롤링하는 동안 최신 버전의 Chrome으로 페이지를 렌더링하고 자바스크립트도 실행하는데, 자바스크립트로 내용을 불러오는 사이트가 많기 때문입니다.

다만 발견한 페이지를 모두 크롤링하지는 않습니다. 사이트 운영자가 크롤링을 막아 둔 페이지나 로그인해야 볼 수 있는 페이지는 건너뛰고, 서버 문제, 네트워크 문제, Googlebot의 접근을 막는 robots.txt 규칙도 흔한 크롤링 문제로 꼽힙니다.

3. 색인: 크롤링된 페이지는 모두 색인될까요?

크롤링이 끝나면 구글은 페이지가 무엇에 관한 것인지 파악하는데요. 텍스트 콘텐츠와 함께 <title> 요소나 alt 속성 같은 주요 태그와 속성, 이미지, 동영상 등을 처리하고 분석하는 단계가 색인입니다.

이 단계에서 구글은 페이지가 다른 페이지와 중복인지, 대표 페이지인 표준(canonical) 페이지인지도 판단합니다. 내용이 비슷한 페이지들을 한 묶음으로 모은 뒤 그중 가장 대표성이 높은 페이지를 표준으로 고르고, 나머지는 모바일 검색처럼 다른 상황에서 보여 줄 수 있는 대체 버전으로 둔다고 하는데요. 이렇게 골라 둔 표준 페이지에 대해 페이지 언어, 콘텐츠가 대상으로 하는 국가, 페이지 사용성 같은 신호도 함께 모읍니다.

그리고 여기서 중요한 문장이 하나 있는데요, 공식 문서는 색인이 보장되지 않으며 구글이 처리한 페이지가 모두 색인되지는 않는다고 설명합니다. 흔한 원인으로는 콘텐츠 품질이 낮은 경우, robots 메타 규칙이 색인을 막는 경우, 사이트 설계 때문에 색인이 어려운 경우를 들고 있습니다.

4. 검색 결과에는 어떤 페이지가 나올까요?

사용자가 검색어를 입력하면 구글은 색인에서 일치하는 페이지를 찾아, 가장 품질이 높고 검색어와 관련 있다고 판단한 결과를 돌려줍니다. 공식 문서는 관련성이 수백 가지 요소로 정해지며, 여기에는 사용자의 위치, 언어, 기기(데스크톱이나 휴대전화) 같은 정보가 들어갈 수 있다고 설명하는데요. 문서의 예시로는 "bicycle repair shops"를 파리에서 검색할 때와 홍콩에서 검색할 때 서로 다른 결과가 나온다고 합니다. 검색어에 따라 결과 페이지의 형태도 달라져서, 자전거 수리점을 찾으면 지역 결과가 나오기 쉽고 "modern bicycle"을 찾으면 이미지 결과가 나오기 쉽다고 하죠.

색인은 됐는데 검색 결과에 보이지 않는 경우도 있습니다. 공식 문서는 그 이유로 페이지 내용이 검색어와 관련이 없거나, 콘텐츠 품질이 낮거나, robots 메타 규칙이 노출을 막는 경우를 듭니다.

5. 내 페이지가 색인됐는지 어떻게 확인할까요?

가장 간단한 방법은 구글 검색창에 site: 검색 연산자를 쓰는 것인데요. SEO 기본 가이드는 site:내도메인 으로 검색해 내 사이트를 가리키는 결과가 보이면 색인에 들어가 있는 것이라고 안내합니다. 특정 페이지를 자세히 보고 싶다면 Search Console의 URL 검사 도구(URL Inspection tool)로 색인 상태와 구글이 고른 표준 URL을 확인할 수 있고, 같은 화면에서 색인 생성 요청(Request indexing)도 보낼 수 있습니다. 색인 생성 요청은 해당 Search Console 속성의 소유자나 전체 사용자(full user)만 보낼 수 있습니다.

다시 크롤링 요청하기 문서는 URL이 몇 개뿐이면 URL 검사 도구를, 많으면 사이트맵 제출을 권합니다. 크롤링에는 며칠에서 몇 주가 걸릴 수 있고, 요청 횟수에는 할당량이 있으며 같은 URL을 여러 번 요청해도 더 빨리 크롤링되지는 않는다고 하니, 한 번 요청한 뒤에는 기다려 보시는 편이 좋습니다. 제가 이 블로그를 만들 때도 빌드할 때 사이트맵을 자동으로 만들도록 해 두었는데, 글이 계속 늘어나는 블로그라면 이렇게 사이트맵을 자동으로 갱신해 두는 편이 관리하기 편하죠.

검색에 노출하고 싶지 않은 페이지가 있다면 방법을 구분해서 쓰셔야 하는데요. robots.txt 소개 문서는 robots.txt가 주로 크롤러 요청이 몰리지 않게 관리하는 용도이고, 페이지를 구글에서 빼는 수단이 아니라고 설명합니다. 다른 페이지가 링크하면 크롤링을 막아 둔 URL도 설명 없이 검색 결과에 나올 수 있기 때문입니다. 페이지를 빼려면 noindex를 쓰되, Googlebot이 noindex를 읽을 수 있도록 그 페이지를 robots.txt로 막지 않아야 합니다.

정리

구글 검색은 크롤링으로 페이지를 찾아 가져오고, 색인에서 내용을 분석해 저장한 뒤, 검색어에 맞는 페이지를 골라 보여 주는 순서로 움직입니다. 검색에 나오지 않는 페이지가 있다면 이 세 단계 중 어디에서 멈췄는지부터 URL 검사 도구로 확인해 보시길 권합니다. 단계별 자세한 설명은 본문에 링크한 Google Search Central 공식 문서를 참고해 주세요.

자주 묻는 질문

사이트맵을 꼭 제출해야 하나요?
꼭 그렇지는 않습니다. 구글 문서는 페이지끼리 링크가 잘 연결된 사이트라면 대부분 찾을 수 있다고 설명합니다. 다만 사이트가 크거나, 새로 만들어 외부 링크가 적거나, 동영상·이미지가 많다면 사이트맵이 도움이 된다고 안내합니다.
색인 생성 요청을 여러 번 보내면 더 빨리 반영되나요?
아닙니다. 구글 문서는 개별 URL 제출에 할당량이 있고, 같은 URL을 여러 번 요청해도 더 빨리 크롤링되지 않는다고 설명합니다. 요청이 곧바로 검색 결과 반영을 보장하지도 않습니다.
robots.txt로 막으면 검색 결과에서 사라지나요?
웹 페이지라면 사라지지 않을 수 있습니다. 다른 페이지가 링크하면 URL이 설명 없이 검색 결과에 나올 수 있습니다. 검색 결과에서 빼려면 noindex를 쓰거나 비밀번호로 보호하는 방법을 권합니다. 이미지·동영상·오디오 파일은 robots.txt로 검색 결과 노출을 막을 수 있다고 안내합니다.

관련 글 더 보기