CRAWLING

robots.txt와 sitemap.xml은 어떻게 함께 써야 하나요?

robots.txt는 크롤러 접근 규칙을 전달하고 sitemap.xml은 검색엔진이 발견해야 할 대표 URL 목록을 제공하는 역할입니다. 둘의 역할은 다르므로 각각 따로 확인해야 합니다.

robots.txt는 크롤링 제어 파일

가장 먼저 확인할 항목은 실수로 전체 사이트를 막는 규칙이 있는지입니다. 특히 운영 배포 후 User-agent: *Disallow: / 조합이 남아 있으면 검색엔진의 크롤링이 제한될 수 있습니다.

robots.txt가 없다고 해서 사이트가 자동으로 차단되는 것은 아니며, 반대로 robots.txt에서 허용된다고 해서 반드시 색인되는 것도 아닙니다.

Sitemap은 대표 URL 목록

Sitemap에는 검색에 노출시키려는 정상 대표 URL을 넣는 것이 기본입니다. 404 페이지, 장기간 리다이렉트되는 URL, NOINDEX 페이지를 Sitemap에 계속 두면 사이트 관리 신호가 서로 충돌할 수 있습니다.

  • 작은 사이트는 하나의 URL Set으로 충분합니다.
  • 규모가 크면 Sitemap Index에서 여러 Sitemap을 나눌 수 있습니다.
  • robots.txt의 Sitemap: 선언으로 위치를 알려줄 수 있습니다.

WordPress 등은 기본 경로가 다를 수 있음

모든 사이트가 /sitemap.xml만 사용하는 것은 아닙니다. WordPress는 /wp-sitemap.xml을 사용할 수 있고 플러그인에 따라 /sitemap_index.xml 같은 경로도 자주 사용됩니다. TODAY SERVER의 사이트 감사는 기본 경로와 robots.txt 선언을 우선 확인하고 대표적인 대체 경로도 제한적으로 탐색합니다.

사이트 감사에서 함께 볼 것

Sitemap에 들어 있는 URL이 실제로 200을 반환하는지, NOINDEX가 붙어 있지는 않은지, Canonical이 다른 주소를 가리키지는 않는지 함께 확인해야 합니다. 이런 충돌은 한 페이지 검사보다 여러 URL을 표본으로 보는 사이트 감사에서 찾기 쉽습니다.