robots.txt는 크롤링 접근을 제어하는 파일이다. 예를 들어 관리자 경로, 내부 검색 결과, 무한 파라미터 URL처럼 검색 가치가 낮거나 크롤링 낭비가 큰 경로를 안내할 때 사용된다.
중요한 점은 robots.txt가 색인 제거 도구가 아니라는 것이다. 이미 알려진 URL은 robots.txt로 크롤링을 막아도 검색 결과에 URL만 남을 수 있다. 검색 결과에서 제외하려면 noindex와 같은 색인 지시를 별도로 이해해야 한다.
robots.txt 설정은 배포 전에 반드시 확인해야 한다. 개발 환경에서 쓰던 `Disallow: /`가 운영 환경에 남으면 사이트 전체의 크롤링이 막힐 수 있고, CSS나 JavaScript 리소스를 잘못 막으면 렌더링 이해에도 영향을 줄 수 있다.
핵심 정리
- 크롤러의 접근 허용 또는 차단을 안내한다.
- 검색 결과 색인 제거를 보장하는 장치는 아니다.
- 사이트 루트의 `/robots.txt` 경로에서 제공된다.
- 중요한 리소스와 페이지를 실수로 차단하지 않도록 주의해야 한다.
