로그에 기록되는 항목과 보관 기간은 환경별로 다릅니다. User-Agent가 Googlebot이라는 이유만으로 실제 구글봇으로 판단하면 안 됩니다. 공식 IP 범위와 대조하거나, 요청 IP의 역방향 DNS 조회 후 확인된 호스트 이름을 정방향으로 조회해 원래 IP와 일치하는지 검증합니다.
검증한 크롤러의 요청을 URL 패턴·상태 코드·날짜별로 분석하고 Search Console의 크롤링·색인 정보와 비교합니다. noindex는 색인 제외 지시이며 크롤링을 막지 않습니다. 중복 URL과 불필요한 크롤링은 URL 설계, canonical, robots.txt의 목적과 부작용을 구분해 처리합니다.
