記録項目と保存期間は環境によって異なります。User-AgentにGooglebotと書かれているだけでは、Googleからのアクセスとは断定できません。公式のIP範囲と照合するか、アクセス元IPの逆引きで確認したホスト名を正引きし、元のIPと一致するかを検証します。
確認済みのクローラーのリクエストをURLパターン、ステータスコード、日付別に集計し、Search Consoleの情報と比較します。noindexはインデックスからの除外を指示するもので、クロールを止めません。重複URLや不要なクロールには、URL設計、canonical、robots.txtの目的と影響を区別して対応します。
