本文にスキップ
weballin

weballin DIGIWIKI

クロール

クロールは、検索エンジンなどの自動化プログラムがURLにリクエストを送信してページと関連リソースを取得するプロセスです。収集したページがすべてインデックス化されたり、検索結果に表示されるわけではありません。

weballin

クロールはサイトを読むプロセスに近いです。ユーザーには正常に見える画面は、アクセス制限やレンダリングの問題のためにクローラーには異なる内容が返されることがあります。

画面が見えるだけでは不十分

ログイン、サーバーエラー、セキュリティ機能のブロック、JavaScriptの実行状態によって、配信される内容が異なる場合があります。重要な本文と内部リンクが実際の応答とレンダリング結果にあることを確認する必要があります。

取得するURLを明確にする

たとえば、サービスの詳細ページがメニューのクリックイベントとしてのみ開かれている場合は、通常のリンクとは異なる動作を行うことができます。ページの実際のアドレスと接続を確認し、フィルタ・並べ替えURLが無限に増える仕組みなのかも調べます。収集量自体よりも重要な情報に到達できるかどうかが重要です。

クローラーごとに目的が異なる

検索用のクローラー、学習用のクローラー、ユーザーの要求として訪問するツールを同じものとして扱いません。運用方針に合わせて対象を区分し、実際のリクエストログと各サービスの公式案内を併せて確認します。

要点

  • URLの応答と実際の本文を確認してください。
  • クロールの許可は、インデックスや紹介を保証しません。
  • クローラーのサービスと目的を区別します。

参考資料

よくある質問

クロールをたくさんすると検索結果も良くなりますか?

収集回数だけで成果を判断することはできません。重要なページを取得できない問題があるか、不要なURLにリクエストが繰り返されるかとインデックス・ユーザーの流入を一緒に見なければなりません。