AIクローラーの解説:意図、証拠、および llms.txt

AI クローラーを分類するには、その名前を読むだけでは不十分です。運営者が表明する目的、技術的な識別情報、そして自分のログは、それぞれ異なる問いに答えます。

最終更新:

クローラー名だけでは、その目的を立証できない

有用な問いは、運用者がボットの機能をどう説明しているか、ボットがどのように自身の身元を証明するか、そして自分のエビデンスが何を示しているかです。「AI ボット」というラベルには複数種類の活動が含まれます。

Cloudflare の検証済みボット分類は、その幅広さを示しています:検索、エージェント、学習、取引、データ収集、セキュリティテスト、SEO、広告検証、ソーシャルまたはリンクプレビュー、フィード取得、監視または運用。1つのボットが複数の挙動を申告する場合もあります。

これらのカテゴリはポリシーの整理に役立ちます。1 件のリクエストが引用につながったこと、モデルの学習に使われたこと、取引を完了したことを証明するものではありません。

llms.txtへのリクエストで証明できること

正常に完了したリクエストの送信先 /llms.txt から確認できるのは、サーバー側の限られた事実だけです。リクエストがサーバーへ到達したこと、記録されたユーザーエージェントが含まれていたこと、そのURLが対象だったこと、記録された時刻にサーバーが記録済みのステータスを返したことです。

そのログ項目だけでは、クライアントが次を行ったことは立証できません。

  • ファイルを正しく解析したこと、
  • すべてのリンクをたどった;
  • HTMLや構造化データよりもそのファイルを優先したこと、
  • コンテンツを検索または学習に使ったこと。
  • 回答内でウェブサイトを引用した。
  • ページまたは商品の順位を変更した。

証拠は段階として扱います: fetched, parsed もし独立して実証された場合、 used もし独立して実証されたのであれば、 cited または converted (宛先システムが測定している場合)。手順を飛ばすと、技術的観測が 根拠のない主張になってしまいます。

意図レベルでの区別が重要な理由

OpenAIは、検索、モデル学習、ユーザー起点の操作、広告審査にそれぞれ別のユーザーエージェントを文書化しています。 OAI-SearchBot ChatGPT 検索に対応します。 GPTBot 基盤モデルの学習に使われる可能性があるコンテンツを対象にします。 ChatGPT-User はユーザーが要求した特定の操作を実行するもので、自動検索クローラーではありません。

OAI-AdsBot は、広告として送信されたページだけにアクセスします。OpenAIによれば、このボットが収集したデータは基盤モデルの学習には使用されません。したがって、広告審査は検索での可視性や学習とは異なる目的です。

これらの役割が、OpenAI の bot が llms.txt。このファイルが役立つのは、クライアントが読むことを選択した場合だけです。

llms.txtの位置付け

llms.txt 有用なページを、所有者が選んだ簡潔なマップとして提供できます。ただし、 HTML、サイトマップ、フィード、API、構造化データ、プラットフォームカタログ、または robots.txt。各サーフェスには固有の役割があります。

Shopify はその有用な例です。そのストアフロントはエージェント検出ファイルを公開できますが、Shopify Catalog は別途、構造化された商品情報を扱っています。いずれかのインターフェースが存在しても、 チャネルが商品を表示したり、ランキングに反映したりすることを保証するものではありません。

公開 llms.txt この規約をサポートするクライアントについては、 証拠によって裏付けられる内容のみを検証してください。ファイルが利用可能であることは採用の証拠ではなく、採用されたからといって引用された証拠にはなりません。

続きを読む

ソース