AI 企業が言語モデルの訓練データを収集する競争を繰り広げる中、ウェブは前例のない自動化トラフィックの波に直面している。インターネット全体のウェブサイト運営者がボットトラフィックの劇的な急増を報告しており、通常の訪問者数の最大10倍の増加を経験している事例もある。この急増により、多くの運営者が積極的なブロック措置を実装せざるを得なくなったが、これが意図せず正当なユーザーにも影響を与えている。
問題の規模
数字は、この問題がいかに深刻になっているかを如実に物語っている。日次300〜3,000ビューの小規模ウェブサイトでは、現在のトラフィックの少なくとも70%が人間以外であると報告されている。フォーラム運営者は、これまで見たことのないような突然の10倍のボットトラフィック増加について述べている。Jenkins や Gerrit などの開発ツールを実行している個人サーバーは、robots.txt ファイルを無視し、リソース集約的なアプリケーションをクラッシュするまで攻撃するクローラーによって圧倒されている。
クローラーは正当に見せかける試みにおいて、ますます巧妙になっている。商業的な起源を隠すために住宅用プロキシサービスを使用し、数百万の IP アドレスをローテーションし、通常のトラフィックに紛れ込むために古いブラウザのユーザーエージェントを使用している。中には、正当な検索エンジンボットであると主張する偽造された DNS エントリを使用するものもある。
トラフィック影響統計:
- 小規模ウェブサイト(日次閲覧数300〜3,000):約70%が非人間トラフィック
- フォーラムトラフィックの増加:通常レベルの最大10倍
- サーバーリソースへの影響:影響を受けたシステムでCPU使用率が500%に到達
社会契約の破綻
この状況を特に問題にしているのは、何十年もの間ウェブを機能させ続けてきた暗黙のルールに違反していることである。インターネットは、異なる当事者間の協力と暗黙の合意の上に構築されていた。ウェブサイト運営者は無料のコンテンツを提供し、検索エンジンは敬意を持ってクロールし、ユーザーは素材と真摯に関わっていた。
「このすべてから最終的に感じたことの一つは、現在のウェブが驚くほど脆弱だということです。ウェブの大部分は、技術によってではなく、暗黙の理解と取り決めによって支えられているように思えます。」
この破綻は単なるウェブクローリングを超えて広がっている。社会契約を無視する同じパターンが、政治的な駆け引きからビジネス慣行まで、現代社会の様々な側面に現れており、関係者全員の生活をより困難にしている。
実際のユーザーへの巻き添え被害
ウェブサイトが自らを守るために実装している防御措置が、正当な訪問者に新たな問題を生み出している。アンチボットシステムは現在、古いブラウザを使用するユーザーをブロックし、アーカイブサービスはコンテンツの保存に苦労し、現在のブラウザバージョンでさえ時々誤検知を引き起こしている。CAPTCHA、レート制限、その他のセキュリティ措置により、すべての人にとってブラウジングがより煩雑になっている。
これは悪循環を生み出し、ユーザー体験の悪化により人々が情報を求めて AI チャットボットに向かい、それが今度は問題の原因となっているまさにそのクローリングの需要を増加させている。この状況は、不便な正当な選択肢がユーザーを違法な代替手段に押しやったメディア海賊版の初期の頃を彷彿とさせる。
技術的課題と解決策
悪意のあるクローラーを特定してブロックすることは、ますます困難になっている。クラウドプロバイダーの IP 範囲をブロックするような従来の方法は明らかなケースには有効だが、住宅用プロキシネットワークにより検出がはるかに困難になっている。一部のウェブサイトでは、コンテンツにアクセスする前にブラウザに計算タスクの実行を要求するプルーフオブワークシステムを実験している。
現在最も効果的な解決策は、Cloudflare のようなサービスを利用することで、リアルタイムでトラフィックパターンを分析し、悪意のある IP のネットワーク全体をブロックできる。しかし、これらの解決策は多くの場合、小規模なウェブサイト運営者が負担するのに苦労するコストを伴う。
一般的なクローラーの行動パターン:
- 正当性を装うために古い Chrome ユーザーエージェントを使用する
- 数百万の住宅用 IP アドレスをローテーションする
- robots.txt ファイルを完全に無視する
- 検索結果やカレンダーイベントなどのリソース集約的なページを標的にする
- 検出を回避するために分散された IP ブロックから発信する
今後の展望
現在の状況は、ウェブの未来に関する根本的な問題を浮き彫りにしている。従来の広告モデルが圧迫され、クローリングコストが急上昇する中、多くの専門家は、オンラインで質の高いコンテンツにアクセスするためにマイクロペイメントやサブスクリプションモデルが必要になる可能性があると予測している。
課題は、ウェブを価値あるものにしたオープンな性質を維持しながら、正当な研究、アーカイブ活動、商業的なデータ収集を区別できるシステムを作ることにある。新しい技術的および法的枠組みがなければ、インターネットを構築した暗黙の社会契約は、より明示的で執行可能な合意に置き換える必要があるかもしれない。
