この章の観測指標
指標 01クローラー拒否率 — 閉ざされていく学習の入口
World
報道機関を先頭に、世界の主要サイトはrobots.txtでAIクローラー(GPTBot、ClaudeBot、 Google-Extended等)を拒否する方向に動いてきました。研究者の調査では、 高品質コーパスの相当部分が数年で「立入禁止」になったと報告されています。 学習データの入口がどれだけ閉じたか——AIにとってこれほど切実な指標はありません。
Japan
日本の主要26サイト(報道・出版・プラットフォーム・知識・EC・行政)のrobots.txtを巡回し、 AIクローラー別の許可・拒否を集計する自前の定点観測が稼働中です(月次更新。最新値は本ページ上部)。 初回観測(2026-08-20)では、報道7社すべてがGPTBotを全面拒否しており、 「学習の入口の閉鎖」は日本でも報道分野で最も進んでいることが確認できました。 robots.txtは公開された機械可読ファイルであり、観測に規約上の問題がない点も本指標の利点です。 なお本サイト自身は、AIクローラーを歓迎する側に立ちます。
指標 02AI汚染度 — 自分の尾を食べる蛇
World
ウェブに流れ込むAI生成コンテンツが増えるほど、次世代モデルは「AIが書いたもの」を学習してしまう—— モデル崩壊(model collapse)と呼ばれるこのリスクは、データ生態系そのものの汚染問題です。 翻訳スパム、量産アフィリエイト、生成画像の氾濫など、汚染の観測手法自体が研究途上にあり、 本章では各種推計の比較と、推計手法の信頼性の評価から始めます。
Japan
日本語圏でも検索結果への生成コンテンツの流入は進んでおり、日本語は英語より 監視の目が少ないぶん汚染の進行が見えにくい言語です。日本語ウェブのAI生成物比率の 推計値を継続収集します(未計測。信頼できる推計が得られない場合は「測定不能」と正直に書きます)。
指標 03権利ルール — 学習は「読む」ことか「盗む」ことか
World
米国では著作権者とAI企業の訴訟が相次ぎ、和解とライセンス契約という市場解が形成されつつあります。 EUはAI法とDSM指令のオプトアウト方式で「拒否の意思表示があれば学習に使えない」枠組みを敷きました。 学習データの法的地位は、国によってまったく違う答えに向かっています。
Japan
日本の著作権法30条の4は、情報解析目的の利用を原則適法とする、世界的に見て学習に寛容な規定です。 一方で文化庁の整理や権利者団体の議論は続いており、「享受目的」との線引きや対価還元の枠組みが 今後の焦点です。国内の制度動向と当事者の動き(新聞協会・出版界・音楽界の声明等)を時系列で記録します(未計測・年表準備中)。
指標 04日本語資源 — 小さな言語圏の大きな資産
World
ウェブの言語分布は英語に大きく偏り、AIの知性も英語に偏って育ちます。 非英語圏にとって、自国語の高品質コーパスは「AIに自国の現実を正しく理解させる」ための戦略資源です。
Japan
日本語はウェブ上で有数の規模を持つ非英語言語であり、しかも出版・新聞・行政文書の 蓄積の質が高い。行政のオープンデータ供給は実測を開始しており、 e-Govデータポータルのデータセット総数(本ページ上部・月次更新)を定点としています。 国立国会図書館のデジタル化や日本語LLM研究用コーパスの整備状況は今後追加します(未計測)。 「日本語の書き手が減れば、日本語のAIも痩せる」——言語資源の観測は、 この国の文化の体力測定でもあります。
指標 05構造化の普及 — AIに読みやすいウェブへ
World
llms.txt、Schema.org、RSS/Atom、APIファースト——ウェブを機械に読みやすくする試みは、 AIエージェントの実用化とともに再評価されています。「人間向けの見た目」と「機械向けの構造」を 両方持つサイトが、AI時代の標準になるかもしれません。
Japan
日本の主要サイトでのllms.txt・構造化データの採用率を定点観測します(未計測・robots.txt巡回と同一基盤で実装予定)。 本サイト自身がllms.txtと全データのJSON提供を実装しているのは、 この指標への意思表示でもあります。観測者が、観測対象の最初の実例になる——それがこの白書の流儀です。
脆弱性 02全面拒否サイト数 — 入口はどれだけ閉じているか
Japan
戦争・災害・温暖化は、AIのライフラインすべてを揺らす要因です。このうち気候・災害は第8章で発生の観測を始めました(「いつ起きるか」の予測はしません)。 そこで本白書は、予知を装う代わりに、各章に「脆弱性=起きたときにどれだけ痛いか」を測る指標を1本ずつ通しています。 電力章に続く第2号が、この指標です。
数えているのは、パネルの主要サイトのうち、観測対象のAIクローラー8種すべてを
robots.txt で全面拒否しているサイトの数です。判定は Robots Exclusion Protocol(RFC 9309)に基づき、
当該クローラーに適用されるグループに Disallow: / があるかどうかで行います。
一部のパスだけを制限している「部分制限」は、全面拒否には数えません。
この指標が意味すること:AIが日本語で学び、答えるための素材が、 主要な入口でどれだけ完全に閉じられているかの記録です。とりわけ報道カテゴリの閉鎖度が高いことは、 時事的な事柄をAIが扱ううえでの構造的な制約を示します。
この指標が意味しないこと:閉じた側への批判ではありません。robots.txtは各サイトの正当な意思表示です。 また、実際に学習へ使われたかどうかを示すものでもなく(robots.txtは宣言であって遵守の実測ではありません)、 全面拒否でないサイトが「自由に使ってよい」ことを意味するものでもありません。 パネルは日本語圏の一部であり、日本語ウェブ全体の比率でもありません。
定点観測は定義を後から変えると時系列が断絶します。そのため観測対象・判定方法・パネル構成は
2026-08-22 に v1.0 として固定しました。パネルのサイトやボットを足し引きすることも定義変更とみなし、
その場合は旧構成の系列を併記します。定義の全文はリポジトリの定義書
(docs/指標定義_脆弱性02_データクローラー全面拒否サイト数.md)に置いています。
データソース(選定中)
- ・クローラー拒否率:自前のrobots.txt定点巡回(稼働中・月次。パネルと生データは /jp/api/data_jp.json)
- ・オープンデータ供給:e-GovデータポータルAPI(稼働中・月次。公共データ利用規約PDL1.0)
- ・AI汚染度:学術研究・調査会社推計(推計値としての明示が条件)
- ・権利ルール:文化庁・裁判所・各国官報の一次資料
- ・日本語資源:国立国会図書館・学術コーパスの公開情報
- ・構造化の普及:自前の定点巡回(robots.txt巡回と同一基盤・出所は本サイト観測)