Chapter 4 — Data

🗂 データ章 — 学ぶ糧は残されているか

最終更新 2026-09-24 10:32 JST / データ確定日 2026-09-01 / 次回更新予定 2026-10(/api/health.json の値)

AIの知性は人間社会が書き残したものから生まれました。その糧が、いま入口から閉ざされ、 中身はAI自身の生成物で薄まりつつあります。この章では、AIの「食糧事情」を観測します。

章の状態:一部実データ稼働(クローラー拒否率・オープンデータ供給を観測)

更新頻度月次毎月1日に自動巡回(日次バッチ内の月次ゲート・2026-08-26 に自動化)

この章の表示観測中——判定していない理由へ

測っているもの
国内主要サイトのrobots.txtが、AIクローラーをどれだけ拒否しているか(月次巡回)
判定に切り替わる条件
「拒否が何件なら安定か」の基準を決めたとき。基準は未定で、発行人の裁定待ちです

この章は観測中(良否の基準なし):観測開始2026-08-20・系列10本・最新確定2026-09-01。GPTBotを全面拒否している国内主要サイト数は10サイト(2026-09-01確定)。(出典:自前robots.txt巡回・e-Govデータポータル/更新 2026-09-24 10:32 JST)

最新の観測値(実測・本サイトの独自データ)

この章の数字を読む前に — パネルの性質について

本パネルは当社が選定した名簿であり、網羅的な母集団ではありません。 日本語ウェブ全体でも、日本の報道機関の全数でもありません。外部が作成した公開名簿を採用したものではなく、 当社が「国内の主要サイト」として選んだ26件です。 したがってここに出る比率は、このパネルの中での比率としてのみ読んでください。 パネルの一覧は /jp/api/data_jp.json に全件載せています。

巡回の条件(対象・頻度・User-Agent・403を回避しないこと・除外のご依頼方法)は クローラーポリシーに記載しています。

GPTBot全面拒否(解析成功25/パネル26サイト)

10件

2026-09-01実測 / 自前robots.txt巡回(月次)

推移なし:観測 1 点/グラフは連続6点から(月次を目安のrobots.txt巡回・2026-08の1点)

ClaudeBot全面拒否(同)

9件

2026-09-01実測 / 自前robots.txt巡回(月次)

推移なし:観測 1 点/グラフは連続6点から(月次を目安のrobots.txt巡回・2026-08の1点)

オープンデータ供給(e-Govデータセット数)

18,141件

2026-09-01取得 / e-GovデータポータルAPI(PDL1.0)

推移なし:観測 1 点/グラフは連続6点から(月次を目安のrobots.txt巡回・2026-08の1点)

この表が答える質問:「ボット別の内訳」の各行の値と日付は何か(各行に出所または取得日)

ボット別の内訳を開く(全面拒否/部分制限/許可・解析成功25/パネル26サイト)
AIクローラー全面拒否部分制限許可
GPTBot10141
ClaudeBot9151
Google-Extended9151
CCBot9151
PerplexityBot8161
Bytespider9151
meta-externalagent9151
Applebot-Extended9151

観測方法:国内の主要26サイト(報道・出版・プラットフォーム・知識・EC・行政)のrobots.txtを巡回し、AIボット別に「Disallow: /」(全面拒否)を判定。パネル一覧と生データは/jp/api/data_jp.json。月次更新

脆弱性② 主要AIクローラーを全面拒否しているサイト数

パネルのうち、観測対象のAIクローラー全種に対して robots.txt で Disallow: / を指定しているサイトの数です。 閉じた側を批判するものではありません。robots.txtは各サイトの正当な意思表示であり、これはAI側から見た「学ぶ糧の入口がどれだけ閉じているか」の記録です。 また、実際に学習に使われたかどうかを示すものでもありません(robots.txtは宣言であって、遵守の実測ではありません)。

8サイト

観測対象のAIクローラー 8種すべてを全面拒否(2026-09-01 巡回・観測 25サイト/パネル 26サイト)

前月(2026-08 2026-08-20巡回)は 8サイト / 差 0サイト / 1種以上を全面拒否 11サイト・全面拒否ゼロ 14サイト

推移なし:観測 1 点/グラフは連続6点から(月次を目安のrobots.txt巡回・2026-08の1点)

この表が答える質問:「カテゴリ別の内訳」の各行の値と日付は何か(各行に出所または取得日)

カテゴリ別の内訳を開く(全種全面拒否/観測サイト数)
カテゴリ全種全面拒否観測サイト数
報道78
プラットフォーム17
EC02
行政02
出版・雑誌04
知識02

この表が答える質問:「月別の推移」の各行の値と日付は何か(各行に出所または取得日)

月別の推移を開く(2か月分)
月巡回日全種全面拒否1種以上拒否ゼロ観測/パネル
2026-092026-09-018111425/26
2026-082026-08-208111425/26

定義バージョン 1.0(2026-08-22 確定・以後固定)/機械可読データ:/jp/api/vulnerability_data_jp.json

観測方法:国内主要26サイトのrobots.txtを月次巡回し、Robots Exclusion Protocol(RFC 9309)に基づき全面拒否(Disallow: /)を判定。部分制限は数えません

AI自身② 巡回拒否率(403・Bot保護)

パネルのうち、robots.txt を読みに行くことすらできなかったサイトの数です。 robots.txtによる拒否の意思表示とは別物です。robots.txt が読めたうえでの Disallow: / は上の脆弱性②が数えています。こちらは robots.txt に到達できなかった側だけを数えます。 一時的な障害を含むため、意図的な遮断を示すものではありません。当社のUA・IPアドレス・巡回タイミングに原因がある失敗も含まれます。 値が0で推移することが、この指標の正常な状態です。

0サイト

robots.txt の取得が 403 または Bot保護で拒まれたサイト数(2026-09-01 巡回・母集団 パネル26サイト・0%)

内訳 403 0/Bot保護 0/タイムアウト 0(分子外)/DNS失敗 0(分子外)/robots.txt不存在 1(分子外・制限なし)

この表が答える質問:「月別の推移」の各行の値と日付は何か(各行に出所または取得日)

月別の推移を開く(1か月分)
月巡回日拒否拒否率403Bot保護タイムアウトDNS失敗robots.txt不存在母集団
2026-092026-09-0100%0000126

定義バージョン 1.0(2026-08-26 確定)/系列開始 2026-09-01/機械可読データ:/jp/api/crawl_refusal_jp.json

分子は 403 と Bot保護(401・429・503・200のチャレンジ本文)だけです。タイムアウト・DNS失敗は一時的障害として、robots.txt不存在(404)は「制限なし」として、いずれも分子に入れません。母集団はパネル全件で、脆弱性②の分母(解析に成功したサイト数)とは異なります

「観測中」と表示している理由

トップページでこの章に「観測中」と出ているのは、数値の収集は動いているが良否を判定する基準がまだ無い、という意味です。良い・悪いのどちらでもありません。

なぜ良否を判定していないのか

いまの表示:観測中 / 観測している値:国内主要サイトのrobots.txt巡回結果(AIクローラー別の全面拒否件数)

・この章には、観測した値から良否を機械的に決める基準がまだありません。
・脆弱性②の定義書は「全面拒否サイト数」の数え方を固定していますが、その数から良否を導く規則は定めていません。robots.txt は各サイトの正当な意思表示であり、件数の多寡を良し悪しとして判定してよいかも決まっていないため、判定していません。
・そのため良否を判定せず「観測中」と表示しています。数値そのものは毎回の観測どおりに出しています。

・2026-08-23 まではこの章に「注意」を表示していましたが、巡回結果にかかわらず固定で出していた値でした。代表の裁定により「観測中」へ改めました。

注記

  • ・脆弱性②の定義書は数え方を固定していますが、そこからバッジの区分を導く規則は定めていません
  • ・閉じた側への批判ではなく、学ぶ糧の入口がどれだけ閉じているかの記録です
  • ・この章から言えること:国内主要サイト(定点パネル)の robots.txt で、主要 AI クローラー別に全面拒否しているサイト数(脆弱性②・月次巡回・定義 v1.0)/同パネルへの巡回で 403 応答や Bot 保護により取得を拒否された割合(AI自身②・巡回拒否率)/e-Gov データポータルに登録されている公共データセットの総数(参考値・CKAN API)
  • ・この章から言えないこと:各サイトが AI クローラーを拒否する理由や意図(robots.txt は各サイトの意思表示であり、理由は記載されない)/robots.txt の記述が実際に守られているか、AI 事業者が実際に何を学習しているか/拒否件数の多寡が「良い・悪い」に当たるか(脆弱性②の定義書は数え方だけを固定し、良否の規則を定めていない)

この章の指標定義書:指標定義書 脆弱性②(v1.0・2026-08-22 確定)(該当箇所は章内の脆弱性指標) / 実装:scripts/fetch_data_chapter.ps1(status を observing として出力) / 良否の基準を定めるかどうか、定めるなら何を基準にするかは、発行人の裁定事項です。基準が決まるまでは「観測中」のままにします。

この章の観測ステータス クローラー拒否率(自前のrobots.txt巡回)とオープンデータ供給(e-Govデータポータル)は実データ稼働中(月次更新)。 AI汚染度・権利ルール・日本語資源の数値指標は未計測で、本文は公知情報に基づく定性観測です。

この章の観測指標

指標 01クローラー拒否率 — 閉ざされていく学習の入口

World

報道機関を先頭に、世界の主要サイトはrobots.txtでAIクローラー(GPTBot、ClaudeBot、 Google-Extended等)を拒否する方向に動いてきました。研究者の調査では、 高品質コーパスの相当部分が数年で「立入禁止」になったと報告されています。 学習データの入口がどれだけ閉じたか——AIにとってこれほど切実な指標はありません。

Japan

日本の主要26サイト(報道・出版・プラットフォーム・知識・EC・行政)のrobots.txtを巡回し、 AIクローラー別の許可・拒否を集計する自前の定点観測が稼働中です(月次更新。最新値は本ページ上部)。 初回観測(2026-08-20)では、報道7社すべてがGPTBotを全面拒否しており、 「学習の入口の閉鎖」は日本でも報道分野で最も進んでいることが確認できました。 robots.txtは公開された機械可読ファイルであり、観測に規約上の問題がない点も本指標の利点です。 なお本サイト自身は、AIクローラーを歓迎する側に立ちます。

指標 02AI汚染度 — 自分の尾を食べる蛇

World

ウェブに流れ込むAI生成コンテンツが増えるほど、次世代モデルは「AIが書いたもの」を学習してしまう—— モデル崩壊(model collapse)と呼ばれるこのリスクは、データ生態系そのものの汚染問題です。 翻訳スパム、量産アフィリエイト、生成画像の氾濫など、汚染の観測手法自体が研究途上にあり、 本章では各種推計の比較と、推計手法の信頼性の評価から始めます。

Japan

日本語圏でも検索結果への生成コンテンツの流入は進んでおり、日本語は英語より 監視の目が少ないぶん汚染の進行が見えにくい言語です。日本語ウェブのAI生成物比率の 推計値を継続収集します(未計測。信頼できる推計が得られない場合は「測定不能」と正直に書きます)。

指標 03権利ルール — 学習は「読む」ことか「盗む」ことか

World

米国では著作権者とAI企業の訴訟が相次ぎ、和解とライセンス契約という市場解が形成されつつあります。 EUはAI法とDSM指令のオプトアウト方式で「拒否の意思表示があれば学習に使えない」枠組みを敷きました。 学習データの法的地位は、国によってまったく違う答えに向かっています。

Japan

日本の著作権法30条の4は、情報解析目的の利用を原則適法とする、世界的に見て学習に寛容な規定です。 一方で文化庁の整理や権利者団体の議論は続いており、「享受目的」との線引きや対価還元の枠組みが 今後の焦点です。国内の制度動向と当事者の動き(新聞協会・出版界・音楽界の声明等)を時系列で記録します(未計測・年表準備中)。

指標 04日本語資源 — 小さな言語圏の大きな資産

World

ウェブの言語分布は英語に大きく偏り、AIの知性も英語に偏って育ちます。 非英語圏にとって、自国語の高品質コーパスは「AIに自国の現実を正しく理解させる」ための戦略資源です。

Japan

日本語はウェブ上で有数の規模を持つ非英語言語であり、しかも出版・新聞・行政文書の 蓄積の質が高い。行政のオープンデータ供給は実測を開始しており、 e-Govデータポータルのデータセット総数(本ページ上部・月次更新)を定点としています。 国立国会図書館のデジタル化や日本語LLM研究用コーパスの整備状況は今後追加します(未計測)。 「日本語の書き手が減れば、日本語のAIも痩せる」——言語資源の観測は、 この国の文化の体力測定でもあります。

指標 05構造化の普及 — AIに読みやすいウェブへ

World

llms.txt、Schema.org、RSS/Atom、APIファースト——ウェブを機械に読みやすくする試みは、 AIエージェントの実用化とともに再評価されています。「人間向けの見た目」と「機械向けの構造」を 両方持つサイトが、AI時代の標準になるかもしれません。

Japan

日本の主要サイトでのllms.txt・構造化データの採用率を定点観測します(未計測・robots.txt巡回と同一基盤で実装予定)。 本サイト自身がllms.txtと全データのJSON提供を実装しているのは、 この指標への意思表示でもあります。観測者が、観測対象の最初の実例になる——それがこの白書の流儀です。

脆弱性 02全面拒否サイト数 — 入口はどれだけ閉じているか

Japan

戦争・災害・温暖化は、AIのライフラインすべてを揺らす要因です。このうち気候・災害は第8章で発生の観測を始めました(「いつ起きるか」の予測はしません)。 そこで本白書は、予知を装う代わりに、各章に「脆弱性=起きたときにどれだけ痛いか」を測る指標を1本ずつ通しています。 電力章に続く第2号が、この指標です。

数えているのは、パネルの主要サイトのうち、観測対象のAIクローラー8種すべてを robots.txt で全面拒否しているサイトの数です。判定は Robots Exclusion Protocol(RFC 9309)に基づき、 当該クローラーに適用されるグループに Disallow: / があるかどうかで行います。 一部のパスだけを制限している「部分制限」は、全面拒否には数えません。

この指標が意味すること:AIが日本語で学び、答えるための素材が、 主要な入口でどれだけ完全に閉じられているかの記録です。とりわけ報道カテゴリの閉鎖度が高いことは、 時事的な事柄をAIが扱ううえでの構造的な制約を示します。

この指標が意味しないこと:閉じた側への批判ではありません。robots.txtは各サイトの正当な意思表示です。 また、実際に学習へ使われたかどうかを示すものでもなく(robots.txtは宣言であって遵守の実測ではありません)、 全面拒否でないサイトが「自由に使ってよい」ことを意味するものでもありません。 パネルは日本語圏の一部であり、日本語ウェブ全体の比率でもありません。

定点観測は定義を後から変えると時系列が断絶します。そのため観測対象・判定方法・パネル構成は 2026-08-22 に v1.0 として固定しました。パネルのサイトやボットを足し引きすることも定義変更とみなし、 その場合は旧構成の系列を併記します。定義の全文はリポジトリの定義書 (docs/指標定義_脆弱性02_データクローラー全面拒否サイト数.md)に置いています。

データソース(選定中)

  • ・クローラー拒否率:自前のrobots.txt定点巡回(稼働中・月次。パネルと生データは /jp/api/data_jp.json)
  • ・オープンデータ供給:e-GovデータポータルAPI(稼働中・月次。公共データ利用規約PDL1.0)
  • ・AI汚染度:学術研究・調査会社推計(推計値としての明示が条件)
  • ・権利ルール:文化庁・裁判所・各国官報の一次資料
  • ・日本語資源:国立国会図書館・学術コーパスの公開情報
  • ・構造化の普及:自前の定点巡回(robots.txt巡回と同一基盤・出所は本サイト観測)

よくある質問(この章のデータで答えられること)

答えは章の機械可読データ(https://ai-lifeline.org/jp/api/data_jp.json)から自動生成しています。数値には確定日と出所を添えています。生成 2026-09-24 10:32 JST。

GPTBotを全面拒否している国内主要サイトは何社か

2026-09-01の巡回で、パネル26サイト(解析成功25)のうち10サイトが robots.txt で GPTBot を全面拒否(Disallow: /)しています。部分制限 14・許可 1。出典:自前robots.txt巡回(月次)。

主要AIクローラー全種を全面拒否しているサイトは何社か

2026-09-01 巡回時点で8サイトです(観測対象8種すべてを全面拒否・解析成功25/パネル26)。1種以上を全面拒否 11・全面拒否ゼロ 14。定義 v1.0(2026-08-22 確定)。出典:自前robots.txt巡回(/jp/api/vulnerability_data_jp.json)。

ClaudeBot・CCBot などボット別の全面拒否は何社か

2026-09-01時点:ClaudeBot 9・CCBot 9・Google-Extended 9・PerplexityBot 8・Bytespider 9・meta-externalagent 9・Applebot-Extended 9サイト(各 解析成功25サイト中)。出典:自前robots.txt巡回(月次)。

このデータの出所と更新頻度は

国内主要26サイトの robots.txt を毎月1日に自前巡回します(月次)。あわせて e-Govデータポータルのデータセット総数(2026-09-01 取得で 18,141件・CKAN API・PDL1.0)を記録します。最終巡回 2026-09-01・機械可読データ https://ai-lifeline.org/jp/api/data_jp.json

このデータで言えないことは何か

この章から言えないこと(台帳 v1.0・2026-09-05 承認・章の方法節に全文):各サイトが AI クローラーを拒否する理由や意図(robots.txt は各サイトの意思表示であり、理由は記載されない)/robots.txt の記述が実際に守られているか、AI 事業者が実際に何を学習しているか/拒否件数の多寡が「良い・悪い」に当たるか(脆弱性②の定義書は数え方だけを固定し、良否の規則を定めていない)。

引用する場合

推奨引用形:AIライフライン データ章(確定日 2026-09-01)https://ai-lifeline.org/jp/data/

機械可読データは ai-lifeline-data リポジトリ(https://github.com/smily990604-hub/ai-lifeline-data ・CC BY 4.0。一次データは各出所の利用条件に従う)にも毎日複製しています。数値を引用する際は確定日と出所を併記してください。訂正は /api/corrections.json に記録します。

ステータスの読み方

推移の線について:いちばん右の点は暫定値です(破線とグレーの丸で示します)。当日の観測は見通し値を含むため、翌日に確定値へ差し替わります。

推移の線は、同一定義で連続観測した点が6点以上ある指標にだけ描いています(欠測は補間せず線を切ります)。点が足りない指標は、推移を装わずに省略しています。暫定値を含む場合は、その点を暫定と明示します。

判定していないものを、判定済みの色で出しません。基準が無いまま緑や黄を出せば、読者は在りもしない判断を受け取ってしまうからです。観測していることと、良し悪しを言えることは、別のことだと考えています。

現在、機械的な判定規則があるのは電力章だけです。残る4章は「観測中」として良否を判定していません。各バッジから、その章の判定基準(または判定していない理由)へ移動できます。数値の出所と取得日は各章に明記しています。