AI時短ラボ
研究· 約14

AIが生成したデータでAIを学習させ続けると何が起きるか──「モデル崩壊」をNature論文の実例で読む

英オックスフォード大学などの研究チームが2024年7月24日にNature誌で発表した論文「AI models collapse when trained on recursively generated data」は、AI自身が作ったデータでAIを再学習させ続けると、世代を追うごとにモデルが現実の分布を見失っていく「モデル崩壊」という現象を、実際のテキスト生成例つきで示した。日本語での丁寧な紹介がまだ少ないこの論文の中身を、一次資料から確認する。

AIが生成したデータでAIを学習させ続けると何が起きるか──「モデル崩壊」をNature論文の実例で読む
執筆・編集:
目次

インターネット上のテキスト・画像のうち、AIが生成したものの割合は年々増えている。次世代のAIモデルを訓練するとき、そのデータの中にAI自身が作ったコンテンツが混じっていたら何が起きるのか。この問いに実証的に答えたのが、英オックスフォード大学のIlia Shumailov氏らの研究チームがNature誌に発表した論文「AI models collapse when trained on recursively generated data」だ。2024年7月24日掲載、2025年3月21日に著者訂正版が出ている。日本語では「モデル崩壊」と訳されることが多いこの現象について、原論文の記述を確認する。

3行まとめ

  1. 論文はモデル崩壊を「学習済み生成モデルの世代を追って影響する退行的プロセス」と定義し、早期(分布の裾の消失)・後期(分散のほぼゼロへの収束)の2段階に分ける
  2. この論文はもともと2023年5月27日に「The Curse of Recursion」というタイトルのプレプリントとしてarXivに投稿され、1年以上後の2024年7月にNature誌へタイトルを変えて正式掲載された
  3. 2025年3月の著者訂正は、数式の記号1箇所(α→β)の誤植を直しただけで、実験結果や結論を書き換えるものではなかった

この論文の経歴:arXivプレプリントからNature掲載まで1年以上

Nature論文の参考文献リストを実際にcurlで確認すると、著者らが公開しているコードリポジトリ(Zenodo)の説明文には「本リポジトリは論文"The Curse of Recursion: Training on Generated Data Makes Models Forget"のためのコードを含む」と書かれている。このタイトルでarXivを検索すると、Nature版とは別の、先行するプレプリント(arXiv:2305.17493)が見つかる。

段階 日付 タイトル 媒体
プレプリント初版投稿 2023年5月27日 The Curse of Recursion: Training on Generated Data Makes Models Forget arXiv
プレプリント最終改訂(v3) 2024年4月14日 同上 arXiv
Nature本掲載 2024年7月24日 AI models collapse when trained on recursively generated data Nature(Vol. 631, pp. 755–759)
著者訂正 2025年3月21日 Author Correction: AI models collapse when trained on recursively generated data Nature(Vol. 640, p. E6)

つまり、この現象自体は2023年5月の時点でプレプリントとして公開されており、Nature誌への正式掲載はそこから1年以上あとだった。タイトルも「The Curse of Recursion(再帰の呪い)」から「AI models collapse(AIモデルは崩壊する)」に変わっている。

モデル崩壊とは何か

論文はモデル崩壊(model collapse)を次のように定義している。

"Model collapse is a degenerative process affecting generations of learned generative models, in which the data they generate end up polluting the training set of the next generation. Being trained on polluted data, they then mis-perceive reality."

学習済みの生成モデルの世代を追って影響する退行的なプロセスで、あるモデルが生成したデータが次世代の訓練データを汚染し、その汚染されたデータで訓練されたモデルは現実を誤って認識するようになる、という現象だ。論文はこれを「早期モデル崩壊(early model collapse)」と「後期モデル崩壊(late model collapse)」の2段階に分けている。早期段階では、モデルは分布の「裾(tails)」=発生頻度の低い事象についての情報を失い始める。後期段階では、モデルは元の分布とほとんど似ていない、多くの場合分散が大幅に縮小した分布に収束してしまう。

3つの誤差源

論文は、世代を追うごとに複合していく誤差を3種類に整理している。

  1. 統計的近似誤差:サンプル数が有限であるために生じる主要な誤差。再サンプリングの各段階で情報が失われる非ゼロの確率があるために起こる
  2. 関数的表現力誤差:関数近似器(ニューラルネットワークなど)の表現力の限界から生じる二次的な誤差
  3. 関数的近似誤差:学習手続き自体の限界(確率的勾配降下法の構造的バイアスや目的関数の選択など)から主に生じる二次的な誤差

これらが世代を経るごとに複合し、多くの場合カスケード的に効果を及ぼす。過学習した密度モデルが誤って外挿し、訓練データのサポート範囲に含まれない領域に高い密度を割り当ててしまう、といった形だ。

数学的な証明:デルタ関数への収束は「避けられない」

論文の理論パートでは、離散分布・多次元ガウス分布という2つの数学モデルを使い、モデル崩壊が生成モデル全般に普遍的に起こることを示している。特に、ガウス分布の設定における定理(Theorem 3.1)は、世代を重ねるにつれて近似分布が真の分布から任意に乖離していくだけでなく、確率1で分散がゼロに収束していくことを示す。論文はこれを「ほぼ理想的な長期学習条件(関数推定誤差なし)であっても、このプロセスは避けられない」と表現している。

実際の言語モデルでの実験

理論だけでなく、論文は実際の言語モデルでの実験結果も示している。実験にはMetaがHugging Face経由で公開しているOPT-125mという因果言語モデルを使い、wikitext2データセットでファインチューニングした。

手法は、5-way beam searchでモデルにデータを生成させ、そのデータで次の世代のモデルを訓練するというサイクルを繰り返すというものだ。元のwikitext2データで実際にファインチューニングした最初のモデルは、ゼロショットのベースライン(perplexity 115)から、mean perplexity 34まで改善し、タスクを正しく学習できていることを確認している。

2つの設定で実験が行われた。

  • 設定A(5エポック、元データ非保持):世代を経るごとに、元のタスクの性能はperplexityにして20〜28ポイント悪化した
  • 設定B(10エポック、元データの10%を保持):元データを一部保持することで、性能の劣化はより軽微になった

つまり、「元の人間が作ったデータを一定割合残す」ことが、崩壊を抑える緩和策になりうることも示されている。

実際に出力がどう壊れていくか

論文には、モデル崩壊が進んだ際の実際のテキスト出力例が掲載されている。中世の教会建築についての同じ入力文に対して、世代を追うごとにモデルの出力がどう変質していくかが示されている。

  • 世代0(Gen 0):「Revival architecture such as St. John's Cathedral in London. The earliest surviving example of Perpendicular Revival architecture is found in the 18th-century Church of Our Lady of Guernsey, which dates from the late 19th century...」(もっともらしいが、すでに事実誤認を含む出力)
  • 世代1(Gen 1):「architecture such as St. Peter's Basilica in Rome or St. Peter's Basilica in Buenos Aires. There is no evidence that any of these buildings were built during the reign of Pope Innocent III...」(元の入力=ウサギの話題からさらに逸脱し、無関係な話題が混入し始める)

論文の他の箇所で言及されている、より進行した世代の崩壊例では、出力が特定の話題(例:ジャックウサギの生息地に関する記述の反復)に収束し、多様性を完全に失っていく様子が報告されている。

なぜ重要なのか:オリジナルデータの価値が上がる

論文の結論部分は、この現象の広範な含意についてこう述べている。

"the use of LLMs at scale to publish content on the Internet will pollute the collection of data to train their successors: data about human interactions with LLMs will be increasingly valuable."

LLMを大規模に使ってインターネット上にコンテンツを公開することは、後継モデルを訓練するためのデータ収集を汚染することになる。したがって、人間とLLMとの本物のやり取りについてのデータは、今後ますます価値を持つようになる、という指摘だ。論文は、分布の裾が重要な学習タスクにおいては、元の人間が生成したデータへのアクセスが不可欠だと強調している。

論文の反響と規模

Nature誌の論文ページをcurlで取得し、掲載されているメトリクスを実際に数えると、2026年8月29日時点で803,000 Accesses(アクセス数)・834 Citations(被引用数)・Altmetric(SNS等での言及を集計するスコア)4004となっている。査読付き学術誌に掲載された、この分野では最も引用されている研究の一つだ。

著者訂正(Author Correction)ページも同様にcurlで取得すると、訂正版自体のメトリクスは18,000 Accesses・6 Citations・Altmetric 14と、原論文よりはるかに小さい。訂正の中身も実際に確認した。「Theoretical intuition」節にあった数式表記の誤り(本来は係数βであるべき箇所を、原文が誤ってαと表記していた)を修正したという、1箇所の記号の訂正であり、実験結果や結論を書き換えるような訂正ではない(原文:In the version of the article initially published, in the "Theoretical intuition" section, the text "αi = γi = 0" should have read "βi = γi = 0")。

実務への含意

生成AIが作ったコンテンツがインターネット上に増え続ける中で、次世代モデルの訓練データをどう「汚染から守るか」は、AI企業にとって実務的な課題になっている。オープンウェイトモデルを含め、学習データの出所・品質管理がモデルの性能を左右する構造は、この論文が示した理論的な裏付けの上に成り立っている。また、AI生成コンテンツが学術論文の引用を汚染する事例(AI生成論文による引用ファーミング)も、モデル崩壊と根っこを同じくする「合成データの無自覚な混入」というリスクの一形態といえる。

実験は1.25億パラメータの小型モデルで行われた

  • 本論文の実験は、比較的小型のモデル(OPT-125m、1.25億パラメータ)とwikitext2という限定的なデータセットで行われたものであり、2026年時点の最先端の大規模モデル(数千億パラメータ級)が実際に同じ速度・同じパターンで崩壊するかどうかは、この論文単体からは確認できない。
  • 論文は「モデル崩壊は避けられない」と数学的に主張しているが、これは特定の理想化された条件下(例:元データの完全な非保持)での証明であり、実際の大規模言語モデル企業がどの程度データフィルタリング・出所管理でこれを緩和できているかについての最新の実務データは、本記事のソースには含まれていない。
  • 2024年7月に掲載された論文であり、日本語での丁寧な解説記事がまだ少ないという点で「もう来ている×日本語圏が薄い」候補として扱っているが、内容自体は2026年の最新研究ではない。2026年時点でのAI企業各社の対策状況(合成データ検出、データ来歴管理など)についての続報は、本記事では調査していない。
  • OPT-125mの原論文(arXiv:2205.01068)は今回curlで取得し、Metaが公開する1.25億〜1750億パラメータ(125M〜175B)のオープン事前学習トランスフォーマー群の一つであることは確認したが、その論文自体に書かれた性能評価(他モデルとの比較ベンチマーク)まではこの記事で扱っていない。あくまでモデル崩壊の実験に使われた「素材」としての確認にとどまる。
シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事