AIが『問題を解きながら賢くなる』──テスト時学習(Test-Time Training)とは
スタンフォード大学のYu Sun氏らが提案した「Test-Time Training(TTT)」層は、推論時の入力シーケンスに対してもモデル自身が自己教師あり学習を行い続ける新しいシーケンスモデリング手法。125M〜1.3Bパラメータでの検証では、TransformerやMambaと異なり、より長い文脈を与えるほど困惑度(perplexity)が下がり続けたという。

3行まとめ
- 「Test-Time Training(TTT)」は、通常は訓練時にだけ更新されるモデルのパラメータ(隠れ状態)を、推論(テスト)時の入力シーケンスに対しても自己教師あり学習で更新し続けるという発想のシーケンスモデリング手法。スタンフォード大学のYu Sun氏らが2024年7月にarXivで発表した。
- 論文は「隠れ状態そのものを機械学習モデルにし、その更新則を自己教師あり学習の1ステップにする」というアイデアで、線形の計算量を保ちながら表現力の高い隠れ状態を実現する枠組みを提示している。線形モデルを隠れ状態とする「TTT-Linear」と、2層MLPを隠れ状態とする「TTT-MLP」の2種類を検証した。
- 125M〜1.3Bパラメータ規模での実験では、Transformerと同様にTTT-LinearとTTT-MLPはより多くのトークンに条件付けるほど困惑度を下げ続けられたのに対し、現代的なRNNであるMambaは16kトークンを超えると改善が止まったという。
何が問題だったのか
論文のアブストラクトは、既存の2つのアプローチが抱える根本的なトレードオフを整理するところから始まる。Self-attention(Transformerの中核技術)は長い文脈でも高い性能を発揮するが、計算量が文脈長の2乗(quadratic)で増大する。一方、既存のRNN層は計算量が線形(linear)に収まるが、その隠れ状態(hidden state)の表現力に限界があるため、長い文脈での性能が制限される。
この論文は、線形の計算量を保ちながら表現力の高い隠れ状態を持つシーケンスモデリング層を実現する、実践的な枠組みを提示するとしている。
隠れ状態そのものを「機械学習モデル」にする
論文の中核となるアイデアは、「隠れ状態そのものを機械学習モデルにし、その更新則を自己教師あり学習の1ステップにする」という点にある。通常のニューラルネットワークでは、隠れ状態は固定サイズのベクトルのような単純な表現にとどまるが、TTTではこの隠れ状態自体が学習可能なモデルになっている。そして、テストシーケンス(推論時に与えられる入力)に対しても、この隠れ状態を訓練によって更新し続けることから、論文はこの層を「Test-Time Training(TTT)層」と名付けたと説明している。
論文は2つの具体的な実装(instantiation)を検証している。
- TTT-Linear: 隠れ状態が線形モデルであるバージョン
- TTT-MLP: 隠れ状態が2層のMLP(多層パーセプトロン)であるバージョン
検証結果
研究チームは125Mから1.3Bパラメータの規模で、強力なTransformerベースラインと、現代的なRNNであるMambaとの比較評価を行った。学習に使った設定(PDF本文のTable 3、Mamba論文のTable 12を再現したもの)は次の通り。
| モデル規模 | 層数 | 隠れ次元 | 学習ステップ数 | 学習トークン数 |
|---|---|---|---|---|
| 125M | 12 | 768 | 4,800 | 25億 |
| 350M | 24 | 1,024 | 13,500 | 70億 |
| 760M | 24 | 1,536 | 29,000 | 150億 |
| 1.3B | 24 | 2,048 | 50,000 | 260億 |
結果として、TransformerがそうであるようにTTT-LinearとTTT-MLPは、より多くのトークンに条件付ける(=より長い文脈を与える)ほど困惑度(perplexity、モデルの予測の不確実性を示す指標で低いほど良い)を下げ続けることができたのに対し、Mambaは16kトークンを超えるとそれ以上改善できなくなったという。
ただしPDF本文を読むと、この結果には重要な留保が付いている。文脈長2kでは「TTT-Linear・Mamba・Transformerはほぼ同等の性能」で、TTT-MLPはむしろ大きな計算量(FLOPs)予算下ではやや劣るとされている。TTT層の優位性がはっきり表れるのは8k文脈以降だという。さらに8k文脈でも「Transformerはどのモデル規模でも依然として良い(最良と言えるほどの)困惑度を保っているが、そのFLOPsコストのために競争力を持たない」と明記されている。つまりTTTの主張は「Transformerより予測精度そのものが優れている」ではなく、「同程度の予測精度を、より少ない計算量で、より長い文脈まで維持できる」という、計算効率の主張だと理解する必要がある。
実際のウォールクロック速度についても数字がある。TPU(v5e-256)上で、文脈長2kの学習1イテレーションあたり、Transformerベースラインが0.30秒、TTT-Linearが0.27秒で、システム最適化なしでも10%速かったという。一方でTTT-MLPについては、著者ら自身が「FLOPsの面では効率的だが、MLP構造の複雑さがFLOPsに対して不釣り合いに大きくウォールクロック時間を増加させる。この枠組みがこの限界を克服できるか、あるいはそれを上回る利点を提供できるかは今後の課題だ」と明記しており、TTT-MLPは依然としてメモリI/O(入出力)の面で課題を抱えているものの、長い文脈においてより大きな可能性を示しており、今後の研究にとって有望な方向性を指し示している、と論文は結んでいる。
論文の位置づけ
このarXiv論文(2407.04620)は2024年7月5日に初版投稿され、2025年8月31日付でv4まで改訂されている。arXivのコメント欄によれば、現行版は関連研究と限界に関する記述が更新されたもので、すべての実験は初版の時点で完了しているとされる。著者はYu Sun氏・Xinhao Li氏・Karan Dalal氏ら12名で、所属機関はスタンフォード大学・UCサンディエゴ校・UCバークレー校・Meta AIの4機関とPDF本文に明記されている。「TTT」という語自体は、Googleサジェストで「test time training done right」「test time training llm」「test time training world model」「test time training nvidia」など複数の関連語形が確認できるほど、英語圏の研究コミュニティで活発に議論されているテーマの一つになっている。
「テスト時学習」というアイデア自体は新しくない
論文の関連研究(Related Work)節を読むと、著者ら自身が「テスト時に学習する」という発想の系譜を丁寧に整理している。最も古い例として、Bottou & Vapnikによる「局所学習(local learning)」――各テスト入力について、その近傍データで学習してから予測する手法――が挙げられ、SVMから現代のLLMまで応用されてきたという。もう1つの源流として、Vladimir Vapnikの「トランスダクティブ学習」も挙げられている。コンピュータビジョンの分野では顔検出・物体検出・超解像・3D再構成などに数十年にわたって応用されてきた考え方で、自然言語処理では「動的評価(dynamic evaluation)」と呼ばれ、プロンプトの形で与えられたテスト系列に対してLLMを直接ファインチューニングする手法として存在していたという。
論文はまた、TTT-Linearと特に近い関係にある手法として「DeltaNet」(Schlag, Irie, Schmidhuberらの研究)を挙げ、「DeltaNetは、内部ループのミニバッチサイズを1とし、Layer Normと残差接続を除いたTTT-Linearと等価だ」と明記している。つまりこの論文の貢献は「テスト時学習」というアイデアそのものの発明ではなく、隠れ状態を任意のニューラルネットワークとしてインスタンス化できる実用的な枠組みを示した点にある、と著者ら自身が位置づけている。
それでも確認できなかったこと
- 本記事はarXiv掲載のPDF全文(2407.04620 v4)を確認して書いている。ただし図として示されているグラフ(Figure 2・Figure 10・Figure 12など)の具体的な数値そのものは、pdftotextでは正確に抽出できず、本記事では本文の記述(prose)から読み取れる範囲にとどめている
- プロジェクト公式サイト(test-time-training.github.io)は、本記事作成時点ではJavaScriptレンダリングのページでcurlではタイトルしか取得できず、2026年9月4日に再確認したところHTTP 404を返すようになっていた。出典はGitHub Organization(github.com/test-time-training・同日200を確認)に差し替えている。本記事は同名のarXiv論文を一次ソースとして扱っているが、プロジェクトサイトとarXiv論文が完全に同一の内容を指しているかは厳密には未確認である
- Googleサジェストに見える「test time training world model」「test time training nvidia」などの関連語が、この論文と直接どうつながるか(応用先の具体例)までは、本記事では調査していない
- 論文の「Discussion」節にある今後の研究方向(Future work)の全項目までは、本記事では読み込んでいない
関連記事
出典・参照資料
- 一次資料Learning to (Learn at Test Time): RNNs with Expressive Hidden States(arXiv:2407.04620) ↗
- 一次資料Learning to (Learn at Test Time): RNNs with Expressive Hidden States(PDF全文) ↗
- 二次資料Test-Time Training(GitHub Organization・公式リポジトリ群) ↗
- 一次資料Mamba: Linear-Time Sequence Modeling with Selective State Spaces(arXiv:2312.00752、比較対象の原論文) ↗
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。