AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読む
Anthropicのアライメント研究ブログが2026年8月に3本公開した。嘘を検出するよう訓練した分類器は分布外のケースにうまく汎化せず、プロンプトだけの手法にほぼ勝てなかったという結果を含む。うちは同ブログの5月分3本は記事化済みだが、6〜7月は追跡が止まっており、8月分から再開する。

目次
Anthropicの研究部門が運営するAlignment Science Blogは、2026年8月に3本の論文的な記事を公開した。うちはこのブログの5月分3本(SLEIGHT-Bench、Teaching Claude Why、Model Spec Midtraining)は記事化しているが、6月・7月分は未着手のまま止まっていた。8月分から追跡を再開し、3本のうち最も実務に近い「嘘発見器」の研究を中心に、残る2本も含めて内容を整理する。
1. 嘘発見器を訓練しても、未知のケースには通用しなかった
「Fine-Tuned Lie Detectors Failed to Generalize」(Jack Hopkins・Dipika Khullar、MATS/Anthropic Fellows Program、2026年8月21日公開)は、オープンソースモデル自身が実際についた嘘(on-policy lies)を使って「嘘発見器」を訓練した結果を報告している。
論文が確認した要点は次の通り。
| 項目 | 内容 |
|---|---|
| 訓練データ | オープンソースモデルが実際についた嘘(on-policy lies) |
| 結果 | ファインチューニングした嘘発見器は、分布外(out-of-distribution)のケースにうまく汎化しなかった |
| プロンプトだけの手法との比較 | 分布外ケースでは、ファインチューニング版はプロンプトのみのベースラインにほぼ勝てなかった |
| さらに悪いケース | より大きいモデルのプロンプト版に、ファインチューニング版が負けることもあった |
| モデルサイズと嘘検出能力 | 大きいモデルほど概ね嘘の検出が上手いが、単調な増加ではなかった |
| データの扱い | 研究チームは使用したデータセットを公開している |
論文の導入部は、この研究の動機を「不整合(misalignment)は隠されている時こそ是正が難しい」という一文で説明している。モデルが誤った目標を追っていたり、間違った信念を持っていたりしても、それを公然と示せば運用者は対処できる。だからこそ信頼できる嘘発見器は、監視の仕組みにとって価値がある、という位置づけだ。ただし論文自身が「嘘発見器はモデルを整合させるわけではなく、隠すコストを上げるだけ」「モデルは何かを主張しなくても多くを隠せる」「検出しても、運用者側にそれを是正する経路が無ければ意味がない」という限界も明記している。
「訓練すれば良くなるはず」という直感に反して、分布外への汎化という点でプロンプトベースの手法を明確に上回れなかった、という結果は、AIの出力を検証する手法そのものの限界を示す事例として扱う価値がある。
2. 解釈可能性ツールは「予測の上乗せ」にならなかった
「Would This Change Your Answer?」(Adam Karvonen・Euan Ong・Subhash Kantamneni・Samuel Marks、2026年8月21日公開)は、CHIVE(Counterfactual Hypothesis Investigation Via Edits)というパイプラインを提案する論文だ。実運用中のLLMの挙動から「予期しない振る舞い」を自動発見し、プロンプトを反実仮想的に編集する実験でその原因を検証する仕組みで、数千件の検証データを生成した。
このデータを使って、活性化(activation)を読み取る3種類の解釈可能性ツール(activation oracles、natural-language autoencoders、sparse autoencoders)を評価したところ、いずれのツールも「transcript(会話ログ)だけを読んだ場合」を上回る予測精度を示さなかった。論文は、ツールの出力が挙動の「因果関係」そのものを明示的に述べておらず、予測エージェントは相関的な手がかりから因果を推測する必要があった、という理由を挙げている。ただし論文自身、この評価は「ground truthをサンプリングで得られる」という点で、実際のシステムカード評価(ground truthが無い状況)とは前提が異なるとも断っている。研究で発見された挙動は比較的単純なものが多く、より複雑な挙動への一般化は未検証だとしている。
3. 「答えの検証しづらい問い」に対する推論力を測る指標
「Introducing the Conceptual Reasoning Index」(Emery Cooper・Caspar Oesterheld・Chi Nguyen・Alex Kastner・Joe Benton・Ethan Perez、Redwood ResearchとAnthropicの共同研究、2026年8月12日公開)は、哲学やAI未来論のように経験的・数学的に検証しづらい問いに対する推論力(conceptual reasoning)を測る3つのベンチマーク(LMCA、ACCoRD、DTBench capabilities)と、それらを統合した指標CRIを提案している。2026年8月10日時点の計測で、最高スコアはOpus 5の73.6(推定上限91のうち)だったと報告している。専用サイト(conceptualreasoning.ai)でスコアを継続更新するとしている。
6〜7月分のブログ記事はまだ扱えていない
- 3本とも記事一覧ページの月別見出しは「August 2026」だったが、個別記事の公開日(8月21日・8月21日・8月12日)は各記事ページの著者クレジット欄に記載されており、そこで直接確認した。
- 各論文の統計的手法・実験デザインの妥当性そのものは、本記事では検証していない(一次資料の記述をそのまま要約している)。特にCRIの「推定上限91」という数字は、人間の評価者間の一致率から論文が独自に見積もったものであり、絶対的な基準ではない。
- このブログは6月分(Diffuse AI Control)・7月分(Agentic Misalignment in Summer 2026、Modular Pretraining)が未着手のまま残っている。8月分の記事化により追跡を再開するが、6〜7月分の記事化は本記事のスコープ外。
Anthropicの他のアライメント研究はAnthropic「SLEIGHT-Bench」を公開、Anthropic「Teaching Claude Why」を公開を参照。
この記事は2026年8月27日時点でAnthropic Alignment Science Blogを確認して書いたものです。
関連記事
出典・参照資料
- 一次資料Anthropic Alignment Science Blog「Fine-Tuned Lie Detectors Failed to Generalize」 ↗
- 一次資料Anthropic Alignment Science Blog「Would This Change Your Answer? Evaluating Explanations of LLM Behavior in the Wild with Counterfactual Experiments」 ↗
- 一次資料Anthropic Alignment Science Blog「Introducing the Conceptual Reasoning Index」 ↗
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。