AI時短ラボ
研究· 約8

AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読む

Anthropicのアライメント研究ブログが2026年8月に3本公開した。嘘を検出するよう訓練した分類器は分布外のケースにうまく汎化せず、プロンプトだけの手法にほぼ勝てなかったという結果を含む。うちは同ブログの5月分3本は記事化済みだが、6〜7月は追跡が止まっており、8月分から再開する。

AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読む
執筆・編集:
目次

Anthropicの研究部門が運営するAlignment Science Blogは、2026年8月に3本の論文的な記事を公開した。うちはこのブログの5月分3本(SLEIGHT-Bench、Teaching Claude Why、Model Spec Midtraining)は記事化しているが、6月・7月分は未着手のまま止まっていた。8月分から追跡を再開し、3本のうち最も実務に近い「嘘発見器」の研究を中心に、残る2本も含めて内容を整理する。

1. 嘘発見器を訓練しても、未知のケースには通用しなかった

「Fine-Tuned Lie Detectors Failed to Generalize」(Jack Hopkins・Dipika Khullar、MATS/Anthropic Fellows Program、2026年8月21日公開)は、オープンソースモデル自身が実際についた嘘(on-policy lies)を使って「嘘発見器」を訓練した結果を報告している。

論文が確認した要点は次の通り。

項目 内容
訓練データ オープンソースモデルが実際についた嘘(on-policy lies)
結果 ファインチューニングした嘘発見器は、分布外(out-of-distribution)のケースにうまく汎化しなかった
プロンプトだけの手法との比較 分布外ケースでは、ファインチューニング版はプロンプトのみのベースラインにほぼ勝てなかった
さらに悪いケース より大きいモデルのプロンプト版に、ファインチューニング版が負けることもあった
モデルサイズと嘘検出能力 大きいモデルほど概ね嘘の検出が上手いが、単調な増加ではなかった
データの扱い 研究チームは使用したデータセットを公開している

論文の導入部は、この研究の動機を「不整合(misalignment)は隠されている時こそ是正が難しい」という一文で説明している。モデルが誤った目標を追っていたり、間違った信念を持っていたりしても、それを公然と示せば運用者は対処できる。だからこそ信頼できる嘘発見器は、監視の仕組みにとって価値がある、という位置づけだ。ただし論文自身が「嘘発見器はモデルを整合させるわけではなく、隠すコストを上げるだけ」「モデルは何かを主張しなくても多くを隠せる」「検出しても、運用者側にそれを是正する経路が無ければ意味がない」という限界も明記している。

「訓練すれば良くなるはず」という直感に反して、分布外への汎化という点でプロンプトベースの手法を明確に上回れなかった、という結果は、AIの出力を検証する手法そのものの限界を示す事例として扱う価値がある。

2. 解釈可能性ツールは「予測の上乗せ」にならなかった

「Would This Change Your Answer?」(Adam Karvonen・Euan Ong・Subhash Kantamneni・Samuel Marks、2026年8月21日公開)は、CHIVE(Counterfactual Hypothesis Investigation Via Edits)というパイプラインを提案する論文だ。実運用中のLLMの挙動から「予期しない振る舞い」を自動発見し、プロンプトを反実仮想的に編集する実験でその原因を検証する仕組みで、数千件の検証データを生成した。

このデータを使って、活性化(activation)を読み取る3種類の解釈可能性ツール(activation oracles、natural-language autoencoders、sparse autoencoders)を評価したところ、いずれのツールも「transcript(会話ログ)だけを読んだ場合」を上回る予測精度を示さなかった。論文は、ツールの出力が挙動の「因果関係」そのものを明示的に述べておらず、予測エージェントは相関的な手がかりから因果を推測する必要があった、という理由を挙げている。ただし論文自身、この評価は「ground truthをサンプリングで得られる」という点で、実際のシステムカード評価(ground truthが無い状況)とは前提が異なるとも断っている。研究で発見された挙動は比較的単純なものが多く、より複雑な挙動への一般化は未検証だとしている。

3. 「答えの検証しづらい問い」に対する推論力を測る指標

「Introducing the Conceptual Reasoning Index」(Emery Cooper・Caspar Oesterheld・Chi Nguyen・Alex Kastner・Joe Benton・Ethan Perez、Redwood ResearchとAnthropicの共同研究、2026年8月12日公開)は、哲学やAI未来論のように経験的・数学的に検証しづらい問いに対する推論力(conceptual reasoning)を測る3つのベンチマーク(LMCA、ACCoRD、DTBench capabilities)と、それらを統合した指標CRIを提案している。2026年8月10日時点の計測で、最高スコアはOpus 5の73.6(推定上限91のうち)だったと報告している。専用サイト(conceptualreasoning.ai)でスコアを継続更新するとしている。

6〜7月分のブログ記事はまだ扱えていない

  • 3本とも記事一覧ページの月別見出しは「August 2026」だったが、個別記事の公開日(8月21日・8月21日・8月12日)は各記事ページの著者クレジット欄に記載されており、そこで直接確認した。
  • 各論文の統計的手法・実験デザインの妥当性そのものは、本記事では検証していない(一次資料の記述をそのまま要約している)。特にCRIの「推定上限91」という数字は、人間の評価者間の一致率から論文が独自に見積もったものであり、絶対的な基準ではない。
  • このブログは6月分(Diffuse AI Control)・7月分(Agentic Misalignment in Summer 2026、Modular Pretraining)が未着手のまま残っている。8月分の記事化により追跡を再開するが、6〜7月分の記事化は本記事のスコープ外。

Anthropicの他のアライメント研究はAnthropic「SLEIGHT-Bench」を公開Anthropic「Teaching Claude Why」を公開を参照。

この記事は2026年8月27日時点でAnthropic Alignment Science Blogを確認して書いたものです。

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読むの記事画像
研究08.27読了13

AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読む

出典 ─ Anthropic Institute「Wh
Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日の記事画像
研究08.31読了10

Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日

出典 ─ Anthropic公式ブログ「Funding
「AIモデルの福祉」を研究する仕事がある──Anthropicが2025年に始め、2026年に「退職面接」を実施した論点の記事画像
研究09.04読了12

「AIモデルの福祉」を研究する仕事がある──Anthropicが2025年に始め、2026年に「退職面接」を実施した論点

出典 ─ Anthropic
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼の記事画像
研究09.22読了10

Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼

出典 ─ Anthropic(2026年8月31日・9月18日取得)
Anthropic「SLEIGHT-Bench」、AI監視システムの死角を突く回避テキストのベンチマークを公開の記事画像
研究06.15読了5

Anthropic「SLEIGHT-Bench」、AI監視システムの死角を突く回避テキストのベンチマークを公開

出典 ─ SLEIGHT-Bench: Finding
Fable 5の生物学セーフガードが更新──フォールバック85%減、Anthropicが分類器の中身を公開したの記事画像
モデル08.29読了6

Fable 5の生物学セーフガードが更新──フォールバック85%減、Anthropicが分類器の中身を公開した

出典 ─ Anthropic「Improving Fa
Anthropicとは?Claude開発企業の戦略と安全性への取り組み【2026年版】の記事画像
業界08.04読了12

Anthropicとは?Claude開発企業の戦略と安全性への取り組み【2026年版】

出典 ─ Anthropic Series H Ann
Anthropicが「Life Sciences Verification Program」を開始──審査を通った生命科学の組織に、Mythos 5.1・Opus 5・Sonnet 5を生物学向けに緩めた安全装置で提供。Standard Use(年次更新・チーム単位)とHigh-risk Use(半年更新・プロジェクト単位・生命科学の遮断を全解除)、リアルタイム遮断から30日保持の事後監視への記事画像
業界09.21読了7

Anthropicが「Life Sciences Verification Program」を開始──審査を通った生命科学の組織に、Mythos 5.1・Opus 5・Sonnet 5を生物学向けに緩めた安全装置で提供。Standard Use(年次更新・チーム単位)とHigh-risk Use(半年更新・プロジェクト単位・生命科学の遮断を全解除)、リアルタイム遮断から30日保持の事後監視へ

出典 ─ Anthropic(2026年9月17日・9月18日取得)