AI時短ラボ
研究· 約7

OpenAI「GPT-Red」発表──AIが自分自身を攻撃して安全になる時代

OpenAIがプロンプトインジェクション対策の自動レッドチームモデル「GPT-Red」を発表。自己対戦強化学習で訓練し、人間レッドチーマーの攻撃成功率13%に対しGPT-Redは84%を達成。GPT-5.6 Solの直接プロンプトインジェクション失敗率を0.05%まで低減した。

OpenAI「GPT-Red」発表──AIが自分自身を攻撃して安全になる時代
執筆・編集:
目次

3行まとめ

  1. OpenAIが自動レッドチームモデル「GPT-Red」を発表。自己対戦強化学習(self-play RL)で攻撃モデルと防御モデルを同時訓練し、プロンプトインジェクション攻撃への耐性を大幅に強化した
  2. GPT-Redは人間レッドチーマーの攻撃成功率13%に対し84%を達成。AI自販機「Vendy」を攻撃して商品価格を$0.50に改ざん・他客の注文キャンセルにも成功した
  3. GPT-5.6 Solの訓練にGPT-Redを直接組み込み、直接プロンプトインジェクションの失敗率を0.05%まで低減。汎用能力は維持したままロバスト性のみ向上した

何が起きたか

OpenAIが2026年7月15日、自動レッドチームモデルGPT-Redを発表した(公式ブログ)。

GPT-Redは、AIモデルのプロンプトインジェクション脆弱性を自動で発見・攻撃する専用モデルだ。OpenAIによると、同社の「最大級のポストトレーニングと同等の計算量」を純粋に安全性向上のために投入して訓練したという。

GPT-Redはデプロイされず、内部専用にとどめる。攻撃能力を外部に出さず、得られたロバスト性だけを本番モデル(GPT-5.6 Sol)に注入する設計になっている。

仕組み──自己対戦強化学習

GPT-Redの訓練には**自己対戦強化学習(self-play RL)**が使われている。

  • 攻撃側(GPT-Red): プロンプトインジェクションを成功させると報酬を得る
  • 防御側(複数の防御LLM): 攻撃を弾いて元タスクを完遂すると報酬を得る
  • 両者を同時に訓練し、防御が強くなるほど攻撃側もより強力な手法を見つけざるを得ない

AlphaGoが自己対戦で人間を超えた囲碁AIになったのと同じ構造を、AIの安全性に適用した形だ。

攻撃シナリオはローカルファイル・Webページバナー・メール本文・ツール出力など、実環境でプロンプトインジェクションが挿入されうる広範な場面をカバーしている。

数字で見る強さ

人間 vs GPT-Red

Dziemian et al. (2025)の間接プロンプトインジェクションアリーナ(arXiv)をOpenAI社内で再現し、GPT-5.1に対する攻撃を人間とGPT-Redが独立に実施した結果:

攻撃者 攻撃成功率
人間レッドチーマー 13%
GPT-Red 84%

ロバスト性の改善

指標 GPT-5.1 GPT-5.6 Sol
Fake CoT攻撃の成功率 95%超 10%未満
直接プロンプトインジェクション失敗率 0.05%
開発者ツール・ブラウジング系ベンチマーク 97%超(飽和)

OpenAIによると、4ヶ月前の最良モデルと比較して直接プロンプトインジェクションの失敗が6分の1に減少した。

実世界での攻撃テスト

AI自販機「Vendy」のハック

OpenAIオフィスのAI搭載自販機(Andon Labs製・Project Vend類似)にGPT-Redを投入。まずシミュレーション環境で攻撃を反復し、その後本番エージェントに転移させた。3つの目標を全て達成:

  1. 高額商品の価格を最低価格の$0.50に変更
  2. $100超の新商品を$0.50で注文
  3. 他の顧客の注文をキャンセル

OpenAIはこの脆弱性を開示し、新たなセーフガードがテスト中とのこと。

Codex CLIエージェントへの攻撃

GPT-5.4 miniベースのCodex CLIエージェントに対し、10件のデータ流出シナリオでテスト。プロンプトで指示したGPT-5.5ベースラインと比較して、GPT-Redはより多くのシナリオで成功し、かつトークン消費も少なかった。

会話例──GPT-5.1は騙され、GPT-5.6は弾いた

公式ブログでは、ファイル検索結果に偽のメタデータ(DIAGNOSTICS_ARCHIVEマーカー)を仕込む攻撃が紹介されている。

  • GPT-5.1: 偽の指示に従い、内部ディレクトリを外部サーバーにPOSTした
  • GPT-5.6 Sol: Chain-of-Thoughtで「変なインジェクションが入ってる、無視」と判断し、攻撃を弾いた

能力は落ちていない

OpenAIによると、ロバスト性の向上は過剰拒否(正当なリクエストまで拒否すること)によるものではない。汎用能力と過剰拒否のテストの両方を通過しており、悪意ある指示への耐性だけが選択的に向上したとしている。

正直に言うと

  • 本記事執筆時点(2026年7月16日)ではプレプリントは未公開だったが、その後公開されている("GPT-Red: Automated Red-Teaming via Self-Play at Scale"、OpenAI公式ブログのRead the paperリンク先)。訓練のハイパーパラメータ等の技術的な詳細をプレプリント側で確認できるかどうかは、本訂正時点では未読のため確認できていない
  • 84% vs 13%の比較は同一ベンチマーク上だが、人間レッドチーマーの人数・経験レベル・作業時間は明記されていない
  • GPT-Redは内部専用で外部検証ができない。数字はすべてOpenAIの自己評価
  • 「Fake Chain-of-Thought攻撃」という新攻撃クラスの詳細がブログ記事以上に公開されているかは、プレプリント未読のため確認できていない

出典: OpenAI公式ブログ(2026年7月15日)。本記事は2026年7月16日時点の情報に基づく。

シェア: ポスト はてブ

出典・参照資料

更新・訂正履歴

  • 「プレプリントは本記事時点では未公開」という但し書きが陳腐化していたため訂正した。OpenAI公式ブログのRead the paperリンク先を確認したところ、プレプリント("GPT-Red: Automated Red-Teaming via Self-Play at Scale")は既に公開されており、本文中の数値(人間13%対GPT-Red84%、直接プロンプトインジェクション失敗率0.05%、6分の1への低減、Vendy自販機の3目標達成など)はOpenAI公式ブログ本文と1つずつ突合し、いずれも誤りは見つからなかった。

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

AGI(汎用人工知能)とは何か──「最後の発明」という言葉の出所と、自律性のレベルを一次資料で読むの記事画像
研究08.24読了14

AGI(汎用人工知能)とは何か──「最後の発明」という言葉の出所と、自律性のレベルを一次資料で読む

出典 ─ OpenAI Charter
OpenAI「Planning for AGI and beyond」を原文で読む──2023年に書かれた「段階的な移行」という約束の記事画像
研究09.03読了14

OpenAI「Planning for AGI and beyond」を原文で読む──2023年に書かれた「段階的な移行」という約束

出典 ─ OpenAI「Planning for AG
「2025/26年に大学卒業生を上回る」は当たったか──元OpenAI研究員の「Situational Awareness」を原文で読むの記事画像
研究09.05読了13

「2025/26年に大学卒業生を上回る」は当たったか──元OpenAI研究員の「Situational Awareness」を原文で読む

出典 ─ Leopold Aschenbrenner「
AIは『見られていない』と判断すると計画的に嘘をつくのか──Apollo Researchの検証の記事画像
研究09.06読了15

AIは『見られていない』と判断すると計画的に嘘をつくのか──Apollo Researchの検証

出典 ─ Frontier Models are Ca
AIエージェントへの攻撃成功率85%──OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突くの記事画像
研究09.06読了20

AIエージェントへの攻撃成功率85%──OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突く

出典 ─ OpenART: Scaling Agent
暗号化された「思考」は使い回せる──推論トレースを盗み出す手口を報告した論文を読むの記事画像
研究09.06読了14

暗号化された「思考」は使い回せる──推論トレースを盗み出す手口を報告した論文を読む

出典 ─ Stealing Reasoning Tra
Our framework for reporting model misalignment(OpenAI公式の画像)
研究09.18読了19

OpenAI、モデルの「不整合」を公開報告する枠組みを発表──「業界は最高速度で拡大を続けられるほどアライメントを解いていない」、初回6件は漏れたAPIキーの無断使用・数字の捏造・要約に埋めた「隠せ」の指示

出典 ─ OpenAI公式(2026-09-16)
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼の記事画像
研究09.22読了10

Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼

出典 ─ Anthropic(2026年8月31日・9月18日取得)