Anthropicの「責任あるスケーリングポリシー」とは──v1.0からv3.4まで、9回の改訂を公式ページで追う
Anthropicは2023年9月にRSP(Responsible Scaling Policy)v1.0を公開して以来、2026年7月8日のv3.4まで改訂を重ねてきた。v3.0は方針全体の書き直し、v3.4は自動化されたAI研究開発の閾値見直しなど、公式ページに残る変更履歴を一次資料で確認する。

目次
Anthropicが「責任あるスケーリングポリシー(Responsible Scaling Policy、RSP)」を最初に公開したのは2023年9月19日だ。以来、公式ページには全ての改訂履歴が残っており、2026年8月27日時点の最新版はv3.4(2026年7月8日発効)にあたる。公式ページを確認し、9回の改訂を一次資料でたどる。
RSPはAnthropicが2023年9月19日に公開した、AIの「破局的リスク」(数千人規模の死者や数千億ドル規模の損害)を管理するための自主的な枠組みだ。生物学的な安全対策レベル(BSL)を参考にした「ASL(AI Safety Level)」という段階制を軸に、2026年7月8日のv3.4まで9回改訂されてきた。v1.0時点で表の中に「…」が置かれていたのはASL-5+の行だけで、ASL-4には「Early Thoughts on ASL-4 and Higher」という独立した節があり3つの推測基準が書かれていたが、v3.0(2026年2月)でポリシー全体が書き直され、「Frontier Safety Roadmap」と「Risk Report」という新しい仕組みが導入された。
バージョン一覧と発効日
公式ページ「Current and Prior Versions」で確認できる一覧は次の通り。
| バージョン | 発効日 |
|---|---|
| v1.0 | 2023年9月19日 |
| v2.0 | 2024年10月15日 |
| v2.1 | 2025年3月31日 |
| v2.2 | 2025年5月14日 |
| v3.0 | 2026年2月24日 |
| v3.1 | 2026年4月2日 |
| v3.2 | 2026年4月29日 |
| v3.3 | 2026年5月26日 |
| v3.4 | 2026年7月8日 |
Anthropicはページ冒頭で「このドキュメントは生きたドキュメントであり、実運用での学びを踏まえて今後も改訂を続ける」と明記している。
各バージョンで何が変わったか
公式ページの更新履歴(changelog)を確認した内容を要約する。
v1.0(2023年9月19日):RSPの初版。
v2.0(2024年10月15日):ASL-3(AI Safety Level 3)の安全対策の計画を公開。デプロイメント側は、化学・生物・放射性物質・核(CBRN)技術の悪用防止に焦点を当てた「多層防御」アーキテクチャ(アクセス制御、リアルタイムの分類器、非同期監視、事後のジェイルブレイク検知の4層)を導入するとした。セキュリティ側は、アクセス管理の階層化、モデルの重みへのアクセス制御、SLSA等のフレームワークを用いたアーティファクトの完全性確保など、具体的な技術的対策を列挙している。
v2.1(2025年3月31日):ASL-3を超える安全対策が必要となる「能力閾値」の明確化。CBRN開発に関する新しい閾値を追加し、既存のAI研究開発(AI R&D)閾値を2段階(エントリーレベルのAI研究業務を完全自動化する能力と、有効なスケーリング速度を劇的に加速させる能力)に分解した。
v2.2(2025年5月14日):軽微な改訂。ASL-3セキュリティ基準の対象から「高度に洗練された、国家に侵害されたインサイダー」だけでなく、「洗練されたインサイダー」全般を除外する脚注修正。
v3.0(2026年2月24日):ポリシー全体の包括的な書き直し。「Frontier Safety Roadmap(フロンティア安全ロードマップ)」という詳細な安全目標の文書と、全ての配備済みモデルにわたるリスクを定量化する「Risk Report(リスクレポート)」の公開を新たに導入した。
v3.1(2026年4月2日):v3で読者から指摘された2点の言語的な曖昧さを明確化する軽微な修正。AI研究開発の能力閾値について「AIが2018〜2024年の2年分の進歩を1年に圧縮する」という表現が「集計されたAI能力全体の進歩速度を倍にする」のか「研究者個人の生産性を倍にする」のか曖昧だった点を、前者の意味だと明確化。また、RSPで義務付けられていない場合でも、Anthropicが適切と判断すればAI開発の一時停止などの措置を独自に取れることを、より明確に記述した。
v3.2(2026年4月29日):Long-Term Benefit Trust(LTBT、長期便益信託)にリスクレポートの外部レビューを要求する権限、外部レビュアー選定を承認する権限を付与し、LTBTへの定期的な報告を制度化。
v3.3(2026年5月26日):新規の化学・生物兵器製造に関する閾値を、想定される脅威モデルにより即したものに改訂。個別モデルのリスクについてのオフサイクル更新の運用方法を改善。用語の軽微な変更。
v3.4(2026年7月8日):自動化されたAI研究開発(Automated R&D)の閾値を、想定される脅威モデルにより即したものに改訂。未編集版リスクレポートの社内共有義務を、全ての一般クリアランス保持社員への共有から、少なくとも200人への共有に変更。リスクレポートが公開日ではなく特定の「対象基準日」時点のリスクを分析できるよう変更(直近の変化を急いで分析する必要を避けるため)。公開版リスクレポートに、どこが編集で伏せられたかを示す表示を義務化。リスクレポートの外部レビューについて、複数の外部レビュアーが異なる未編集セクションをそれぞれレビューする形(全体を1人がレビューする必要はない)でもよいことを明確化。
v1.0原文を読む:「…」だったのはASL-5+で、ASL-4には推測基準が3つあった
v1.0のPDF原文を直接確認すると、公式ページの要約だけでは伝わらない、初版ならではの率直さが見える。冒頭でAnthropicはこの取り組みの出自をこう説明している。
"Our commitments are designed in the spirit of the Responsible Scaling Policy (RSP) framework being developed by Paul Christiano and ARC Evals, as well as emerging government policy proposals on responsible AI development in the UK, EU, and US. We thank ARC Evals for substantial advice and collaboration on the development of our commitments."
RSPという枠組み自体、Anthropicの完全なオリジナルではなく、Paul Christiano氏とARC Evalsが開発していた枠組みの精神に沿って設計され、ARC Evalsの助言・協力を受けたと明記されている。ASL(AI Safety Level)という段階分けも、「米国政府のバイオセーフティレベル(BSL)基準を緩やかに参考にした」ものだと説明されている。
v1.0が定義していたASL-1〜3の内容を表にすると、次のようになる。
| レベル | 定義(v1.0原文の要約) | 具体例 |
|---|---|---|
| ASL-1 | 破局的リスクを明白かつ疑いなく持たないモデル | 「2018年のLLM」「チェスだけを指すよう訓練されたAIシステム」 |
| ASL-2(当時の現行水準) | 破局的な結果を招く能力はないが、その兆候が見え始めている | 「検索エンジンでは見つからない生物兵器関連の情報を提供できるが、実用に足るほど確実ではないAIシステム」 |
| ASL-3(当時「準備中」) | アクセスできれば破局的な悪用リスクが大幅に高まる自律能力・情報 | 具体例の記載なし。非国家主体が重みを盗めない水準のセキュリティ強化などを要求 |
| ASL-4以降 | 「ASL-3モデルの訓練前にASL-4の評価基準を定義する」という手続き的コミットメントのみ | 具体的な基準は原文で「…」(省略記号)のまま、未定義 |
v1.0の時点でAnthropicが「当時の現行水準」としていたのはASL-2だった。表の中で「…」という記号だけが置かれていたのはASL-5+の行で(2026年9月4日にv1.0のPDFを取得して確認。「…」はPDF全体で1回しか現れない)、ASL-4には「Early Thoughts on ASL-4 and Higher」という独立した節(目次にも記載・本文14ページ)があり、「It is too early to define ASL-4 capabilities, containment measures, or deployment measures with any confidence(ASL-4の能力・封じ込め策・展開策を確信をもって定義するには早すぎる)」と断ったうえで、①国家安全保障上のリスクの主因になり、安全策なしの展開が数百万人規模の死者を招きうる「重大な破局的悪用リスク」②現実世界での自律的な複製・資源獲得・停止回避 ③悪意あるAI開発計画を大きく後押しする自律的AI研究、という3つの推測基準が挙げられていた。つまり初版は「ASL-4は白紙」だったのではなく、「ASL-4は推測として3点を置き、ASL-5+は空欄」という状態だった。これは公式ページの現行版changelogだけを読んでいても伝わらない。
v2.0(2024年10月)の原文も確認すると、記事本文で紹介した「多層防御」について、ASL-3のデプロイ基準を満たすための5つの基準がより具体的に書かれていた。
"1. Threat modeling ... 2. Defense in depth: Use a 'defense in depth' approach by building a series of defensive layers... 3. Red-teaming ... 4. Rapid remediation: Show that any compromises of the deployed system, such as jailbreaks or other attack pathways, will be identified and remediated promptly enough... 5. Monitoring: Prespecify empirical evidence that would show the system is operating within the accepted risk range..."
脅威モデリング・多層防御・レッドチーミング・迅速な是正・モニタリングの5点を満たすことが、ASL-3水準のデプロイを認める基準として原文に明記されている。
v3.4原文:「閾値を越えたと見なさない」ケースまで具体的に書かれている
v3.4のPDF原文(本文末尾のChangelog)を確認すると、公式ページの要約以上に細かい条件分岐が書かれている。自動化されたAI研究開発(Automated R&D)の閾値改訂について、原文はこう説明する。
"It revises the Automated R&D capability threshold in light of further issues that have come up in discussion - particularly the question of whether we'd consider the threshold to be crossed if the overall rate of AI progress were constant or slowing, but we estimated that it was dramatically faster than it would be in the absence of advanced AI tools. We would not: in this case there could be a strong argument for expecting the trend to continue rather than accelerate..."
(AI進歩の全体的な速度が一定または鈍化している一方で、先進的なAIツールがなかった場合と比べれば劇的に速いと推定される場合、それを閾値超過と見なすかという論点について、Anthropicは「見なさない」と原文で明記している。非AI要因による減速がAI由来の加速を相殺し続けている限り、トレンドが加速するのではなく継続すると期待する強い根拠がありうるため、というのがその理由だ)
この閾値は「劇的な再帰的自己改善(recursive self-improvement)の始まり」を捉えることを意図しているが、原文は「運用可能な形に落とし込むのが難しいことが判明している(has proven difficult to operationalize)」とも認めている。公式ページのchangelog要約が「想定される脅威モデルにより即したものに改訂」とだけ書いていた部分の具体的な中身は、原文でしか読めなかった。
またv3.4のAppendix B「Notes on ASLs」では、v3.0以降になぜ「ASL(AI Safety Level)ごとに必要な管理策を具体的に列挙する」やり方をやめたのかについて、「将来の能力水準に必要なリスク軽減策を定義する際、管理策の具体的なリストを示すのは硬直的すぎることが分かった。代わりに、AI開発者がそのシステムのリスク水準についてどのような論証をすべきかに焦点を当てることを選んだ」という説明がある。v1.0で見た「ASL-4以降は…(未定義)」という率直な空白は、v3.0以降は「具体策の列挙」自体を方針として手放したことで解消された、という理解になる。
リスクレポートという仕組み
v3.0で導入された「Risk Report」は、公式ページによれば「Anthropicの自社システムのリスクと、それへの備えの状況について、直接的・率直・情報量のある説明を提供する」ことを目的とする。2026年8月14日には「August 2026 Risk Report」が公開されており、対象期間は2月の前回レポートから7月15日までとされている。これは既存記事Anthropicが自社AIの危険度を3つとも引き上げたで扱った内容と同じ枠組みだ。
v3.0〜v3.4のPDF原文・redline差分までは読み込んでいない
- v1.0・v2.0・v3.4のPDF原文は本記事で直接読み込んだが、v2.1〜v3.3の各バージョンのPDF本文・redline(変更箇所を示す差分表示)そのものは、公式ページの更新履歴の説明文をそのまま紹介するにとどまり、原文までは読み込んでいない。9バージョン全ての原文を突き合わせた全文比較ではない。
- 「なぜこのタイミングで改訂されたか」という背景(社内の議論プロセスなど)は公式ページ・原文PDFからは分からず、本記事の範囲外。
- v1.0原文が言及する「Paul Christiano氏・ARC Evals」との協力関係が、その後のバージョンでどう変化したか(継続しているか、独自路線に変わったか)は、本記事では確認していない
RSPが対処しようとしている「目標のずれ」の理論的背景は「ペーパークリップを増やし続けるAI」の話はどこから来たか、Anthropicの企業としての全体像はAnthropicとは?Claude開発企業の戦略と安全性への取り組みを参照。
この記事は2026年8月27日時点でAnthropic公式ページを確認して書いたものです。
出典・参照資料
- 一次資料Anthropic「Anthropic's Responsible Scaling Policy」公式ページ ↗
- 一次資料Anthropic's Responsible Scaling Policy Version 1.0(原文PDF、2023-09-19) ↗
- 一次資料Anthropic's Responsible Scaling Policy Version 2.0(原文PDF、2024-10-15) ↗
- 二次資料Anthropic's Responsible Scaling Policy Version 3.4(原文PDF、2026-07-08発効) ↗
- 二次資料Anthropic's Responsible Scaling Policy v3.3→v3.4 redline(変更箇所の追跡表示PDF) ↗
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。