Claude Opus 5.5は本当に最強か──第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖
Claude Opus 5.5の公開から1日。Artificial Analysisの総合指数は212モデル中1位(58)、コーディングエージェントの指数も20組中1位、Vals AIのRSI Indexでは5つの研究課題のうち1つで初めて人間側の基準を超えた。一方で、セキュリティなどの作業は別モデルへ自動で切り替わる仕様で、Vals AIのSRE Benchは切り替え分を除くと33.59%から5.34%に下がる。第三者の数字、筆者の評価、Hacker NewsとXの反応をまとめた。

目次
2026年9月24日・日本時間時点の情報です。 Claude Opus 5.5の公開(9月22日)から1日たち、第三者の評価が出そろってきた。Artificial AnalysisとVals AIの2社の総合指数ではどちらも1位で、Vals AIの「RSI Index」では、モデルが次のモデルを作る研究の課題5つのうち1つで、初めて人間側の基準を超えた。一方で、セキュリティなどの作業は別のモデルに自動で切り替わる仕様があり、一部のベンチマークの点数にはその分が混ざっている。この記事では、第三者の数字、筆者自身の評価、コミュニティの反応を順に並べる。動画版はこちら(YouTube)。公開当日の発表内容はOpus 5.5の速報記事、使い方は公式プロンプトガイドの解説にまとめてある。
3行まとめ
- Artificial Analysisの総合指数で212モデル中1位(58)。 これまで首位だったClaude Fable 5.1とGPT-6 Astraは53。コーディングエージェントの指数でも、Claude Code+Opus 5.5が66.0で20組中1位。Vals AIの総合指数も69.69%で65モデル中1位。
- Vals AIのRSI Indexで、5つの研究課題のうち1つで初めて人間側の基準を超えた。 小さなGPTの学習を改善する課題で0.8308(基準は2019年の論文の0.85、低いほど良い)。総合37.13%で19モデル中1位。
- ただし、セキュリティ系の作業はOpus 4.8へ自動で切り替わる。 Vals AIのSRE Benchは262タスク中217が切り替え分で、それを失敗として数えると33.59%が5.34%になる。総合のVals Indexは切り替え分を除いても69.69%・1位のまま。
第三者の総合指数:2社とも1位
| 指数 | Opus 5.5 | 比較 |
|---|---|---|
| Artificial Analysis Intelligence Index(effort最大) | 57.6(表示58・212モデル中1位) | Fable 5.1 53.4/GPT-6 Astra 52.7/Opus 5 50.8/GPT-6 Sol 47.5 |
| 同・effort high | 53.6 | 他社の最上位(Astra 52.7)を上回る |
| Vals Index | 69.69%(65モデル中1位) | Fable 5.1 68.83%/Opus 5 67.21%/Astra 66.61% |
Artificial Analysisによると、Opus 5.5の最上位設定(max)は、同社の指数の1タスクを解くのに5.98ドルかかる。GPT-6 Astraの最上位は3.26ドルなので、点数は高いがコストも高い。
コーディング:1位だが、一番高くて遅い部類
Artificial Analysisの「Coding Agent Index」は、Claude CodeやCodexのようなエージェントとモデルの組み合わせで測る。3つのテスト(DeepSWE、Terminal-Bench 4.0、SWE-Atlas-QnA)の平均だ。
| 組み合わせ | 指数 | 1タスクのコスト | 1タスクの時間 |
|---|---|---|---|
| Claude Code+Opus 5.5 | 66.0 | 13.04ドル | 約64分 |
| Claude Code+Fable 5.1 | 62.2 | 12.39ドル | 約35分 |
| Codex+GPT-6 Astra | 61.6 | 7.47ドル | 約29分 |
| Codex+GPT-6 Sol | 56.7 | 2.99ドル | 約22分 |
Terminal-Bench 4.0では63.1で、2位のFable 5.1(57.6)を離した。一方、DeepSWEは68.4で、Muse Spark 1.3(73.2)やGrok 4.7(72.6)の方が上だった。表の右2列のとおり、1位は時間とお金をかけて取っている。Vals AIでも、Terminal-Bench 2.1(87.64%)とProgramBench(18.50%)で1位だった。
RSI Index:研究課題で初めて人間の基準を超えた
Vals AIのRSI Indexは、「次のモデルを作る研究を、モデルが自力でどこまでできるか」を測る指数だ。Claude CodeやCodexに入れたモデルに研究課題を渡し、12〜30時間、人の手を借りずに進めさせる。採点は0が出発点、0.5が人間や論文の基準、1が理論上の最良。
| 課題(Opus 5.5) | スコア | 順位 |
|---|---|---|
| LM training(小さなGPTの学習改善) | 0.530 | 1位 |
| Compression(圧縮) | 0.465 | 1位 |
| Parameter Golf(16MBの小型モデル) | 0.414 | 1位 |
| Post-training(追加学習) | 0.351 | 1位 |
| Harness engineering(別のAIの採点の仕組みを改善) | 0.096 | 11位 |
0.5を超えたのはLM trainingの1つだけだ。基準は2019年の論文の64層のモデルで0.85、Opus 5.5は0.8308で下回った(この数値は低いほど良い)。Vals AIは、論文と同じ条件での再現ではないと明記している。総合は37.13%で1位、2位はFable 5.1の35.03%、GPT-6 Astraは29.03%。
Vals AIはこの結果全体を「Execution outpaced judgment(実行力が判断力を上回った)」とまとめている。実験を回して測り間違いを直すのは得意だが、筋のいい方向を見つけて攻める判断力はまだ足りない、という評価だ。
1位の数字に混ざっているもの:フォールバック
Anthropicの発表によると、Opus 5.5はサイバーセキュリティや生物などの分野に安全対策があり、該当する作業は別のモデルに自動で切り替わる。ほとんどのサイバーセキュリティ作業はOpus 4.8に回ると書かれている。理由は、Opus 5.5が生物とサイバーセキュリティでClaude Mythos 5.1に匹敵するから、としている。
Vals AIは、切り替わった分を失敗として数えた場合の点数も出している。
| ベンチ | 通常 | 切り替え分を失敗扱い | 順位 |
|---|---|---|---|
| SRE Bench(システム障害の対応) | 33.59% | 5.34% | 2位→5位 |
| Vibe Code Bench v1.1 | 90.29% | 83.34% | 2位→11位 |
| Terminal-Bench 4.0 | 61.62% | 53.53% | 1位→2位 |
| Vals Index(総合) | 69.69% | 69.69% | 1位のまま |
SRE Benchは262タスク中217が切り替え分だった。Artificial AnalysisのCoding Agent Indexでも、909回の試行のうち78回(9.1%)が切り替わっている。ほかに、Vals AIの法務エージェントのテストは3.75%(69モデル中33位)で、得意とは言えない。
筆者の評価:性能は間違いない、ただし暴れ馬
ここからは、この記事と動画を作っている筆者自身の評価だ。
Opusはもともと、作業をどんどん勝手に進めたがるタイプのモデルだった。要所要所で必要な下調べや確認を取らずに、とりあえず成果物を出したがる。これが5.5で治ったかを、自分で付けているルールや仕組み(いわゆるハーネス)で縛っていない部分で試したが、はっきり言って治っていなかった。Claude Code自体もハーネスの一種だが、ここで言うのは、使う人がその上に自分で足すものだ。
ただ、性能が高いのは間違いない。ハーネスに左右されがちなモデル、というのが筆者の印象だ。
筆者はOpusをよく使うし好きだが、ハーネス依存のモデルは好きではない。ハーネスは無くて済むなら無い方がいい。ハーネス自体が悪さをすることがあるし、作って整える手間も、モデルが更新されるたびに見直す手間もかかる。Opus用に作ったハーネスが、Fableでは不要どころか邪魔になることもよくある。
ここで言う「暴れる」は、何でも止まらずに進めることではない。確認が要る所と要らない所を区別せずに、とりあえず進めることだ。自走する力が上がったことと、この区別ができないことは矛盾しない。Vals AIの「実行力が判断力を上回った」という総括とも重なる。
なお、上のフォールバックは、かなり専門的な使い方でないと滅多に当たらない。筆者の使い方ではたまにしか当たらないので、この評価には入れていない。
コミュニティの反応
Hacker News:公式発表のスレッドは1,672ポイント・コメント1,022件(2026年9月24日取得時点)。好意的な声は値下げと「Fable 5.1並みなのにOpus 5より安い」点に集まり、否定的な声には、セキュリティ作業が別モデルに回される不満や、数週間で性能を落とされるのではという不信があった。
X:反応が大きい投稿の多くは、Opus 5.5にコードだけでアニメーションや動画を作らせたものだった。全フレームをJavaScriptで描いたアニメーション(5,833いいね)、自分の一生をアニメにさせた投稿(4,090いいね)などで、画像生成や動画生成は使っていないと書かれている。日本語でも「5分もかからずピクセルアニメーションを出してきた」という投稿が伸びていた。動画やデザインが本当に上手いのかは、別の動画で検証する予定だ。
AnthropicのNat McAleese氏は「Opus 5.5はOpus 5よりずっとずっと良い。あのモデル(Opus 5)はごめん、こっちを試して」と投稿し、1万いいねを超えた(本人のプロフィールには個人の見解と記載)。目立ったのは「性能を落とさないでほしい」という声で、「Opus 5と同じ過ちをしないで」という投稿は3,416いいねだった。
噂:Google所属のPatrick Toulme氏は「より大きな社内モデル(おそらくMythos)から蒸留されたので小さくて安い」と投稿し、5,429いいねを集めた。教師モデルがMythos 5.1だから強い、という説もある。どちらも根拠は示されておらず、Anthropicは認めていない。公式が言っているのは「生物とサイバーセキュリティでMythos 5.1に匹敵する」というところまでだ。
結論:暴れる癖を差し引いても、現行最強
第三者のベンチマークでは、総合もコーディングも研究課題も、Opus 5.5が1位だった。ただし一番高くて遅い部類で、専門的な分野ではフォールバックが点数に混ざっている。筆者の評価は、暴れる癖は治っていないが、それを差し引いても本当にいいモデル。コミュニティの反応も大きく好意的だ。現時点では、Opus 5.5が現行最強のモデルだと筆者は判断している。
みなさんの評価も、動画のコメント欄で教えてほしい。
数字の取得時点と、確かめられなかったこと
- ベンチマークの数字と順位は、2026年9月24日に各サイトを取得した時点のもの。モデルが追加されると順位は変わる。
- Artificial Analysisの比較は各社の最上位設定(effort最大)同士。
- Vals AIの「切り替え分を失敗扱い」の数字は、同社サイトの切り替え表示で確認した。
- RSI Indexは、Vals AIが明記しているとおり各モデル1回ずつの実行。
- XとHacker Newsの数字は取得時点のもの。Redditは取得できなかった(本記事の確認範囲外)。
- 蒸留とMythos 5.1の話は、根拠が示されていない噂・説として扱った。
出典・参照資料
- 一次資料Anthropic公式発表「Claude Opus 5.5」(2026-09-22) ↗
- 一次資料Artificial Analysis:Claude Opus 5.5 リリースページ(2026-09-24取得) ↗
- 一次資料Artificial Analysis:Claude Opus 5.5 モデルページ(2026-09-24取得) ↗
- 一次資料Artificial Analysis:Coding Agent Index(2026-09-24取得) ↗
- 一次資料Vals AI:Claude Opus 5.5 モデルページ(2026-09-24取得) ↗
- 一次資料Vals AI:RSI Index(2026-09-21更新) ↗
- 二次資料Hacker News:Claude Opus 5.5 スレッド ↗
- 二次資料X:Nat McAleese氏(Anthropic)の投稿 ↗
- 二次資料X:Patrick Toulme氏の投稿(蒸留の噂) ↗
この記事の解説動画
YouTubeで見る ↗AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。