Odysseyの世界モデル「Agora-2」にOpus 5.5を4回入れてみた──0キルから50キル、ボス撃破まで。ゲームエンジンのどこをAIが引き受け、どこがルールのまま残っているか
Odysseyが9月21日に公開したマルチエージェント世界モデル「Agora-2」は、ゲームエンジンの「ルールの計算」と「画面の描画」を2つの学習モデルに置き換え、人間とAIが同じ世界に入れる研究プレビューとしてブラウザで公開されている。技術レポートによると、人間が操作できるのは最大4人で残り16体は自律キャラ、地図・シナリオ・敵の出現・ポータルは今も従来のエンジンが受け持つ。AI時短ラボは9月25日にClaude Opus 5.5へ4回プレイさせた。画面を見て1手ずつ操作した1・2回目は0キル、ページが受け取る地図と位置のデータを読むプログラムを自分で書いた3回目にボスのAndarielを倒し、4回目は50キルだった。

目次
2026年9月25日夜・日本時間時点の情報です。Odysseyは9月21日、人間とAIエージェントが同じ世界に入って遊べるマルチエージェント世界モデル「Agora-2」の研究プレビューを公開し、ブラウザ(agora.odyssey.systems)から誰でも試せるようにした。公式ブログによると、Agora-2はDiablo II(Blizzard)のキャプチャで学習しており、実質的に「a learned game engine(学習されたゲームエンジン)」として働く。AI時短ラボでは、あわせて公開された技術レポート(23ページ)を読み、9月25日の午後にAnthropicのClaude Opus 5.5に4回プレイさせた。
この記事では、ブログ、技術レポート、Odysseyの過去の発表3本、それに4回分のプレイ記録(録画・終了画面のスコア表・ページが受け取った状態データ)をもとに、Agora-2がゲームエンジンのどの仕事をAIに置き換え、どこを従来のルールに残しているかを整理する。動画版(15分45秒)も公開している: https://youtu.be/5VLHU0BD8_4
3行まとめ
- Agora-2は、ゲームエンジンの「ルールの計算」と「画面の描画」を、2つの学習モデルに分けて置き換えた。 技術レポートによると、約446万パラメータのシミュレーションモデルが全員の操作から次の瞬間の共有状態(移動・攻撃・ダメージ・アニメーション)を予測し、約10億パラメータの描画モデルがその状態から各プレイヤーの640×480の画面を生成する。描画モデルはプレイヤー1人にGPU1枚で、毎秒30コマは目標値。
- ただしエンジンが無くなったわけではない。 レポートは、地図・シナリオ・敵の出現の足場・ポータルなどは従来のゲームエンジンが今も受け持ち、死亡や復活の管理はサーバーのルールが行うと書いている。ブログの「最大20の人間とエージェント」も、レポートでは人間が操作できるのは最大4人で、残り16体は自律キャラという内訳になっている。
- Opus 5.5は、画面を見て1手ずつ操作した1・2回目は0キルだった。 ページが受け取る地図と位置のデータを読んで道を計算するプログラムを自分で書いた3回目にボスのAndarielを倒し(体力140→16.5)、直した4回目は50キル2デス。4回目には、Opus 5.5が40マス以上離れている間にAIの仲間2体が画面の外でAndarielを倒しており、画面とは別に世界の状態が進んでいることを記録で確かめられた。
Agora-2の要点
| 項目 | 内容(出典) |
|---|---|
| 発表 | 2026年9月21日、Odysseyブログ「Introducing Agora-2」(Oliver Cameron氏) |
| 何か | 人間とエージェントが共有する世界をリアルタイムに生成するマルチエージェント世界モデル。公開されたのは遊べる研究プレビュー(ブログ) |
| 参加者 | ブログ:最大20の人間とエージェント(Agora-1の5倍)/レポート:人間の操作は最大4人+自律キャラ16体 |
| 題材 | ブログ:Diablo IIのキャプチャで学習/レポート本文:計装したRust製のアイソメトリック(斜め見下ろし)ゲームエンジンから記録 |
| しくみ | シミュレーションモデル(約446万パラメータ)が共有状態を進め、プレイヤーごとの描画モデル(約10億パラメータ・flow matching)が画面を作る(レポート) |
| 画面 | 640×480。潜在表現の更新を毎秒15回、表示を毎秒30コマにするのが目標(レポート §6.2) |
| 学習 | 描画モデルは約433万区間の記録で、B200 GPU 32枚を使い6万回+6万回の更新(レポート 付録A) |
| 配信 | 4人のセッションでNVIDIA RTX PRO 4500を4枚。1枚につき1人分の描画モデル(レポート §6.1) |
| 前作 | Agora-1(2026年5月18日)。題材はGoldenEyeで、最大4人 |
| 遊び方 | agora.odyssey.systems。9月25日時点ではログインなしで始められ、1試合10分 |
ブログとレポートで書き方が違う2点
1つ目は人数だ。ブログは「最大20の人間とエージェント」と書くが、レポートの序論は、人間が操作するキャラ最大4体と自律キャラ16体を同時に扱うと説明している。合計は20で一致するが、20人の人間が同時に遊べるという意味ではない。今回のプレイでも、待合室の表示は「1/4」のように最大4人だった。
2つ目は題材だ。ブログはDiablo IIのキャプチャで学習したと書いている。一方、今回取得したレポートのPDFを全文検索すると「Diablo」は0件で、データの節には「計装したRust製のアイソメトリックゲームエンジン」から記録したとある。ただしレポートの図3にはDurielというボスの名前が出てきて、今回のプレイでもAndarielとMephistoというボスが現れた。どちらもDiablo IIに出てくるボスと同じ名前だ。レポートが言うRust製のエンジンが、Diablo IIを再現したものなのか別物なのかは、この2つの文書だけでは判断できない。
世界モデルとは何で、Odysseyはなぜゲームから始めるのか
Odysseyは9月15日のOdyssey-3の発表で、世界モデルを「learned dynamical systems(学習された力学系)」と説明している。今の状態と行動を入れると、次に世界がどうなるかを予測するモデルのことだ。言語モデルが次の単語を予測するのに対し、世界モデルは次の瞬間の世界を予測する。予測を繰り返せば、そのまま世界のシミュレーターとして使える。
では、シミュレーターがあると何がうれしいのか。Odysseyは6月12日のブログ「The Era of Multi-Agent Imagined Experience」で、AIの歩みを3幕に分けている。囲碁やチェスのように自分と対戦して強くなった時代、人間の文章を大量に真似して学ぶ大規模言語モデルの時代、そして今から始まる「経験の時代」だ。その中心にある考え方を、ブログは「an agent doesn't have to learn in the real world.(エージェントは現実世界で学ぶ必要がない)」と書く。世界モデルの中で練習し、身につけた技を現実に持ち出せばよい、という主張だ。
実例として、Odyssey-3の発表は、シミュレーションの運転データ20時間だけで学んだ方策が、インドの道路で車を閉ループで自動運転したと書いている。安全ドライバーが介入するまでに走れた距離は、実際の走行映像で学んだ方策の約77%だったという。
Agora-2はこの流れを複数のエージェントに広げたものだ。ブログは使い道として、AIの訓練・ロボット・自動運転・防衛・エネルギー・サイバーセキュリティ・ゲームを挙げる。背景として、AIを使ったサイバー攻撃やエージェント同士の談合が報告されていることにも触れ、AI同士の関わり方を、現実のシステムを危険にさらさずに調べる手段になるとしている。ブログはさらに、強化学習で訓練したエージェントに、相手を追う・障害物を避ける・行き詰まったら抜け出す、といった行動を学ばせていると説明し、エージェントと、それを鍛える世界モデルが互いを改善していく研究としてPROWL(arXiv 2605.18803)を挙げている。
ルールの係と絵の係:ゲームエンジンの2つの仕事をどう置き換えたか
ふつうのゲームでは、人が書いたコードが動き・当たり判定・ダメージを計算し、その結果を決まった絵として画面に描く。レポートによると、Agora-2はこの2つの仕事を別々の学習モデルに任せている。
ルールの係=シミュレーションモデル。 約446万パラメータ(付録では4,457,777)、4層で幅256のTransformerだ。全員の操作と直前の状態から、次の瞬間の共有状態を予測する。移動は、あらかじめ決めた14通りの動き方から1つを選ぶ。攻撃は3つの時計(攻撃の進み具合など)がどう進むかを予測し、ダメージ・アニメーションの種類と段階・飛び道具の発射と着弾も予測する。ルールの係は、パラメータ数でいえば描画モデルの200分の1以下の大きさしかない。
絵の係=描画モデル。 約10億パラメータの、flow matchingで学習したTransformer(16ブロック)だ。周囲12×12マスの地形、キャラ、エフェクトを1つずつトークンとして受け取り、そのプレイヤーの直前の映像も参照しながら、5段階の生成で潜在表現を1つ作る。1つの潜在表現から2コマ分の映像が出てくる。ブログによると、学習中はわざと直前の映像を頻繁に取り除き、渡された状態を頼りに描くよう仕向けているという。
動き方。 レポートの§6.2によると、ブラウザから届いた操作とエージェントの行動をシミュレーションモデルが受け取り、サーバーがその予測を適用して共有状態を進める。その後、プレイヤーごとの描画モデルが次の画面を生成し、WebRTCで各ブラウザへ送る。シミュレーションは毎秒30回の刻みで進み、描画は毎秒15回の潜在の更新=30コマの表示を目標にしている。
学び方。 レポートの§5によると、お手本になる本物のゲームエンジンを並列でたくさん動かし、各刻みの操作・全キャラの状態・何が起きたか・各プレイヤーの画面を記録した。学習データは、シミュレーションモデル用が1,108,800区間、描画モデル用が4,332,800区間。ふつうのプレイでは、壁に押し付ける・狭い隙間を通る・攻撃を空振りするといった場面がほとんど出てこない。そこでこうした場面を再現するシナリオを別に用意し、多めに集めたと書かれている。
AIが予測する部分と、ルールのまま残る部分
レポートの表2と§6.2は、どこが学習モデルでどこがルールかを分けて書いている。まとめると次のとおり。
| 担当 | 受け持つこと(レポート 表2・§6.2) |
|---|---|
| シミュレーションモデル(学習) | 移動の枝と向きの選択、攻撃とクールダウンの時計、ダメージ、飛び道具、アニメーションの種類と段階 |
| 描画モデル(学習) | 状態と直前の映像から、プレイヤーごとの次の画面を生成 |
| エージェント方策(学習) | 自律キャラの行動を選ぶ |
| サーバー | 予測を適用して共有状態を進める。体力、死亡・死体の消去・出現・復活・回復のルール |
| 従来のゲームエンジン | 地図、シナリオ、敵が出てくる足場、シナリオが持つ物の効果 |
従来のエンジンが残っている部分について、レポートは「Native-engine scaffolding supplies maps, scenarios, spawning, and scenario-owned world-object effects.(ネイティブエンジンの足場が、地図・シナリオ・出現・シナリオが持つ物の効果を供給する)」と書いている。図3の説明でも、動きと描画は学習によるものだが、ポータルの出現はシナリオ側のルールに従う、と断っている。
つまり、「ゲームエンジン無しで動く」は言い過ぎだ。動き・戦闘・画面は学習モデルの予測から出てくるが、世界の骨組みと生死の管理はルールが持っている。学習にはお手本のエンジンも必要だった。AI時短ラボの解釈では、エンジンを消したというより、エンジンがやっていた中心の仕事を、学習モデルで再現できるようになった段階と読むのが近い。
Opus 5.5に4回遊ばせた記録:0キル、0キル、4キル、50キル
ここからは、AI時短ラボが9月25日の午後(日本時間)に実際にプレイした記録だ。操作したのはAnthropicのClaude Opus 5.5で、専用に立ち上げたブラウザを、決まった操作(キー入力・画面の保存など)だけで動かした。
| 回 | 操作のしかた | 結果(終了画面のスコア表) |
|---|---|---|
| 1回目 | 画面を撮って見て、1手ずつキーを押す | 0キル。同じ世界にいたNEURONAUTは8キル |
| 2回目 | 同上 | 0キル。人間が操作する枠はOpus 5.5の1つだけで、AIの仲間3体が付いてきた |
| 3回目 | Opus 5.5が書いたプログラムに任せる(ページが受け取る地図と位置のデータを読み、道を計算して戦う) | 4キル0デス。Andarielを倒し、2面のThe Dark Towerへ |
| 4回目 | 3回目のプログラムを直した版 | 50キル2デス |
1回目(ソーサレス)。 スコア表には、ほかの参加者としてGUILEとNEURONAUTの名前が並んだ(NEURONAUTは終了時に「disconnected」表示)。Opus 5.5は1手ごとに画面を撮って考えてからキーを押していたので、数秒に1手しか動けず、敵のいる区画までたどり着けなかった。洞窟では、盾を持った小鬼の姿をしたキャラに合計24回攻撃した。まったく倒れないので調べると、ミニマップのデータでは敵として扱われていなかった。敵として動く相手ではなく、置物だったと判断している。
2回目(バーバリアン)。 人間が操作する枠に入っていたのはOpus 5.5だけで、AIの仲間3体が付いてきた。レポートにある、人間についてくる自律キャラだ。この回も0キルだった。
3回目。 やり方を変えた。Agora-2のページは、映像とは別に、ミニマップ用の地図と全キャラの位置をサーバーから受け取っている。Opus 5.5はページのプログラムを読み、ミニマップの色の意味(黄=自分、緑=仲間とほかの参加者、赤=敵、オレンジ=ボス)を確かめたうえで、そのデータを読み取り、地図の上で道を計算して敵に近づき攻撃するプログラムを書いた。正確に言えば、1コマずつOpus 5.5が判断しているのではなく、判断のしかたを書いたのがOpus 5.5だ。洞窟の奥のAndarielとは正面からの殴り合いになり、体力を140から16.5まで削られながら倒した。するとポータルが開き、2面のThe Dark Towerに移ると、ボスはMephistoに変わった。
ただし、このプログラムには誤りがあった。地図のデータには1〜3の数字が入っていて、Opus 5.5はこれを「通りやすさ」と読んでいた。録画を見ていたチャンネル運営者から「進めない所に進もうとしている」と指摘されて調べ直すと、数字が違うマスどうしは行き来できないことが多く、床の高さの段だと考えられた。崖を正面から登ろうとしていたわけだ。
4回目。 高さの段が変わる移動は遠回りを選ぶ、進めなかったマスは覚えておく、ボスが倒れたらポータルを目指す、という3点を直した。約10回/秒で状態を記録しながら遊び、結果は50キル2デス。2回倒されたが、復活して試合を続けた。
画面の外で倒されたボスが示すこと
4回目で起きたことが、Agora-2の設計をいちばんよく表していた。Opus 5.5のキャラが洞窟の別の場所を歩いている間に、AIの仲間2体がAndarielを倒していたのだ。記録(10,565件)で撃破の直前を見ると、Andarielとの距離は、仲間の2体が1.5マスと1.9マス、Opus 5.5のキャラは40.6マスだった。Opus 5.5の画面にボスは映っていない。
ブログは、キャラの情報は特定の視点とは別に状態として保たれるので、「they remain available when an entity is out of frame(画面の外にいても失われない)」と説明している。今回の記録は、この説明と合っていた。そもそも、映像ではなくサーバーが送る状態データを読んで遊べたこと自体が、絵とは別に世界の状態があることの裏付けになっている。
一方で、今回確かめられたのはサーバー側の状態だけだ。同じ出来事が、ほかのプレイヤーの画面にも食い違いなく描かれていたかどうかは確かめていない。レポートも、視点どうしの見た目の一致はまだ評価していないと書いている。
遊んで気になった点と、レポート自身が「まだ測っていない」と書く点
遊んで気になったのは2点だ。1つは、置物と敵が見た目では区別しにくいこと。1回目の24回の攻撃は、そのせいで起きた。もう1つは、キャラの歩く速さがかなり遅く感じられたことだ。
レポートの「Limitations」の節は、まだ評価していないことをはっきり書いている。
- 長く遊んだときの画質、プレイヤーどうしの画面の一致、操作どおりに動くか、エージェント方策の強さは未評価
- 毎秒15回・30コマは目標値で、実際に続けて出ているフレームレートや、操作してから画面が変わるまでの遅れは定量評価していない
- 新しい見た目・ルール・環境への移し替えは試していない
- シミュレーションの予測の誤りは、時間とともに積み重なりうる
評価済みの数字もある。1ステップ先の予測で、移動の枝の正答率は85.17%、障害物で止められる場面に限ると68.17%、アニメーションの種類は95.84%だった。ぶつかる場面がいちばん難しいという結果は、Opus 5.5が崖で苦労したことと重なる。画質は、VAEを使った比較対象のPSNR 20.67dBに対して30.11dBで、9.44dB高い。ただしレポートは、この比較は学習予算・データ・条件づけが揃っていない完成品どうしの比較で、構造の良し悪しだけを比べたものではないと注記している。
AI時短ラボ側でも、フレームレートと遅延は測っていない。
遊び方(9月25日時点)
- ブラウザで agora.odyssey.systems を開く(ログイン不要だった)
- アマゾン・ネクロマンサー・バーバリアン・パラディン・ソーサレスの5クラスから選び、名前を入れる
- 待合室で最大4人まで待つ。待たずに始めるなら「START ANYWAY」
- 1試合は10分。最初の場所は洞窟「The Den of Evil」。WASDで移動、スペースで攻撃
ゲームの映像は640×480でWebRTCで届き、BGMと効果音はサイト側で鳴っていた。研究プレビューなので、仕様は予告なく変わる可能性がある。
この記事で確かめていないこと
- 一次資料(ブログ・技術レポート・過去の発表)は9月25日に取得した。レポートのPDFの作成日時は2026年9月25日6時24分(日本時間)で、9月21日の公開後に差し替えられた可能性がある。数字は取得した版のもの
- ミニマップの色の意味は、ページのプログラムから読み取った。ボスを倒した後に出た水色の印はポータルと推測している
- 1回目のGUILEとNEURONAUTが人間だったかAIだったかは確かめていない
- 小鬼を置物と判断したのは、ミニマップのデータで敵として扱われていなかったことによる。当たり判定の問題だった可能性は残る
- 3回目以降のプレイはOpus 5.5が書いたプログラムによる操作で、1コマずつの判断ではない
動画版では、この記事の内容をプレイ映像と一緒に15分45秒で見られる。編集もOpus 5.5が担当したので、編集への感想も動画のコメント欄で聞かせてほしい。
関連記事
出典・参照資料
- 一次資料Introducing Agora-2: Advancing Multi-Agent World Simulation — Odyssey(Oliver Cameron・2026-09-21) ↗
- 一次資料Agora-2: An Action-Conditioned World Model for Real-Time Multiplayer Environments(技術レポートPDF・23ページ) ↗
- 一次資料Agora-2 研究プレビュー(ブラウザ版) ↗
- 一次資料Agora-1 — Odyssey(2026-05-18) ↗
- 一次資料The Era of Multi-Agent Imagined Experience — Odyssey(2026-06-12) ↗
- 一次資料Introducing Odyssey-3 — Odyssey(2026-09-15) ↗
- 一次資料PROWL: Prioritized Regret-Driven Optimization for World Model Learning(arXiv 2605.18803) ↗
この記事の解説動画
YouTubeで見る ↗AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。