Mac Studio 1台か、Mac mini 3台の分散推論か──exoのTB5 RDMAクラスタ機能を公式READMEで確認した
オープンソースの分散推論ツール「exo」は、macOS 26.2で追加されたThunderbolt 5経由のRDMAに対応し、複数のMacをケーブルでつなぐだけで1台に収まらない大規模モデルを動かせる。対応機種はM4 Pro Mac Mini・M4 Max Mac Studio・M4 Max MacBook Pro・M3 Ultra Mac Studio。2台で最大1.8倍、4台で最大3.2倍のテンソル並列速度向上が公式に示されている。

目次
大規模モデルをローカルで動かすとき、選択肢は「メモリを積んだ1台の強いマシンを買う」か「複数の安いマシンをつないでクラスタにする」かに分かれる。オープンソースの分散推論ツール「exo」は後者を現実的にする道具の1つで、2026年8月27日に確認した公式GitHub READMEには、Macを複数台つないでAIクラスタを組む具体的な条件が明記されていた。
3行まとめ
- exoはmacOS 26.2で追加された新機能「Thunderbolt 5経由のRDMA」にday-0対応しており、対応機種はM4 Pro Mac Mini・M4 Max Mac Studio・M4 Max MacBook Pro・M3 Ultra Mac Studioの4機種と明記されている
- テンソル並列(モデルを複数デバイスに分割して並列実行する方式)で、2台構成で最大1.8倍、4台構成で最大3.2倍の速度向上が公式に示されている
- macOS版はGPU(Metal経由)を使うが、Linux版は現時点でCPUのみでの動作。つまりexoの「本気の性能」は今のところMac側に寄っている
exoは何をするツールか
公式READMEの説明を訳すと、exoは「手持ちのすべてのデバイスをAIクラスタに変換する」ツールで、1台には収まらない大規模モデルを実行できるようにするだけでなく、「Thunderbolt経由のRDMAへのday-0対応」により、デバイスを追加するほどモデルの実行が速くなる、という設計になっている。
主な機能として次が挙げられている。
- 自動デバイス検出: exoを動かしているデバイス同士が手動設定なしに自動的に発見し合う
- Thunderbolt 5経由のRDMA: デバイス間のレイテンシを99%削減
- トポロジー認識の自動並列化: デバイスのリソースとネットワークのレイテンシ・帯域幅をリアルタイムに見て、モデルの最適な分割方法を判断
- テンソル並列: モデルを分割(シャーディング)し、2台構成で最大1.8倍、4台構成で最大3.2倍の高速化
- MLXバックエンド: 推論バックエンドにApple製の機械学習フレームワークMLXを使用
- 複数API互換: OpenAI Chat Completions API・Claude Messages API・OpenAI Responses API・Ollama APIと互換
- カスタムモデル対応: Hugging Face Hubからカスタムモデルを読み込み、利用可能なモデルの範囲を拡張できる
GitHub API(api.github.com/repos/exo-explore/exo)を直接取得すると、リポジトリのスター数は47,167、フォーク数は3,476、未解決のissueは349件(2026年8月31日再確認時点、8月27日時点の47,126/3,472/348からわずかに増加)。リポジトリ作成日は2024年6月24日、最終pushは2026年8月25日で、ライセンスはApache License 2.0だった。
実測ベンチマークとして公式が引用している事例
READMEには、外部ブロガーJeff Geerling氏の検証記事(「15 TB VRAM on Mac Studio – RDMA over Thunderbolt 5」)へのリンク付きで、次のような実行例が紹介されている。
- 512GB搭載のM3 Ultra Mac Studioを4台つないで、DeepSeek v3.1(8bit量子化)とKimi-K2-Thinking(4bit量子化)を実行
- Qwen3-235B(8bit)をテンソル並列RDMAで4台のM3 Ultra Mac Studioに分散実行
- DeepSeek v3.1 671B(8bit)を同様に4台構成で実行
いずれも「4 × M3 Ultra Mac Studio」という強力な構成での実測例であり、Mac mini中心の低コスト構成でどこまで速度が出るかは、README内の具体的なベンチマーク数値としては確認できなかった。
Jeff Geerling氏の元記事にある具体的な数字
READMEがリンクしているJeff Geerling氏のブログ記事本文(2025年12月18日公開)をcurlで直接取得すると、README単体には出てこない具体的な数値が確認できた。Geerling氏はApple本社から4台のM3 Ultra Mac Studio一式(DeskPi製のミニラック込み)を貸与されてテストしており、その旨は記事内で明記されている。
| 項目 | 数値 | 出典箇所 |
|---|---|---|
| クラスタ全体の統合メモリ | 1.5TB(512GB×2+256GB×2) | 本文冒頭 |
| クラスタ構成の合計購入価格(目安) | 約$40,000弱 | 本文冒頭 |
| 512GB版M3 Ultra Mac Studio単価 | $11,699 | 本文冒頭 |
| 256GB版M3 Ultra Mac Studio単価 | $8,099 | 本文冒頭 |
| RDMAによるメモリアクセスのレイテンシ | 300μs → 50μs未満に短縮 | 本文冒頭 |
| HPL(FP64)ベンチマーク:単体 | 1.3 Teraflops | "HPL and Llama.cpp"セクション |
| HPL(FP64)ベンチマーク:4台合計 | 3.7 Teraflops(3倍未満の伸び) | 同上 |
| Qwen3-235B、Exo・4台クラスタ | 32トークン/秒 | "Enabling RDMA"セクション |
| Kimi K2 Thinking(1Tパラメータ、A32B)、4台クラスタ | 約30トークン/秒 | 同上 |
(表の数値はGeerling氏のブログ本文をcurlで取得し、該当箇所を目視で抽出したもの。単体1.3 Teraflopsに対し4台合計3.7 Teraflopsに留まっているのは、上位2台と下位2台でメモリ搭載量が異なる非対称構成のためと本文で説明されている。)
Geerling氏自身は記事中で「Appleからこのクラスタを借りて検証した」ことと、「Exoの開発チームが一時期音信不通になっていたことへの不信感が残っている」という趣旨のコメントも書いている(原文: "I still have some underlying trust issues with Exo, since the developers went AWOL for a while")。これは検証者自身の受け止めであり、exo側の公式見解ではない。
Thunderbolt 5 RDMAの有効化条件
READMEの「Enabling RDMA on macOS」セクションによれば、RDMAはmacOS 26.2で新たに追加された機能で、Thunderbolt 5を搭載したMacであれば動作するとされ、対応機種として次の4つが名指しされている。
- M4 Pro Mac Mini
- M4 Max Mac Studio
- M4 Max MacBook Pro
- M3 Ultra Mac Studio
有効化にはリカバリーモードに入ってターミナルからrdma_ctl enableを実行し、再起動する必要がある。重要な注意点として次が明記されている。
- RDMAクラスタに参加するデバイスは、他のすべてのデバイスと直接接続されている必要がある
- ケーブルはTB5対応である必要がある
- Mac Studioでは、Ethernetポートの隣のThunderbolt 5ポートは使用できない
- ソースからビルドして実行する場合は、付属スクリプトでThunderbolt Bridgeを無効化し、各RDMAポートにDHCPを設定する必要がある
- macOSのバージョン(ベータ版のバージョン番号も含む)がすべてのデバイスで完全に一致していないと、RDMAポート同士が発見できないことがある
macOSとLinuxで性能の前提が違う
READMEの「Hardware Accelerator Support」セクションには次のように明記されている。
"On macOS, exo uses the GPU. On Linux, exo currently runs on CPU. We are working on extending hardware accelerator support."
つまり現時点でexoがGPUを使って高速に動作するのはmacOS版のみで、Linux版は現状CPU実行にとどまる。README冒頭でも「Apple silicon is a first-class citizen」(llama.cppなど他の推論エンジンでもよく見られる表現だが、exoのMLXバックエンド自体もApple製)という位置づけがうかがえる設計になっている。
READMEに一覧化されていない機能──APIリファレンスで確認できたこと
exoのAPI仕様は、README本体とは別にdocs/api.mdという技術リファレンス文書にまとまっている。これをcurlで取得すると、README単体では触れられていない機能がいくつか見つかった。
まず、/v1/images/generations・/v1/images/editsという画像生成・画像編集のエンドポイントがOpenAI互換の形式で用意されている。リクエスト例ではexolabs/FLUX.1-devというモデルIDが使われており、n(生成枚数)・size(解像度)・response_format(b64_jsonなど)といったパラメータを指定できる。README冒頭の「主な機能」一覧には画像生成の記載がなかったが、環境変数EXO_ENABLE_IMAGE_MODELS(デフォルトはfalse)で有効化する設計になっている。
もう1つはexo-benchというベンチマークツールだ。uv run bench/exo_bench.py --model <モデル> --pp <プロンプト長のリスト> --tg <生成長のリスト>のように実行し、配置(ノード数・シャーディング方式)ごとのプロンプト処理速度・生成速度・ピークメモリ使用量を計測できる。--shardingパラメータでpipeline(パイプライン並列)とtensor(テンソル並列)を切り替えて比較できるほか、--instance-metaで通信バックエンド(ringまたはjaccl)も指定できる。README本文の1.8倍・3.2倍という数字は、こうした計測の仕組みを使って算出されたものと見られるが、exo-bench自体の出力とREADMEに掲載された数値の対応関係までは、この記事では確認していない。
カスタムモデルの追加はcurl -X POST http://localhost:52415/models/addにモデルIDをJSONで渡す形で行う。APIドキュメントには「trust_remote_codeを要求するカスタムモデルは、セキュリティ上の理由でデフォルトでは無効化されており、モデルのリモートコード実行を信頼できる場合のみ明示的に有効化すべき」という注記があり、Hugging Face Hub由来の任意コードを実行しうるリスクへの配慮がAPI設計に組み込まれていることが分かる。
「Mac Studio 1台か、Mac mini 3台か」への答え
公式READMEの範囲では、この問いに対する明確な結論(コストパフォーマンス比較や具体的な推奨構成)は示されていなかった。分かったのは次の事実だけである。
- Mac miniもRDMAクラスタの対象機種に含まれている(M4 Pro Mac Mini)ため、複数台のMac miniでクラスタを組むこと自体は技術的に対応範囲内
- 公式が実測ベンチマークとして引用しているのは、あくまで高スペックなM3 Ultra Mac Studio×4台の構成であり、Mac mini構成での実測値は確認できなかった
- テンソル並列の速度向上率(2台1.8倍・4台3.2倍)は特定機種に限定した数値ではなく、一般的な数値として示されている
「1台の強いMacか、複数の安いMacか」は、結局のところメモリ容量・予算・置き場所(複数台をケーブルで繋ぐ物理的な手間)とのトレードオフであり、本稿で確認した情報だけでは断定できない。
Mac mini構成の実測値はREADMEに載っていなかった
- Mac mini構成での具体的な性能実測値は、本稿で確認したREADMEの範囲には掲載されていなかった
- Geerling氏のベンチマークで使われた4台のMac Studioは、本人ではなくApple本社からの貸与機材である。第三者が自費で同じ構成を再現した実測値ではない点は明記しておく
- exoのGPU(Metal)利用が具体的にどこまで最適化されているか(VRAM相当の割り当て方式など)は、READMEの記述以上には検証していない
- GitHub APIのスター数・フォーク数・issue数は2026年8月27日時点のスナップショットであり、記事公開後に変動する
関連記事
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。