AIモデル性能・コスト比較マップ
主要AIモデルの総合性能スコアと出力コストを散布図で比較。ドットをクリックすると詳細を表示。
出典
各モデルの価格・コンテキスト長は各社の公式ドキュメント(Anthropic Docs、OpenAI Platform、Google AI、xAI Docs、Z.ai Docs、DeepSeek Docs、Moonshot Docs、Alibaba Cloud 等)から取得。ドットをクリックすると、そのモデルの出典ページへ飛べる。
価格・コンテキスト長は2026年9月10日に各社の公式ページで取り直した(掲載モデルのうち44件)。 それ以外のモデルは取得日が特定できていない初期データのままなので、価格をそのまま信用しないでほしい。
注: 表示価格はAPIの定価で、ボリュームディスカウント・キャッシュ割引・バッチ割引は含まない。 二段階価格(長いコンテキストで単価が上がる)や期間限定価格のモデルがあるので、実額は料金シミュレータと各社の公式ページで確認すること。
ベンチマーク値について(2026年9月10日に全数を見直した)。以前このページには、一次ソースで裏の取れていない数値が混ざっていた(当時の注記にも「プレースホルダを含む」と書いてあった)。 60件の数値を各社の公式資料に当たって突き合わせた結果、一致18件・不一致8件・公表が見つからない34件だった。 不一致の中には、Claude Fable 5 の SWE-bench Pro として別モデル(Mythos 5)の 80.3% を載せていたもの、 Llama 4 Scout の GPQA Diamond として同じ表の MMLU Pro の値(74.3)を載せていたものがあった。確認できた値だけを残し、間違っていた値は公式の値に直し、裏が取れなかった値は消した。その結果、散布図に出るのは12モデルだけになっている(残りはベンチマーク値を持たないため描画しない)。
なお compositeScore は掲載ベンチマークの単純平均で、独自の重み付けはしていない。 ただしモデルによって取れているベンチマークの組み合わせが違うため、縦軸の高さを厳密に比べることはできない。 各モデルのドットをクリックして、内訳と出典を見てほしい。