AI時短ラボ

AIモデル性能・コスト比較マップ

主要AIモデルの総合性能スコアと出力コストを散布図で比較。ドットをクリックすると詳細を表示。

国別
モデル種別
出力コスト上限: $100/1M tokens
$0$180
$0.5$1$2$5$10$20$50$100$200425159687685出力コスト($/1M tokens)総合性能スコアClaude Fable 5Claude Opus 4.8Claude Sonnet 4.6Gemini 3.1 ProGemini 2.5 ProGemini 2.5 FlashGLM-5.2DeepSeek V4-ProDeepSeek V3Qwen 3 (30B-A3B)Llama 4 MaverickLlama 4 Scout
最終更新: 2026-09-10表示中: 56 / 57 モデル

出典

各モデルの価格・コンテキスト長は各社の公式ドキュメント(Anthropic Docs、OpenAI Platform、Google AI、xAI Docs、Z.ai Docs、DeepSeek Docs、Moonshot Docs、Alibaba Cloud 等)から取得。ドットをクリックすると、そのモデルの出典ページへ飛べる。

価格・コンテキスト長は2026年9月10日に各社の公式ページで取り直した(掲載モデルのうち44件)。 それ以外のモデルは取得日が特定できていない初期データのままなので、価格をそのまま信用しないでほしい。

注: 表示価格はAPIの定価で、ボリュームディスカウント・キャッシュ割引・バッチ割引は含まない。 二段階価格(長いコンテキストで単価が上がる)や期間限定価格のモデルがあるので、実額は料金シミュレータと各社の公式ページで確認すること。

ベンチマーク値について(2026年9月10日に全数を見直した)。以前このページには、一次ソースで裏の取れていない数値が混ざっていた(当時の注記にも「プレースホルダを含む」と書いてあった)。 60件の数値を各社の公式資料に当たって突き合わせた結果、一致18件・不一致8件・公表が見つからない34件だった。 不一致の中には、Claude Fable 5 の SWE-bench Pro として別モデル(Mythos 5)の 80.3% を載せていたもの、 Llama 4 Scout の GPQA Diamond として同じ表の MMLU Pro の値(74.3)を載せていたものがあった。確認できた値だけを残し、間違っていた値は公式の値に直し、裏が取れなかった値は消した。その結果、散布図に出るのは12モデルだけになっている(残りはベンチマーク値を持たないため描画しない)。

なお compositeScore は掲載ベンチマークの単純平均で、独自の重み付けはしていない。 ただしモデルによって取れているベンチマークの組み合わせが違うため、縦軸の高さを厳密に比べることはできない。 各モデルのドットをクリックして、内訳と出典を見てほしい。