オープンソースAI vs クローズドAI──メリット・デメリット比較【2026年】
Llama 4やDeepSeek V4などオープンウェイトモデルと、GPT-5.5やClaude Opus 5などクローズドモデルを、コスト・プライバシー・カスタマイズ性・性能・安全性・サポートの6軸で比較した。

3行まとめ
- オープンウェイトモデル(Llama 4、DeepSeek V4、Qwen 3)はクローズドモデルとの性能差を数ポイントまで縮め、コストは10分の1以下になっている
- クローズドモデル(GPT-5.5、Claude Opus 5、Gemini 3)は複雑な推論・マルチモーダル・エンタープライズサポートで依然として優位
- 「オープンソース」と呼ばれるモデルの大半はライセンス制限があり、OSI定義の厳密なオープンソースではない点に注意が必要
前提:「オープンソースAI」は正確ではない
まず用語の整理が必要だ。
2024年10月にOpen Source Initiative(OSI)が公開した「Open Source AI Definition(OSAID)1.0」によると、オープンソースAIの条件はモデルの重み・学習データ・コードのすべてが自由に利用可能であることだ。
この定義を満たすモデルはほぼ存在しない。Llama 4、DeepSeek V4、Qwen 3、Mistral Large 3はいずれも重みは公開するが学習データは非公開であり、正確には「オープンウェイト」モデルだ(出典)。
本記事では一般的な通称に従い「オープンソースAI」と表記するが、この区別は知っておく価値がある。
主要モデルの一覧
オープンウェイト陣営
| モデル | 開発元 | パラメータ | 特徴 |
|---|---|---|---|
| Llama 4 Maverick | Meta | 400B(MoE) | 英語圏での汎用性が高い。700M MAU超の企業は別途ライセンスが必要 |
| DeepSeek V4 Pro | DeepSeek | 1.6T(MoE、49Bアクティブ) | APIコストがクローズドの約1/10〜1/30 |
| Qwen 3 | Alibaba | 最大235B | 100以上の言語に対応(後継のQwen 3.5時点)。多言語・長文脈RAGに強い |
| Mistral Large 3 | Mistral AI | 非公開 | EU域内のデータ主権を重視。80言語以上対応 |
各モデルの詳細はオープンウェイトモデル上半期まとめを参照。
クローズド陣営
| モデル | 開発元 | 特徴 |
|---|---|---|
| GPT-5.2 | OpenAI | マルチモーダル統合。API料金は$1.75/$14.00(入力/出力・1Mトークンあたり) |
| Claude Opus 5 | Anthropic | 複雑な推論・コーディングに強い。Constitutional AIによる安全性設計 |
| Gemini 3 Pro | Google検索・Workspace統合。長文脈処理 |
6軸で比較する
1. コスト
コスト差はオープンウェイト陣営の最大の強みだ。
| 項目 | オープンウェイト | クローズド |
|---|---|---|
| API利用(1Mトークン出力) | $0.59〜$0.79(Groq経由Llama 3.3 70B) | $1.75〜$14.00(GPT-5.2) |
| セルフホスト | 約$15/1Mトークン(Llama 3.3 70B・H100×2) | 不可 |
| 初期コスト | GPU調達・運用が必要 | ゼロ(API登録のみ) |
出典(Let's Data Science)が示す試算例では、1日1,000万トークン規模(月間約3億トークン)の利用で、API利用がGPT-5.2で月$36,000・Claude Sonnet 4.5で月$41,400・Gemini 3.1 Proで月$32,200になるのに対し、Llama 3.3 70Bを2基のH100でセルフホストすると月$4,500(Groqのマネージドサービス利用でも月$10,000)になるとされている。同記事は損益分岐点を月間500万〜1,000万トークンとし、それを超える利用ではセルフホストが年間50〜90%安くなるとしている。ただしこれはGPUレンタル代のみの比較で、MLOpsエンジニアの人件費・運用体制まで含めた「現実的な最小規模の本番運用」は年間$125,000〜$190,000かかり、それでも大量利用時の主要クローズドAPIより50〜75%安いと同記事は述べている。小規模利用ではクローズドAPIのほうが総コストは安くなる場合が多い。
2. プライバシー・データ主権
| 項目 | オープンウェイト | クローズド |
|---|---|---|
| データの外部送信 | セルフホストなら不要 | API利用時は送信が必要 |
| データ利用ポリシー | 自社で完全管理 | 各社のポリシーに依存 |
| 規制対応(GDPR等) | 自社インフラで対応可 | プロバイダのコンプラに依存 |
医療・法務・金融など機密データを扱う業種では、データを外部に出さずに済むオープンウェイトモデルのセルフホストが選ばれる傾向がある。Mistral LargeシリーズはEU拠点のMistral AIが開発しており、データ主権を重視する欧州企業から関心を集めているとされるが、この記事で出典としているAI Magicxの記事はMistral Small 4の性能比較が中心で、Mistral Large 3のEU域内データ主権や欧州企業での採用状況についての記述は確認できなかった。
3. カスタマイズ性
| 項目 | オープンウェイト | クローズド |
|---|---|---|
| ファインチューニング | 自由に実行可能 | 限定的(一部モデルのみ) |
| モデル改変 | 重みの編集・蒸留が可能 | 不可 |
| 推論最適化 | 量子化・プルーニング等を自由に適用 | 不可 |
ファインチューニングはオープンウェイトモデルの決定的な強みだ。自社データで追加学習し、特定タスクに特化させることで、汎用モデルでは到達しない精度を実現できる。
ローカルでのLLM運用方法はローカルLLMガイドで解説している。Llama 4のセットアップ手順はLlama 4ローカル構築ガイドを参照。
4. 性能(ベンチマーク)
2026年6月時点のベンチマークスコア(報道ベース):
| ベンチマーク | オープンウェイト最高 | クローズド最高 |
|---|---|---|
| SWE-bench Verified | Qwen 3.5-397B: 76.4% | Claude Opus 4.6: 約80% |
| 複雑な推論(CRE) | クローズドより10〜25%低い | GPT-5.5・Claude Opus 5がリード |
| コーディング | Qwen 3が高スコア | Claude系が上位 |
注意点がいくつかある。
- SWE-benchのスコアは各社の自己申告を含み、評価条件が統一されていない場合がある。表の数値はLet's Data Science(本記事のsources内)が2026年に報告したQwen 3.5-397B・Claude Opus 4.6の値。旧版が載せていたDeepSeek V4 Pro 80.6%・Claude Opus 4 77.2%以上という数値は、出典としていたMorphLLMのページが今回の点検(2026-08-27)でアクセス制限により取得できず裏取りできなかったため置き換えた
- 「複雑な推論」のベンチマークは定義や範囲が報告元によって異なる
- ベンチマークのスコアと実用時の体感は必ずしも一致しない
総合的には、汎用的な推論・マルチモーダル・長期的な対話ではクローズドモデルが優位、**特定タスクへの特化(ファインチューニング後)**ではオープンウェイトが逆転する場合がある。
5. 安全性・ガードレール
| 項目 | オープンウェイト | クローズド |
|---|---|---|
| 安全性フィルタ | 自社で実装が必要 | プロバイダが組み込み済み |
| 悪用リスク | 重みが公開されており制御困難 | APIを通じた利用制限が可能 |
| 監査・透明性 | コード・重みを直接検証可能 | ブラックボックス |
ここにはトレードオフがある。クローズドモデルは安全性フィルタが組み込まれているが、その判断基準はブラックボックスだ。オープンウェイトモデルはコードと重みを直接検証できるが、悪用者がフィルタを除去することも技術的には可能になる。
6. サポート・運用負荷
| 項目 | オープンウェイト | クローズド |
|---|---|---|
| 公式サポート | コミュニティベース | エンタープライズ契約でSLA付き |
| 運用負荷 | インフラ管理が必要 | API呼び出しのみ |
| アップデート | 手動で適用 | プロバイダが自動適用 |
技術チームを持たない中小企業や個人にとって、クローズドAPIの**「登録すればすぐ使える」**手軽さは大きなメリットだ。一方、大規模組織で専任のMLOpsチームがいる場合は、オープンウェイトのセルフホストが長期的にコスト効率が高くなる。
ライセンスの落とし穴
オープンウェイトモデルは「自由に使える」と思われがちだが、実際にはライセンス制限がある。
| モデル | 制限 |
|---|---|
| Llama 4 | 月間7億ユーザー超の企業は別途商用ライセンスが必要。EUでは一部機能(Vision等)が利用不可 |
| DeepSeek V4 | 比較的自由だが、中国の法規制下にある点を考慮する必要がある |
| Qwen 3 | Apache 2.0ライセンスで商用利用可。比較的制限が少ない |
| Mistral Large 3 | 商用利用可。EU規制への適合を重視 |
Llama 4のライセンスは「700M MAU超の企業はMetaに別途申請」という条件があり、大手プラットフォーム企業にとっては実質的な制約になる(出典)。
モデルの探し方・取得方法はHugging Faceガイドを参照。
どちらを選ぶべきか
| 条件 | 推奨 |
|---|---|
| 機密データを扱う | オープンウェイト(セルフホスト) |
| 特定タスクに特化させたい | オープンウェイト(ファインチューニング) |
| 大量リクエスト(数百万/日) | オープンウェイト(コスト優位) |
| 技術チームがいない | クローズドAPI |
| すぐに使い始めたい | クローズドAPI |
| 最先端の推論性能が必要 | クローズド(ただし差は縮小中) |
| マルチモーダル統合が必要 | クローズド(現時点で成熟度が高い) |
実際には二者択一ではなく、用途によって使い分けるのが現実的だ。社内の機密分析にはセルフホストのオープンウェイトモデル、顧客向けチャットボットにはクローズドAPIというハイブリッド構成を採る企業は増えている。
この比較の限界と筆者のバイアス
- ベンチマークのスコアは各社の自己申告や報道ベースを含み、本記事では独自検証していない。評価条件・データセットが異なる数値を並べて比較している限界がある
- コスト比較の数値は推論コストのみであり、GPU調達・運用・人件費を含む総保有コスト(TCO)は環境によって大きく変わる
- 「オープンソースAI」と「オープンウェイトモデル」の区別は本記事で触れたが、業界全体で用語が統一されていない
- 筆者はClaudeを日常的に使用しており、クローズドモデル側の評価が偏っている可能性がある
- 中国発モデル(DeepSeek、Qwen)の利用については、地政学的リスクやデータ規制の観点から追加の検討が必要な場合がある
参照した比較記事4本
- Let's Data Science — Open Source vs Closed LLMs: The 2026 Decision Framework
- MorphLLM — DeepSeek V4: 1.6T MoE, 1M Context
- CoderSera — Llama 4 Guide: Scout, Maverick, Behemoth
- MindStudio — Open-Source vs Closed-Source AI Models
- AI Magicx — Qwen 3.5 vs Llama vs Mistral
- Medium — Navigating the AI Licensing Labyrinth
モデルの仕様・料金・ベンチマークスコアは2026年6月時点の公開情報に基づく。各モデルとも頻繁にアップデートされるため、最新情報は公式サイトで確認することを推奨する。
出典・参照資料
- 二次資料Open Source vs Closed LLMs: The 2026 Decision Framework — Let's Data Science ↗
- 二次資料DeepSeek V4: 1.6T MoE, 1M Context — MorphLLM ↗
- 二次資料Llama 4 Guide: Scout, Maverick, Behemoth — CoderSera ↗
- 二次資料Open-Source vs Closed-Source AI Models — MindStudio ↗
- 二次資料Qwen 3.5 vs Llama vs Mistral — AI Magicx ↗
- 二次資料Navigating the AI Licensing Labyrinth — Medium ↗
更新・訂正履歴
- クローズド陣営表とコスト比較表のGPT-5.5表記をGPT-5.2に修正。出典Lets Data Scienceの1.75ドル/14.00ドルという価格はGPT-5.2のものでGPT-5.5という表記は出典に存在せず、コスト比較表の1.50ドルという下限値も出典で確認できなかったため1.75ドルに修正した。セルフホストのコスト削減60から80パーセントの但し書きを訂正。旧文はGPU調達と運用人件費を除いた比較としていたが、出典の試算はGPUレンタル代とMLOps人件費を含めた上での削減率であり説明が逆だった。Qwen3の言語対応数を201から100以上に修正。201という数字はどの出典にも見当たらず、出典Aimagicxが示すのはQwen3.5時点で100以上の言語対応だった。Mistral Large3のEU域内データ主権と欧州企業採用の記述を修正。出典としていたAimagicxの記事はMistral Small4の比較が中心でMistral Large3やEU域内データ主権への言及がなく出典に無い記述だった。DeepSeek V4 ProのSWE-bench 80.6パーセントとClaude Opus 4の77.2パーセント以上について、一次情報とみられるMorphLLMの記事がアクセス制限で取得できず出典未確認である旨を追記した。
- (承前)追加の点検で4件を修正。(1) DeepSeek V4 Proのパラメータ数を671B(37Bアクティブ)から1.6T(49Bアクティブ)に修正。自サイトopen-weight-models-h1-2026記事がHugging FaceのDeepSeek-V4-Proモデルカードを直接確認した値と矛盾していた。(2) セルフホスト試算行の「Llama 4 70B」は実在しない構成(Llama 4はScout 17B-16E/Maverick 17B-128Eの2種のみ)だったため、出典Let's Data Scienceが実際に試算しているLlama 3.3 70B(H100×2)に置き換え、値も同記事の月額試算(1日1000万トークン規模で月4500ドル、月間3億トークン換算で約15ドル/1Mトークン)に基づき0.15ドルから15ドルへ修正した。前回訂正で書いた「GPUレンタル代1万〜1.5万ドル」「MLOps人件費8000〜1.2万ドル」「Qwen 3.5 70B」は出典を再確認した結果どこにも見当たらなかったため、出典に実在する数値(月次API/セルフホスト比較表、損益分岐点、年間125,000〜190,000ドルの本番運用試算)に総入れ替えした。(3) SWE-bench Verified比較行のDeepSeek V4 Pro 80.6%/Claude Opus 4 77.2%以上は出典未確認のままだったため削除し、同じLet's Data Science記事内で確認できる実在の数値(Qwen 3.5-397B 76.4%、Claude Opus 4.6 約80%)に置き換えた。(4) 常緑記事なのにクローズド代表が「Claude Opus 4」のまま2世代古かったため、3行まとめ・モデル一覧表・CRE比較行の表記をClaude Opus 5(2026-07-25公開)に更新した。
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。