AI時短ラボ
活用· 約16

オープンソースAI vs クローズドAI──メリット・デメリット比較【2026年】

Llama 4やDeepSeek V4などオープンウェイトモデルと、GPT-5.5やClaude Opus 5などクローズドモデルを、コスト・プライバシー・カスタマイズ性・性能・安全性・サポートの6軸で比較した。

オープンソースAI vs クローズドAI──メリット・デメリット比較【2026年】
執筆・編集:
目次

3行まとめ

  1. オープンウェイトモデル(Llama 4、DeepSeek V4、Qwen 3)はクローズドモデルとの性能差を数ポイントまで縮め、コストは10分の1以下になっている
  2. クローズドモデル(GPT-5.5、Claude Opus 5、Gemini 3)は複雑な推論・マルチモーダル・エンタープライズサポートで依然として優位
  3. 「オープンソース」と呼ばれるモデルの大半はライセンス制限があり、OSI定義の厳密なオープンソースではない点に注意が必要

前提:「オープンソースAI」は正確ではない

まず用語の整理が必要だ。

2024年10月にOpen Source Initiative(OSI)が公開した「Open Source AI Definition(OSAID)1.0」によると、オープンソースAIの条件はモデルの重み・学習データ・コードのすべてが自由に利用可能であることだ。

この定義を満たすモデルはほぼ存在しない。Llama 4、DeepSeek V4、Qwen 3、Mistral Large 3はいずれも重みは公開するが学習データは非公開であり、正確には「オープンウェイト」モデルだ(出典)。

本記事では一般的な通称に従い「オープンソースAI」と表記するが、この区別は知っておく価値がある。

主要モデルの一覧

オープンウェイト陣営

モデル 開発元 パラメータ 特徴
Llama 4 Maverick Meta 400B(MoE) 英語圏での汎用性が高い。700M MAU超の企業は別途ライセンスが必要
DeepSeek V4 Pro DeepSeek 1.6T(MoE、49Bアクティブ) APIコストがクローズドの約1/10〜1/30
Qwen 3 Alibaba 最大235B 100以上の言語に対応(後継のQwen 3.5時点)。多言語・長文脈RAGに強い
Mistral Large 3 Mistral AI 非公開 EU域内のデータ主権を重視。80言語以上対応

各モデルの詳細はオープンウェイトモデル上半期まとめを参照。

クローズド陣営

モデル 開発元 特徴
GPT-5.2 OpenAI マルチモーダル統合。API料金は$1.75/$14.00(入力/出力・1Mトークンあたり)
Claude Opus 5 Anthropic 複雑な推論・コーディングに強い。Constitutional AIによる安全性設計
Gemini 3 Pro Google Google検索・Workspace統合。長文脈処理

6軸で比較する

1. コスト

コスト差はオープンウェイト陣営の最大の強みだ。

項目 オープンウェイト クローズド
API利用(1Mトークン出力) $0.59〜$0.79(Groq経由Llama 3.3 70B) $1.75〜$14.00(GPT-5.2)
セルフホスト 約$15/1Mトークン(Llama 3.3 70B・H100×2) 不可
初期コスト GPU調達・運用が必要 ゼロ(API登録のみ)

出典(Let's Data Science)が示す試算例では、1日1,000万トークン規模(月間約3億トークン)の利用で、API利用がGPT-5.2で月$36,000・Claude Sonnet 4.5で月$41,400・Gemini 3.1 Proで月$32,200になるのに対し、Llama 3.3 70Bを2基のH100でセルフホストすると月$4,500(Groqのマネージドサービス利用でも月$10,000)になるとされている。同記事は損益分岐点を月間500万〜1,000万トークンとし、それを超える利用ではセルフホストが年間50〜90%安くなるとしている。ただしこれはGPUレンタル代のみの比較で、MLOpsエンジニアの人件費・運用体制まで含めた「現実的な最小規模の本番運用」は年間$125,000〜$190,000かかり、それでも大量利用時の主要クローズドAPIより50〜75%安いと同記事は述べている。小規模利用ではクローズドAPIのほうが総コストは安くなる場合が多い。

2. プライバシー・データ主権

項目 オープンウェイト クローズド
データの外部送信 セルフホストなら不要 API利用時は送信が必要
データ利用ポリシー 自社で完全管理 各社のポリシーに依存
規制対応(GDPR等) 自社インフラで対応可 プロバイダのコンプラに依存

医療・法務・金融など機密データを扱う業種では、データを外部に出さずに済むオープンウェイトモデルのセルフホストが選ばれる傾向がある。Mistral LargeシリーズはEU拠点のMistral AIが開発しており、データ主権を重視する欧州企業から関心を集めているとされるが、この記事で出典としているAI Magicxの記事はMistral Small 4の性能比較が中心で、Mistral Large 3のEU域内データ主権や欧州企業での採用状況についての記述は確認できなかった。

3. カスタマイズ性

項目 オープンウェイト クローズド
ファインチューニング 自由に実行可能 限定的(一部モデルのみ)
モデル改変 重みの編集・蒸留が可能 不可
推論最適化 量子化・プルーニング等を自由に適用 不可

ファインチューニングはオープンウェイトモデルの決定的な強みだ。自社データで追加学習し、特定タスクに特化させることで、汎用モデルでは到達しない精度を実現できる。

ローカルでのLLM運用方法はローカルLLMガイドで解説している。Llama 4のセットアップ手順はLlama 4ローカル構築ガイドを参照。

4. 性能(ベンチマーク)

2026年6月時点のベンチマークスコア(報道ベース):

ベンチマーク オープンウェイト最高 クローズド最高
SWE-bench Verified Qwen 3.5-397B: 76.4% Claude Opus 4.6: 約80%
複雑な推論(CRE) クローズドより10〜25%低い GPT-5.5・Claude Opus 5がリード
コーディング Qwen 3が高スコア Claude系が上位

注意点がいくつかある。

  • SWE-benchのスコアは各社の自己申告を含み、評価条件が統一されていない場合がある。表の数値はLet's Data Science(本記事のsources内)が2026年に報告したQwen 3.5-397B・Claude Opus 4.6の値。旧版が載せていたDeepSeek V4 Pro 80.6%・Claude Opus 4 77.2%以上という数値は、出典としていたMorphLLMのページが今回の点検(2026-08-27)でアクセス制限により取得できず裏取りできなかったため置き換えた
  • 「複雑な推論」のベンチマークは定義や範囲が報告元によって異なる
  • ベンチマークのスコアと実用時の体感は必ずしも一致しない

総合的には、汎用的な推論・マルチモーダル・長期的な対話ではクローズドモデルが優位、**特定タスクへの特化(ファインチューニング後)**ではオープンウェイトが逆転する場合がある。

5. 安全性・ガードレール

項目 オープンウェイト クローズド
安全性フィルタ 自社で実装が必要 プロバイダが組み込み済み
悪用リスク 重みが公開されており制御困難 APIを通じた利用制限が可能
監査・透明性 コード・重みを直接検証可能 ブラックボックス

ここにはトレードオフがある。クローズドモデルは安全性フィルタが組み込まれているが、その判断基準はブラックボックスだ。オープンウェイトモデルはコードと重みを直接検証できるが、悪用者がフィルタを除去することも技術的には可能になる。

6. サポート・運用負荷

項目 オープンウェイト クローズド
公式サポート コミュニティベース エンタープライズ契約でSLA付き
運用負荷 インフラ管理が必要 API呼び出しのみ
アップデート 手動で適用 プロバイダが自動適用

技術チームを持たない中小企業や個人にとって、クローズドAPIの**「登録すればすぐ使える」**手軽さは大きなメリットだ。一方、大規模組織で専任のMLOpsチームがいる場合は、オープンウェイトのセルフホストが長期的にコスト効率が高くなる。

ライセンスの落とし穴

オープンウェイトモデルは「自由に使える」と思われがちだが、実際にはライセンス制限がある。

モデル 制限
Llama 4 月間7億ユーザー超の企業は別途商用ライセンスが必要。EUでは一部機能(Vision等)が利用不可
DeepSeek V4 比較的自由だが、中国の法規制下にある点を考慮する必要がある
Qwen 3 Apache 2.0ライセンスで商用利用可。比較的制限が少ない
Mistral Large 3 商用利用可。EU規制への適合を重視

Llama 4のライセンスは「700M MAU超の企業はMetaに別途申請」という条件があり、大手プラットフォーム企業にとっては実質的な制約になる(出典)。

モデルの探し方・取得方法はHugging Faceガイドを参照。

どちらを選ぶべきか

条件 推奨
機密データを扱う オープンウェイト(セルフホスト)
特定タスクに特化させたい オープンウェイト(ファインチューニング)
大量リクエスト(数百万/日) オープンウェイト(コスト優位)
技術チームがいない クローズドAPI
すぐに使い始めたい クローズドAPI
最先端の推論性能が必要 クローズド(ただし差は縮小中)
マルチモーダル統合が必要 クローズド(現時点で成熟度が高い)

実際には二者択一ではなく、用途によって使い分けるのが現実的だ。社内の機密分析にはセルフホストのオープンウェイトモデル、顧客向けチャットボットにはクローズドAPIというハイブリッド構成を採る企業は増えている。

この比較の限界と筆者のバイアス

  • ベンチマークのスコアは各社の自己申告や報道ベースを含み、本記事では独自検証していない。評価条件・データセットが異なる数値を並べて比較している限界がある
  • コスト比較の数値は推論コストのみであり、GPU調達・運用・人件費を含む総保有コスト(TCO)は環境によって大きく変わる
  • 「オープンソースAI」と「オープンウェイトモデル」の区別は本記事で触れたが、業界全体で用語が統一されていない
  • 筆者はClaudeを日常的に使用しており、クローズドモデル側の評価が偏っている可能性がある
  • 中国発モデル(DeepSeek、Qwen)の利用については、地政学的リスクやデータ規制の観点から追加の検討が必要な場合がある

参照した比較記事4本

モデルの仕様・料金・ベンチマークスコアは2026年6月時点の公開情報に基づく。各モデルとも頻繁にアップデートされるため、最新情報は公式サイトで確認することを推奨する。

シェア: ポスト はてブ

出典・参照資料

更新・訂正履歴

  • クローズド陣営表とコスト比較表のGPT-5.5表記をGPT-5.2に修正。出典Lets Data Scienceの1.75ドル/14.00ドルという価格はGPT-5.2のものでGPT-5.5という表記は出典に存在せず、コスト比較表の1.50ドルという下限値も出典で確認できなかったため1.75ドルに修正した。セルフホストのコスト削減60から80パーセントの但し書きを訂正。旧文はGPU調達と運用人件費を除いた比較としていたが、出典の試算はGPUレンタル代とMLOps人件費を含めた上での削減率であり説明が逆だった。Qwen3の言語対応数を201から100以上に修正。201という数字はどの出典にも見当たらず、出典Aimagicxが示すのはQwen3.5時点で100以上の言語対応だった。Mistral Large3のEU域内データ主権と欧州企業採用の記述を修正。出典としていたAimagicxの記事はMistral Small4の比較が中心でMistral Large3やEU域内データ主権への言及がなく出典に無い記述だった。DeepSeek V4 ProのSWE-bench 80.6パーセントとClaude Opus 4の77.2パーセント以上について、一次情報とみられるMorphLLMの記事がアクセス制限で取得できず出典未確認である旨を追記した。
  • (承前)追加の点検で4件を修正。(1) DeepSeek V4 Proのパラメータ数を671B(37Bアクティブ)から1.6T(49Bアクティブ)に修正。自サイトopen-weight-models-h1-2026記事がHugging FaceのDeepSeek-V4-Proモデルカードを直接確認した値と矛盾していた。(2) セルフホスト試算行の「Llama 4 70B」は実在しない構成(Llama 4はScout 17B-16E/Maverick 17B-128Eの2種のみ)だったため、出典Let's Data Scienceが実際に試算しているLlama 3.3 70B(H100×2)に置き換え、値も同記事の月額試算(1日1000万トークン規模で月4500ドル、月間3億トークン換算で約15ドル/1Mトークン)に基づき0.15ドルから15ドルへ修正した。前回訂正で書いた「GPUレンタル代1万〜1.5万ドル」「MLOps人件費8000〜1.2万ドル」「Qwen 3.5 70B」は出典を再確認した結果どこにも見当たらなかったため、出典に実在する数値(月次API/セルフホスト比較表、損益分岐点、年間125,000〜190,000ドルの本番運用試算)に総入れ替えした。(3) SWE-bench Verified比較行のDeepSeek V4 Pro 80.6%/Claude Opus 4 77.2%以上は出典未確認のままだったため削除し、同じLet's Data Science記事内で確認できる実在の数値(Qwen 3.5-397B 76.4%、Claude Opus 4.6 約80%)に置き換えた。(4) 常緑記事なのにクローズド代表が「Claude Opus 4」のまま2世代古かったため、3行まとめ・モデル一覧表・CRE比較行の表記をClaude Opus 5(2026-07-25公開)に更新した。

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

ローカルLLMとは何か──自分のPCでAIを動かす仕組み・利点・始め方を解説の記事画像
活用06.16読了11

ローカルLLMとは何か──自分のPCでAIを動かす仕組み・利点・始め方を解説

出典 ─ Ollama 公式サイト
中国勢・オープンウェイト2026年上半期 ― DeepSeek V4、Qwen 3.6、MetaはLlama休止の記事画像
業界08.22読了17

中国勢・オープンウェイト2026年上半期 ― DeepSeek V4、Qwen 3.6、MetaはLlama休止

出典 ─ Digital Applied
DeepSeekの使い方【2026年9月版】──無料アプリ・Web版のログイン方法と機能、API(deepseek-flash/deepseek-v4-pro)の始め方とピーク・オフピーク料金、Claude Code・Codexから使う方法、データが中国のサーバーに置かれる点までの記事画像
活用09.21読了14

DeepSeekの使い方【2026年9月版】──無料アプリ・Web版のログイン方法と機能、API(deepseek-flash/deepseek-v4-pro)の始め方とピーク・オフピーク料金、Claude Code・Codexから使う方法、データが中国のサーバーに置かれる点まで

出典 ─ DeepSeek API Docs(2026年9月18日取得)
『不正するな』と言ってもAIは不正をする──22モデルを検証した実測研究の記事画像
研究09.01読了16

『不正するな』と言ってもAIは不正をする──22モデルを検証した実測研究

出典 ─ Every Model Cheats: Pr
1文字ずつでなく面で書くAI──商用スケールの拡散言語モデルMercuryとはの記事画像
モデル09.05読了12

1文字ずつでなく面で書くAI──商用スケールの拡散言語モデルMercuryとは

出典 ─ Introducing Mercury, t
Anthropicが154ページでClaudeの悪用を全公開──中国7ラボを実名、マリの2500万SIM監視、生物兵器への悪用を業界で初めて開示の記事画像
業界09.11読了21

Anthropicが154ページでClaudeの悪用を全公開──中国7ラボを実名、マリの2500万SIM監視、生物兵器への悪用を業界で初めて開示

出典 ─ Detecting and counteri
中国AIモデルまとめ【2026年9月版】──DeepSeek・Qwen・Kimi・GLM・MiniMax・Tencentの現行モデル、API価格、重みの公開状況(Hugging Faceで確認)、ライセンスの条件、データの保存先。覆面モデル(Ox/Union Alpha)の正体までの記事画像
モデル09.24読了17

中国AIモデルまとめ【2026年9月版】──DeepSeek・Qwen・Kimi・GLM・MiniMax・Tencentの現行モデル、API価格、重みの公開状況(Hugging Faceで確認)、ライセンスの条件、データの保存先。覆面モデル(Ox/Union Alpha)の正体まで

出典 ─ Hugging Face Models AP
ファインチューニング やり方・費用・いつ使うべきか【2026年入門】の記事画像
活用07.15読了12

ファインチューニング やり方・費用・いつ使うべきか【2026年入門】

出典 ─ CloudZero※2026-08-27時点でリンク切れ(404)。Wayback Machineにも記録なし