5分のフル楽曲を生成するMiniMax Music 3、重みが公開──8B+0.6Bの2段構えLLMとFlow Matchingで歌詞から曲を作る
MiniMaxは2026年8月7日、最長5分の完結した楽曲を生成できる音楽生成モデル「MiniMax Music 3」の重みをHugging Faceで公開した。長期構造を担う8B、音響の細部を担う0.6Bの2段階LLM構成に、Flow MatchingとFlow-VAEによる連続隠れ状態合成を組み合わせている。API自体は2026年7月16日から提供されており、8月に公開されたのは重みという位置づけ。

目次
MiniMaxは2026年8月7日、音楽生成モデル「MiniMax Music 3」の重みをHugging Faceで公開した。当サイトは同社のテキスト生成モデル「MiniMax M3」(関連記事)を扱ってきたが、今回は音楽生成モデルの重み公開という別のニュースになる。
3行まとめ
- MiniMaxは2026年8月7日、最長5分の完結した楽曲を生成する「MiniMax Music 3」の重みをHugging Faceで公開した。8B「Global LLM」(長期構造)+0.6B「Local LLM」(音響の細部)の階層構成に、Flow MatchingとFlow-VAEを組み合わせている。
- ライセンス原文(
LICENSEファイル)を直接確認すると、商用利用は可能だが、利用製品・サービスの年間売上合計が2,000万ドルを超える場合はMiniMaxへの個別の書面許諾が必要という、売上規模に応じた条件付きライセンスだった。- モデルの構成要素の由来もライセンス文面から判明した。Global LLMはApache 2.0ライセンスのQwen3-8Bから、拡散モデル部分(DiT-2B)はMITライセンスのStability AI「Stable Audio」から、VAEはMITライセンスのDescript Audio Codec(DAC)から、それぞれ改変・派生している。
モデルの仕組み(一次資料の記載)
Hugging Face上のREADME(curlで全文取得・確認済み)によれば、MiniMax Music 3の仕様は次の通り。
- 歌詞と詳細な音楽の説明を条件として、最長5分の完結した楽曲を生成
- 出力は32kHz・16bitステレオWAV
- 歌詞には
[Intro][Verse][Pre-Chorus][Chorus][Post-Chorus][Bridge][Instrumental][Solo][Outro]という9種類のセクションタグを書き込める - 構成は8Bの「Global LLM」(長期的な音楽構造を担当。Qwen3-8Bから初期化)と0.6Bの「Local LLM」(フレーム単位の音響の細部を担当)の階層構造
- Global LLMが最初のRVQ(残差ベクトル量子化)コードブックをフレーム単位で予測し、曲の長期的な意味・構造の進行をモデル化。Local LLMが各フレーム内の残りの音響コードブックを予測し、細かい音響情報を復元する
- トークナイザーはRVQ8層構成。最初の「意味コードブック」は16,384エントリで音楽の核となる意味・構造を捉え、残り7層の「音響コードブック」は各1,024エントリで残差の音響detail を表す。学習時はまず意味コードブックを最適化してから8層全体を結合学習するが、推論時の波形合成はLLMの融合隠れ状態を使い、この離散トークナイザーのデコーダー自体は使わない
- 離散的なRVQトークンだけからデコードするのではなく、Global LLMとLocal LLMの最終隠れ状態を融合した連続表現から合成することで、ボーカルの発音・楽器の質感・時間的な連続性をより豊かに保持
- 合成部分は**Flow Matching(2.4Bパラメータ)とFlow-VAE Decoder(123Mパラメータ)**による。Flow-VAE自体はMiniMax Speechのアーキテクチャを転用し、音楽の音域・スペクトル特性向けに再学習したもの
- 動作環境(README記載): フル精度では24GB未満のVRAMに収まる。自動CPUオフロードを使うと約22GBに収まり、言語モデル層を1層ずつストリーミングする設定にすれば8GBのビデオカードでも動作するという
- プロンプト拡張用に、歌詞セクションタグを保持したまま音楽記述を「Global Metadata」「Vocal Details」「Arrangement」の構造化キャプションへ展開する
music-caption-rewriterというスキル(GitHub上で公開)も用意されている - 推論はSGLang-Omni・SGLang・diffusers・ComfyUIの4つの経路で対応(README記載時点でdiffusers対応は本家PRのマージ待ちで、コミット指定でのインストールが必要と明記)。デモ音源は
minimax-ai.github.io/music3-demo/で公開されている
README自身が明記する制限事項
README末尾の「Limitations」節(curlで取得・確認)には、次の5点が明記されている。
- 推論にはCUDAが必須(CPUのみでの推論には対応していない)
- 現時点ではストリーミング生成には対応せず、非ストリーミング生成のみ
- テキストプロンプトのトークン数上限は5,000トークン
- 音声生成は最大9,000音響フレームまで
- セクションタグや音楽記述はあくまで「生成の方向づけ」であり、記号的な厳密な保証ではない。テンポ・キー・楽器編成・歌詞・曲構成が、指定した内容と厳密に一致するとは限らない
つまりMiniMax自身が、指定したセクションタグ通りに必ず曲が構成される保証はない、と明記している。生成音楽の構造制御を謳う一方で、その精度には限界があることをモデル提供元自身が認めている形だ。
API提供開始日と重み公開日は別
MiniMax公式のリリースノートによれば、Music 3.0のAPI提供開始日は2026年7月16日。8月に起きたのは、そのモデルの重みの公開であり、新モデルの発表ではない。公式リリースノートの8月分にMusic 3関連の項目はなく、重み公開はHugging Face側の実測(createdAt: 2026-08-07)でのみ確認できる。
Hugging Face上の実測(2026年8月29日、API直接確認)
- ダウンロード数: 20,724
- likes: 1,292
- 最終更新日: 2026年8月14日(公開の8月7日から1週間ほどで更新が入っている)
ライセンス原文を直接確認した──商用利用は年商2,000万ドルが境界線
モデルカードからリンクされているLICENSEファイル(MiniMax-Music3 COMMUNITY LICENSE)の本文を直接取得して確認した。要点は次の通り。
- 重み・パラメータ・設定ファイル・推論コードを含む「Software」全体について、使用・複製・改変・結合・公開・配布・サブライセンスが無償で許諾されている
- 著作権表示とライセンス本文を、複製物・実質的な部分に必ず含めること
- 利用は、後述のAcceptable Use Policy(許容利用ポリシー)と適用法令(貿易規制を含む)に従うこと
- 商用条件: (1) このソフトウェアを使う商用製品・サービスのUI上に「MiniMax-Music3」の名称を明示すること。(2) 自社・関連会社が提供する当該製品・サービスの年間合計売上が2,000万ドル(約30億円)を超える場合、MiniMaxに個別の書面許諾を得ること(
api@minimax.io宛てに申請) - 第三者に生成機能を提供するサービスを運営する場合、権利侵害等の不正利用を防止・軽減するための技術的・組織的な安全策を実装・維持・テスト・定期レビューする義務がある
Acceptable Use Policy(Exhibit A、最終改訂2026年8月6日)には、違法行為・自傷他害・ガードレール回避・未成年搾取・偽情報拡散・なりすまし・軍事目的利用など19項目の禁止事項が列挙されている。11番目の項目には「生成物であることを明確かつ目立つ形で開示せずに、公開の場(bot投稿等を含む)で情報・コンテンツを生成・拡散する用途」も禁止と明記されている。
またLICENSE文末には、モデルの構成要素の由来も記載されていた。
| 構成要素 | 由来 | 元のライセンス |
|---|---|---|
| Global LLM(8B) | Qwen3-8Bから初期化 | Apache License 2.0 |
| DiT-2B(拡散モデル部分) | Stability AI「Stable Audio」のコードを改変 | MIT License |
| VAE | Descript Audio Codec(DAC)のコードを改変 | MIT License |
「Qwen3-8Bから初期化」という点はモデルカード(README)にも記載があったが、拡散モデル部分がStability AIのStable Audioコードを、VAEがDescriptのDACコードをそれぞれ改変したものだという由来は、README本文には記載がなく、LICENSEファイルを直接確認して初めて分かった情報だった。
実際に聴いての品質評価はしていない
本記事の仕様説明はHugging FaceのモデルカードとMiniMax公式リリースノート、LICENSE原文に基づく。実際に生成した楽曲の品質、既存のSuno・Udio(当サイトの比較記事で扱った2社)との聴感上の違いは、本記事では検証していない。当ラボは音の判定を実際に聴くことに依存しており、テキスト情報だけでは品質の優劣は判断できないため、この点は明記しておく。「2,000万ドル」という商用ライセンスの閾値が、他社(Qwen3.8-Max等)の類似の売上連動ライセンスと比べて高いのか低いのかという横並び比較も、本記事では行っていない。
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。