AI時短ラボ
モデル· 約10

Metaが「Muse Glimmer」を公開──Muse Sparkを30Bに蒸留、Apache 2.0でローカル実行専用

Metaが2026年8月、有料APIの「Muse Spark」とは別に、29.6Bパラメータの「Muse Glimmer」をApache 2.0で重み公開した。24GB〜32GBのVRAMに収める量子化と、投機的デコード用ドラフターDFlashを同梱し、RTX 5090で3.1倍の高速化を確認済みとモデルカードにある。公式配布は本記事執筆時点で55万ダウンロードを超えていた。

Metaが「Muse Glimmer」を公開──Muse Sparkを30Bに蒸留、Apache 2.0でローカル実行専用
執筆・編集:
目次

Metaのマルチモーダルモデル「Muse」シリーズには、有料のMeta Model API経由で提供される「Muse Spark」がある(当サイトでもMuse Spark 1.1Muse Spark 1.2を扱った)。それとは別に、重みそのものを公開する「Muse Glimmer」がHugging Faceで配布されていることを、transformers v5.15.0(2026年8月10日公開)のリリースノートで確認した。

Muse Glimmer, released today, is Meta’s new multimodal model, especially designed for agentic use cases. Distilled from Muse to 30B parameters, and released under the Apache 2.0 license, it can be deployed to local setups for privacy-aware applications such as coding, document analysis, personal assistants, Claw- or Hermes-like setups.

(本日公開されたMuse Glimmerは、Metaの新しいマルチモーダルモデルで、特にエージェント用途向けに設計されている。Museから30Bパラメータに蒸留され、Apache 2.0ライセンスで公開されており、コーディング・文書分析・パーソナルアシスタント、Clawやhermesのようなセットアップなど、プライバシーを重視したアプリケーション向けにローカル環境へ展開できる)

モデルカードで確認できるスペック

Hugging Face上の公式モデルカード(meta-models/Muse-Glimmer-30B)によれば、開発元はMeta Superintelligence Lab、公開は2026年8月。パラメータ数は約29.6B(視覚エンコーダ込み)で、内訳は隠れ次元6656・52層のDense Causal Transformer、Attention headsはQuery32/KV2(GQA比16:1)、加えて約1.8BのViT-G/14ベースの知覚エンコーダを備える。コンテキスト長は131,072トークン以上、対応言語は100以上とされている。知識のカットオフは2026年1月4日と明記されていた。

モデルカードはMuse Glimmerを、次の8つの能力で評価・訓練したと説明している——エンドツーエンドのエージェントタスク完了、信頼できるツール呼び出し、複数ステップの推論、失敗からの回復、マルチモーダル入力と推論、OpenClaw・Hermes Agentなど複数のエージェント実行環境(スキャフォールド)との互換性、思考量の制御(Controllable Effort)、多言語対応(Multilingual)だ。

消費者向けハードウェアで動かす前提の設計

モデルカードの「Optimized for Local Deployments」欄には、量子化による劣化を実測した表がある。

フル精度 K-Quant-Dynamic K-Quant-17GB
劣化率 - 0.2% 1.0%
対象ハードウェア 64GB VRAM 32GB VRAM 24GB VRAM

「劣化率は15種類の一般的なベンチマークにわたる精度指標の平均で測定」とただし書きがある。約4bit精度への量子化で言語モデル部分を20GB未満に圧縮し、KVキャッシュ・知覚エンコーダ・投機的デコード用ドラフターを同時に載せてもなお24GB〜32GBのVRAMに収まる設計だという。

投機的デコードには、DFlashベースの軽量ドラフターを同梱している。モデルカードが引用するarXiv:2602.06036を実際に開いて確認すると、これは「DFlash: Block Diffusion for Flash Speculative Decoding」というタイトルの論文(著者Jian Chen・Yesheng Liang・Zhijian Liuの3名)で、自己回帰的な下書きモデルは本質的に逐次処理になってしまうという投機的デコードの限界に対し、ブロック単位の拡散モデルで並列に下書きを生成する手法を提案するものだった。Muse Glimmerのドラフターは16トークンのブロックを1回のフォワードパスでまとめて提案し、本体モデルが並列に検証する。実測速度は次の通り。

GPU 投機なし(tok/s) DFlash投機あり平均(tok/s) 倍率
NVIDIA RTX 5090 74.9 233.4 3.1倍
Apple M4 Max 23.7 37.8 1.5倍
Apple M5 Max 26.6 50.2 1.8倍

ただし書きには「M4/M5の測定はExecuTorch、RTXの測定はllama.cppを使用」とあり、測定環境が機種ごとに異なる点は明記されていた。

同規模モデルとのベンチマーク比較

モデルカードは、同じく30B前後のクラスであるGemma4-31B(Thinking Mode)・Qwen3.6-27B(Thinking Mode)との比較表も公開している。一部を抜粋する。

ベンチマーク Muse Glimmer-30B(High Reasoning) Gemma4-31B Qwen3.6-27B
MCP Atlas (Public) 75.5 54.2 62.5
DeepSearch QA 74.6 61.7 71.1
SWE-Bench Pro 51.2 36.9 50.2
OSWorld-Verified 65.9 58.5 75.6
SkillsBench (with skills) 44.3 32.4 46.6

全項目でMuse Glimmerが最上位というわけではなく、OSWorld-VerifiedやSkillsBenchではQwen3.6-27Bが上回っている。モデルカード自身も「同サイズクラスで複数の指標にわたり強い成績」という書き方にとどめており、全項目での優位は主張していない。

エコシステムでの広がり

Hugging Face APIで実測したところ、公式配布(meta-models/Muse-Glimmer-30B)のダウンロード数は623,035、likes数は1,843だった(いずれも2026年9月4日にHugging Face APIで取得)。GGUF形式の派生配布だけでも、unsloth・bartowski・mlx-communityなど複数の第三者が量子化版を公開しており、unsloth/Muse-Glimmer-30B-GGUFのページを直接開いて実在を確認したところ、945,806ダウンロードと、公式配布そのものより数字が大きい。ローカルLLMコミュニティで実際に使われている規模感がうかがえる。

Muse Sparkとの違い

有料APIの「Muse Spark」系列と「Muse Glimmer」は、名前こそ近いが別物だ。Muse Sparkはクラウド提供のAPI製品として当サイトでも扱ってきたが、Muse Glimmerは重みそのものが公開され、ローカル環境で完結させることを前提に設計されている。モデルカードが挙げる用途例(コーディング・文書分析・パーソナルアシスタント)は重なる部分もあるが、「ネットワーク接続なしで動く」という制約と引き換えに、パラメータ数はMuse Sparkよりかなり小さい。

ベンチマーク数字を自分で再現したわけではない

本記事はtransformersのリリースノート、Hugging Face上の公式モデルカード、モデルカードが引用するDFlash論文(arXiv:2602.06036)、第三者GGUF配布ページ(unsloth/Muse-Glimmer-30B-GGUF)をそれぞれ実際に開いて確認した内容にもとづく。モデルカードが引用する論文が実在するかどうかを確認したのは、この記事シリーズでは他の記事(IETFドラフトの参考文献検証など)でも重視している裏取り作業の一環で、今回は実在を確認できた。この記事を書いている自分の手元でMuse Glimmerを実際にダウンロードし、量子化版の応答品質やRTX 5090・Apple Silicon上での速度を再現する検証は行っていない。モデルカードに記載された比較ベンチマークの数字は、Meta自身が測定・公表したものであり、第三者による独立した再現結果ではない点は留意しておきたい。

関連記事: Meta、Muse Spark 1.1を発表 / Metaが「Muse Code」を公開 / ローカルLLM入門ガイド

感想・指摘はコメント欄へ。

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事