Ant GroupのLing-3.0-tinyがM4 Pro MacBookで86〜90トークン/秒──7.9BのうちアクティブなのはMITライセンスの1.3Bだけ
Ant Group系のinclusionAIは2026年8月10日、総パラメータ7.9B・アクティブ1.3BのMoEモデル「Ling-3.0-tiny」をMITライセンスで公開した。Moonshot由来のKimi Delta Attentionを3:1で採用したハイブリッド構成で、公式実測ではDGX Sparkで100〜105トークン/秒、M4 Pro MacBookで86〜90トークン/秒、8Kコンテキストでピークメモリ約8.34GiB。Mac一台でのローカルLLM運用を検討する際の実測値として貴重。

中国のオープンウェイトモデルというとDeepSeek・Qwen・MiniMax・Kimi・GLMあたりが定番だが、Alibaba傘下のAnt Groupが手がける「inclusionAI」というチームからも、2026年8月にモデルが公開されている。「Ling-3.0-tiny」は、Mac上での実測速度が公式モデルカードに明記されている点が特徴的だ。
モデルの仕様
Hugging Face上のREADME(curlで全文確認済み)によれば、仕様は次の通り。
- ライセンス: MIT
- 総パラメータ7.9B、トークンあたりアクティブなのは1.3BのMoE(Mixture of Experts)構成
- 注意機構はKDA:MLA = 3:1(4層ブロックごとに、Moonshot発の技術であるKimi Delta Attention 3層+Multi-Head Latent Attention 1層)。この技術は元々Moonshot(Kimiシリーズ)が開発したもので、それを他社(Ant Group)が採用した形になる
- MoE FFN部分は128の routed experts を持ち、各トークンは8つのrouted expertと1つのshared expertを活性化
- BF16・FP8・INT4の重みを提供し、幅広いハードウェア・デプロイ設定に対応
- 思考モード(
enable_thinking)をリクエスト単位で切り替え可能
Mac実測値(inclusionAI自己申告)
モデルカードに明記されている実測値は次の通り。
| 環境 | 出力速度 | 備考 |
|---|---|---|
| NVIDIA DGX Spark(FP8) | 100〜105 tokens/s | |
| M4 Pro MacBook(FP8) | 86〜90 tokens/s | 8Kコンテキストでピークメモリ約8.34 GiB |
さらに、Artificial Analysisのテストでは出力速度160 tokens/s超、500トークン応答のエンドツーエンド遅延は推論時間込みで約18秒とされている。同じくArtificial Analysisの指標では、Intelligence Index v4.1.1で25点、Agentic Indexで16点。いずれもモデル自身または第三者ベンチマークサービスによる数字で、当ラボ独自の検証は行っていない。
なぜMac実測値が貴重か
当サイトはMac Studio M5 Ultraでローカル動作を検証する記事など、Macでのローカル運用検討を継続的に扱っている。多くのモデルカードは性能ベンチマークを載せるものの、具体的な機種名でのトークン/秒の実測値まで公式に明記しているケースは少ない。Ling-3.0-tinyは「M4 Pro MacBook」という具体的な機種名で実測を公開しており、Mac購入・買い替えを検討する際の判断材料として使える。
なお、7.9B/アクティブ1.3Bという規模はAPI経由のクラウドモデルと比べれば非力だが、ローカルで軽快に動く点、MITライセンスで商用利用の制約がほぼない点は、常時起動のローカルアシスタント用途などに向く。
正直に:この記事の範囲
本記事の速度・メモリ使用量の数字はすべてinclusionAI自身が公開しているものであり、当ラボによる実機での再現検証は行っていない。M4 Pro MacBookの具体的なメモリ構成(RAM容量)はモデルカードの当該箇所には明記がなく確認できていない。また、Ling-3.0-tinyはAnthropic・OpenAI・Google・中国7社という当サイトの通常の担当範囲には含まれないモデルで、扱うかどうかは編成側の判断に委ねる。
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。