AI時短ラボ
モデル· 約11

Qwen3.8-27BはどのMacで動くか──GGUF量子化ファイルの実サイズから積算した

Alibabaが2026年8月5日に公開した「Qwen3.8-27B」は27Bパラメータの高密度(Dense)ビジョン言語モデルで、Hugging Face上のGGUF量子化版は最小6.19GB(IQ1_S)から最大31.46GB(Q8_K_XL)まで24種類が公開されている。Apple・Qwen双方から「Macでは何GB必要か」という公式のガイドは見当たらなかったため、公開されているファイルサイズをもとに積算した。

Qwen3.8-27BはどのMacで動くか──GGUF量子化ファイルの実サイズから積算した
執筆・編集:
目次

Qwenの最上位モデル「Qwen3.8-Max」(2.4兆パラメータ)は個人のマシンで動かせる規模ではないが、同じQwen3.8世代には27Bパラメータの高密度モデル「Qwen3.8-27B」も存在する。こちらは「持ち帰って自分のMacで動かす」現実的な選択肢に入ってくるサイズだ。本稿はHugging Face上の公式モデルカードとGGUF量子化ファイルの実サイズを一次で確認し、Macで動かす際の目安を積算する。

3行まとめ

  1. Qwen3.8-27Bは2026年8月5日公開の27Bパラメータ・高密度(MoEではない)ビジョン言語モデルで、ネイティブに262,144トークン、RoPEスケーリングで最大1,000,000トークンまでのコンテキストに対応する。ライセンスはApache 2.0
  2. GGUF量子化版(unsloth配布)は最小6.19GB(IQ1_S)から最大31.46GB(Q8_K_XL)まで24ファイルが公開されている。実用的な品質とされることが多いQ4_K_Mは16.46GB、Q6_Kは21.98GB
  3. 「Macで何GB必要か」という公式のガイドはQwen・unsloth双方のモデルカードに見当たらなかった。本稿末尾の対応表は、公開ファイルサイズにmacOS本体の消費分・コンテキスト用メモリを加味した、独自の積算である

Qwen3.8-27Bとは何か

Hugging Face公式モデルカードによれば、Qwen3.8-27Bは「Qwen3.5のアーキテクチャを基盤に、コーディング・専門的な業務・研究・長期にわたるエージェント的タスクで大幅な性能向上を実現した」とされるQwen3.8世代の一角で、「コンパクトでデプロイしやすい高密度(dense)モデル」と位置づけられている。画像・動画を理解するネイティブなビジョン言語モデルであり、思考の切り替え(thinking control)にも対応するという。

パラメータ数は27B。MoE(Mixture of Experts)ではなく、全パラメータが常時使われる高密度モデルである点は、前述のQwen3.8-Max(2.4兆パラメータ・アクティブ950億のMoE)とは構造が異なる。

コンテキスト長は「ネイティブに262,144トークン、RoPEスケーリング技術(YaRNなど)を使えば最大1,000,000トークンまで拡張可能」と明記されている。

GGUF量子化ファイルの実サイズ(2026年8月27日確認)

Hugging Face上のunsloth/Qwen3.8-27B-GGUFリポジトリには、量子化レベル別に24種類のGGUFファイル(量子化モデル本体。ほかにmmproj×2・imatrix×1が別途公開されている)が公開されている。ファイルツリーAPIで実際のバイト数を確認したところ、代表的なものは次の通りだった(値は実ファイルサイズを10進数換算=1GB=10^9バイトでGBに変換したもの。2進数(1GiB=2^30バイト)換算だとこれより約7.4%小さい値になる)。

量子化レベル ファイルサイズ
IQ1_S(最小) 6.19 GB
IQ2_XXS 7.27 GB
Q2_K_XL 9.83 GB
IQ3_S 12.04 GB
IQ4_XS 14.25 GB
Q4_K_M 16.46 GB
Q4_K_XL 17.56 GB
Q5_K_M 19.77 GB
Q6_K 21.98 GB
Q6_K_XL 25.30 GB
Q8_0 29.05 GB
Q8_K_XL(最大) 31.46 GB

一般に量子化レベルが低い(ビット数が少ない)ほどファイルは小さく動作は軽くなるが、出力品質の劣化リスクが高まる。IQ1_S・IQ2系は極端に低ビットな量子化で、実用品質を保てるかどうかはモデル・タスクによって差が大きいとされる。ローカルLLMコミュニティでは、Q4_K_M〜Q6_K程度が「品質と軽さのバランスが取れた実用ライン」として選ばれる傾向がある(この評価軸自体はコミュニティの経験則であり、Qwen・unsloth公式が定めた基準ではない)。

MLX形式の量子化版も、コミュニティから複数公開されている

GGUFはllama.cppなど汎用の推論エンジンで使われる形式だが、Apple SiliconのGPU・Neural Engineに最適化された「MLX」というApple製フレームワーク向けの形式も、Qwen3.8-27Bには存在する。Hugging Face APIで検索すると、mlx-communitylmstudio-communityなど複数のコミュニティアカウントから、4bit・6bit・8bitなど様々な量子化レベルのMLX版が公開されていることを確認した。ただしQwen公式(Qwenアカウント)自身がMLX版を配布しているわけではなく、あくまでコミュニティによる変換版である。

代表的な2つのファイルサイズを、Hugging Face APIで実際に集計すると次のようになった。

形式 量子化レベル 実ファイルサイズ 対応するGGUFのおおよその量子化レベル
MLX(mlx-community/Qwen3.8-27B-4bit 4bit 16.05 GB Q4_K_M(16.46GB)とほぼ同水準
MLX(mlx-community/Qwen3.8-27B-8bit 8bit 29.50 GB Q8_0(29.05GB)とほぼ同水準

同じビット数であれば、MLXとGGUFのファイルサイズはかなり近い水準になる。どちらの形式が実際に速く動くか(Apple Silicon上での実効速度の差)は、この記事では検証していない。

なお、Qwen公式(Qwenアカウント)自身は、GGUF・MLXではなく「FP8」という別の量子化形式を公式に配布している。Qwen/Qwen3.8-27B-FP8のファイルサイズをHugging Face APIで確認すると、実測30.87GBだった。これはGGUFのQ8_0(29.05GB)・MLXの8bit版(29.50GB)と近い、8bit相当のサイズ感になる。

Macで動かす場合の目安(独自の積算・非公式)

Apple・Qwen・unsloth、いずれの公式ドキュメントにも「Macで動かすには何GBの統合メモリが必要か」という具体的な指針は見当たらなかった。そこで本稿では、確認できたファイルサイズをもとに、次の前提で目安を積算する。

  • モデルの重み(GGUFファイルサイズ)をそのままメモリに載せる必要がある
  • macOS本体・バックグラウンドアプリで一定のメモリが消費される
  • 会話の文脈を保持する「KVキャッシュ」も、コンテキスト長に応じて別途メモリを消費する(長いコンテキストを使うほど増える)

これらを踏まえた大まかな対応関係は次の通りになる(あくまで目安であり、実測ではない)。

統合メモリ 動かせる可能性がある量子化レベルの目安
16GB IQ1_S〜IQ2_XXS程度(品質劣化が大きい極小量子化のみ現実的)
24GB Q3系〜IQ4_XS程度まで、短いコンテキストなら
32GB Q4_K_M〜Q4_K_XL程度が現実的なライン
36〜48GB Q5_K_M〜Q6_K程度まで、ある程度長いコンテキストも余裕を持って
64GB以上 Q8_0〜Q8_K_XL(ほぼ無劣化に近い量子化)まで、長いコンテキストも含めて余裕を持って

262,144トークンのネイティブ上限まで使い切るような長文処理をさせる場合は、上記の目安よりもさらに大きな統合メモリが必要になる可能性が高い。短い質問応答中心であれば、表より小さいメモリでも動く可能性はある。

実際にMac上で動作を検証したわけではない

  • 上記の「動かせる可能性がある量子化レベルの目安」は、公式のベンチマークや実測データに基づくものではなく、ファイルサイズからの単純な積算に基づく本稿独自の推測である。実際にMac上で動作を検証したわけではない
  • KVキャッシュの消費量はコンテキスト長・バッチサイズ・実装(llama.cpp/MLXなど)によって変わり、本稿では具体的な計算式までは示していない
  • MLX形式の量子化版が存在すること自体とファイルサイズはHugging Face APIで確認したが、GGUF版との実効速度の差(同じMacで同じプロンプトを流したときのトークン/秒の違いなど)は、この記事では検証していない
  • MLX版の配布元はmlx-communitylmstudio-communityなど複数あり、この記事で確認したのはmlx-communityが配布する4bit・8bit版の2つのみ。他の配布元・他の量子化レベルまでは網羅的に確認していない
  • Qwen3.8-27Bの実際の生成品質・ベンチマークスコールは、本稿では扱っていない(モデルの性能評価は既存記事「Qwen3.8-Max」の解説を参照)

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事