Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多
AlibabaのQwenチームは2026年8月5日、27Bパラメータの密(dense)視覚言語モデル「Qwen3.8-27B」をApache-2.0でHugging Faceに公開した。ネイティブに26万2,144トークン、拡張で最大100万トークンのコンテキストに対応し、Terminal Bench 2.1で73.0点と自己申告。8月27日時点でダウンロード329万回・likes 1.3万に達しており、同月に公開された中国勢モデルの中で最も反応が大きい。

目次
AlibabaのQwenチームは2026年8月5日、パラメータ数27Bの密(dense)モデル「Qwen3.8-27B」をApache-2.0ライセンスでHugging Faceに公開した。すでに大型モデルのQwen3.8-Max(関連記事)や、次世代技術を先行公開したQwen3.8-Flash-Next(関連記事)を扱ってきたが、実際に個人のマシンで動かせる帯域の密モデルとしては、このQwen3.8-27Bが本命候補になる。
3行まとめ
- Qwenチームは2026年8月5日、27Bパラメータの密モデル「Qwen3.8-27B」をApache-2.0でHugging Face公開。ネイティブ26万2,144トークン、YaRNで最大100万トークンまで拡張可能
- モデルカード掲載のマルチモーダルベンチマークでは、コンピュータ操作(OSWorld-Verified)84.3・モバイル操作(AndroidWorld)81.9など、比較対象の「Opus4.6 Max」を上回る自己申告スコアが複数ある
- 8月27日時点でダウンロード329万回・likes 1.3万(FP8・NVFP4量子化版を含む3リポジトリ合計は978万回超)。VRAM要件はSGLang公式Cookbookで確認済み(NVFP4約16.5GB・FP8約28.5GB)だが、いずれもQwen・SGLang自身の公開値で、第三者による独立再現検証は本記事では確認していない
モデルカードで確認できる仕様
Hugging Face上のREADME(一次ソース、curlで全文取得・確認済み)による仕様は次の通り。
- パラメータ数: 27B(密モデル。MoEではない)
- ネイティブ視覚言語モデル: アダプタの後付けではなく、画像・動画を直接入力できる設計
- コンテキスト長: ネイティブ26万2,144トークン、拡張で最大100万トークン
- 構造: 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) というハイブリッド線形注意+MTP(Multi-Token Prediction)構成
- 思考モードの制御: 既定でオン、リクエスト単位でオフ可能。
reasoning_effortで推論の深さを調整、preserve_thinkingで過去メッセージの推論コンテキストを保持できる
ベンチマーク(Qwen自己申告)
モデルカードには、コーディング・エージェント系のテキストベンチマークに加え、VLM(視覚言語モデル)としてのマルチモーダルベンチマークが別表で掲載されている。いずれもQwen自身が公開している数字で、比較対象にはAlibaba自社の旧モデルに加えて、他社モデルとみられる「Muse Glimmer-30B」「Opus4.6 Max」も含まれている。
コーディング・エージェント系(一部)
| ベンチマーク | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Opus4.6 Max |
|---|---|---|---|---|
| Terminal Bench 2.1(Terminus・エージェント型ターミナル操作) | 73.0 | 63.4 | 64.0 | 78.2 |
| SWE-bench Pro(エージェント型コーディング) | 61.7 | 53.5 | 57.6 | 53.4 |
| QwenSWEBench(ソフトウェア工学) | 79.0 | 49.3 | 59.2 | 63.8 |
| CoWorkBench(長時間の事務作業) | 70.7 | 61.0 | 65.1 | 68.2 |
マルチモーダル(VL Performance、一部)
| ベンチマーク | 内容 | Qwen3.8-27B | Opus4.6 Max |
|---|---|---|---|
| OSWorld-Verified | コンピュータ操作エージェント | 84.3 | 72.7 |
| WebArena-Verified | ブラウザ操作エージェント | 64.8 | 記載なし |
| AndroidWorld | モバイル操作エージェント | 81.9 | 62.0 |
| SWE-MM | マルチモーダルなソフトウェア工学 | 38.6 | 27.1 |
| RealWorldQA | 実世界の視覚的質問応答 | 85.9 | 73.9 |
| ERQA | 身体性を伴う推論(embodied reasoning) | 65.5 | 40.8 |
Terminal Bench 2.1とSWE-bench ProはOpus4.6 Maxとの直接比較が載っている数少ない指標で、前者はOpus優位(78.2 vs 73.0)、後者はQwen3.8-27B優位(61.7 vs 53.4)という結果になっている。同じ「Opus4.6 Max比」でも指標によって優劣が入れ替わっており、単一の指標だけで「勝った/負けた」と単純化しない方がよさそうだ。
反応の大きさ:中国勢8月公開モデルの中で最大
Hugging Face APIで確認した実測値(2026年8月27日時点)は次の通り。
createdAt: 2026-08-05T08:22:59ZlastModified: 2026-08-14T15:00:01Z- ダウンロード数: 3,298,569
- likes: 12,939
この記事で他に扱っているTencent UI-Mate-27B(likes 85)、MiniMax Music3(likes 1,255前後)などと比べても、likesの規模が一桁大きい。2026年8月に中国勢が公開したオープンウェイトモデルの中では、反応の大きさで頭一つ抜けている。
Hugging Face上には量子化済みの公式チェックポイントも別リポジトリで公開されており、こちらもダウンロード数を独立にカウントしている。同じくAPIで確認したところ、FP8版「Qwen/Qwen3.8-27B-FP8」(作成日2026-08-13)が5,129,402ダウンロード・likes 732、NVFP4版「RadixArk/Qwen3.8-27B-NVFP4」(作成日2026-08-14)が1,352,270ダウンロード・likes 70だった。ベース(BF16)の329万回と合わせた3リポジトリ合計は978万回を超える。量子化版のダウンロード数がベース版を上回っている点からは、実際に動かしている層の多くがBF16のままではなく、VRAMに合わせて量子化版を選んでいることがうかがえる。
個人のマシンで動かせるか
27Bという規模は、ローカルLLMの実用ラインとしてよく参照される帯域だ。当サイトのローカルLLMおすすめモデル10選やローカルLLMとは何かで扱ってきた「自宅のGPU/Macで動かせる」規模に収まる密モデルで、なおかつ画像・動画のネイティブ理解を備えている点は、同クラスの他モデルとの差別化点になる。
モデルカードには、実運用に向けた推奨設定が書かれている。サンプリングパラメータは「思考モード時: temperature=1.0, top_p=0.95, top_k=20」「非思考モード時: temperature=0.7, top_p=0.80, top_k=20, presence_penalty=1.5」を推奨。デプロイはSGLang・vLLM・TokenSpeedの3フレームワーク向けに専用レシピが公式に用意されている。ネイティブの26万2,144トークンを超えて最大100万トークンまで拡張するには、YaRN(RoPEスケーリング手法)を使い、config.jsonのrope_parametersを書き換えるか、vLLM/SGLang起動時に該当オプションを渡す方法が案内されている。ただしモデルカードは「静的YaRNは短いコンテキストでの性能を落とす可能性があるため、長文処理が必要な場合のみ有効化すべき」とも注記しており、常時100万トークンモードで使う設計ではなさそうだ。
VRAM要件と対応カード(SGLang公式Cookbookで確認)
SGLangの公式デプロイガイド(curlで本文取得・確認済み)には、量子化ごとの重みサイズと動作カードが具体的に記載されている。
| チェックポイント | 量子化 | 重みサイズ目安 | 動作確認カード |
|---|---|---|---|
| Qwen/Qwen3.8-27B | BF16 | モデルカード記載なし | H200, RTX PRO 6000, DGX Spark |
| Qwen/Qwen3.8-27B-FP8 | FP8(blockwise) | 約28.5GB(32GBカードではbs≤2までしか動かせないとの記載) | H200, RTX PRO 6000, DGX Spark |
| RadixArk/Qwen3.8-27B-NVFP4 | NVFP4 W4A4(lm_headはFP4) | 約16.5GB(RTX 5090クラスに推奨と明記) | RTX PRO 6000, RTX 5090, DGX Spark |
いずれも「1枚のGPUで動く」設計で、H200・RTX PRO 6000(Blackwell)・RTX 5090・DGX Spark(GB10、128GB統合メモリ)の4種で動作確認されている。ただしH200はFP4テンサーコアを搭載していないため、NVFP4チェックポイントはH200では対象外(フォールバックでMarlin W4A16経路になり、そのセルはグレーアウトと明記)。
投機的デコード(speculative decoding)を使った場合の実測レイテンシもRTX 5090上の数値として掲載されており、「DFlash2」方式で median TPOT 4.92ms・受理長(accept length)4.29が「このカードでの最良結果」と記載されている。また同じNVFP4+EAGLE構成でも、SSMの状態をfp32で持つかbf16で持つかでトークン速度が変わり(152.9 vs 144.5 tok/s/user)、FP8+EAGLEでは逆にfp32の方が遅いケース(106.3 vs 116.1)も報告されている。これらはいずれもSGLangチーム自身による計測値で、当サイトが独立に再計測したものではない。
DGX Spark(GB10、aarch64)については「3チェックポイント × 投機的デコード方式 × サービング戦略 × SSMデータ型」の48通り全パターンが起動・応答まで確認済みと明記されている一方、スループットや受理長の数値までは取れていない「起動確認のみ」の扱いだと注記されている。またDGX Sparkは128GBがCPUとの統合メモリのため、--mem-fraction-staticを0.85にするとOS側のメモリが不足してプロセスがkillされる事例が15/48セルで発生し、0.80であれば全セルで動作したとも書かれている。
ベンチマーク表の「Opus4.6 Max」「Muse Glimmer-30B」は何者か特定していない
本記事の数字(仕様・ベンチマーク・ダウンロード数・VRAM要件)はすべてHugging Face(README・API)とSGLang公式Cookbookという一次資料から直接確認したもので、Qwen・SGLangそれぞれの自己申告値を含む。以下は本記事では検証・特定できていない点。
- 比較表に登場する「Opus4.6 Max」はAnthropicのモデルを指すとみられるが、Anthropic側がこの名称・バージョンのモデルを公式に発表しているかどうかは、本記事では突き合わせていない。「Muse Glimmer-30B」についても、どの企業のどのモデルなのか本記事では特定できていない
- マルチモーダルベンチマーク表に出てくる「CI」という略号(MathVision・BabyVision・CharXiv (RQ)の欄に付記)が何を指すか、モデルカード本文に明示的な定義を見つけられなかった。文脈から「Code Interpreter」の可能性があると推測したが、これは当サイトの推測であり確認済みの事実ではない
- BabyVisionというベンチマークで、Qwen3.8-27B(With CIで85.6)とOpus4.6 Max(12.6)の差が他の指標に比べて突出して大きい。この差が妥当なものかどうかを判断する材料(ベンチマークの詳細な内容・採点方法)は本記事では確認していない
- VRAM要件やレイテンシの数値はSGLang公式Cookbookに実測値として記載があるものを引用したが、これはSGLangチーム自身の計測であり、当サイトや他の第三者機関による独立した再現検証ではない。ベンチマークスコア(Terminal Bench 2.1など)についても同様に、第三者機関による再現検証は本記事では確認していない
オープンウェイトの定義や「オープンソースとの違い」についてはオープンウェイトとは何かを参照してほしい。
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。