AlibabaがQwen4の仕組みを先行公開──Qwen3.8-Flash-Next、動くのは6Bで最上位級の性能
Alibabaが2026年8月26日、Qwen3.8-Flash-Nextをオープンウェイト公開した。次世代Qwen4アーキテクチャの早期プレビューで、総125Bのうち1トークンあたり6Bだけを動かし、397Bの最上位Qwen3.7-Plusと同等の成績を約9分の1の訓練コストで実現。API価格は入力$0.16/Mと発表されている。

2026年8月26日夜・日本時間時点の情報です。
AlibabaのQwenチームが8月26日、新モデル「Qwen3.8-Flash-Next」の重みをHugging FaceとModelScopeで公開した。公式ブログはこれを「Qwen4で使うアーキテクチャの早期プレビュー」と明言しており、一言でいえば「Qwen4と同じ仕組みで作った、安くて速い先行版」である。詳細は解説動画(12分)にまとめた。
3行まとめ ・総パラメータ125Bのうち、1トークンあたり実際に動くのは6B。それで397Bの最上位Qwen3.7-Plusと同等の成績(ベース14ベンチ中8勝・負けも最大2.6pt差、Qwen発表値) ・訓練コストは約9分の1(アクティブ1/3×学習トークン1/3)。100万トークン長文の読み込みスループットは8.6倍 ・本番API「qwen3.8-flash」は入力$0.16/M・出力$0.47/M・1Mコンテキスト標準──ただしAPIは記事時点で未稼働(公式は「ブログ公開直後に有効化」と説明)
何が出たか
| 項目 | 内容 |
|---|---|
| モデル名 | Qwen3.8-Flash-Next(Qwen Community License 1.0) |
| 規模 | 総125B・アクティブ6B+N-gram埋め込み51B+MTP 4B |
| コンテキスト | 262,144トークン(YaRN拡張で100万) |
| 入力 | テキスト・画像・動画 |
| 配布 | Hugging Face / ModelScope(公開済み) |
| API | QwenCloudで「qwen3.8-flash」・$0.16/M入力・$0.47/M出力(coming soon) |
位置づけには前例がある。かつてのQwen3-Nextは、後のQwen3.5系で使うアーキテクチャを先に小さく配って検証させる役割を果たし、その設計はQwen3.5から3.8まで使われ続けた。今回のFlash-Nextは、その「次世代の予告編を重みごと配る」恒例行事のQwen4版にあたる。
性能──Qwen発表値では「小さいのに最上位と互角」
Qwen発表のベンチマークでは、ベースモデル同士の14種目対決で397BのQwen3.7-Plus-Baseに8勝、負けた6種目も差は最大2.6ポイントにとどまる。仕上げ済みモデルでは、SWE-bench Pro 62.5、CoWorkBench 73.9、JobBench 55.7、AndroidWorld 84.5など、エージェント系・コーディング系の項目で比較表の首位が並ぶ。
ただしこれらは全てQwen社内の評価値である。SWE系ベンチはQwen側がClaude Codeなどのハーネスで他社モデルも測り直した数字で、Claude-Opus-4.6のSWE-bench Proのみ公式公表値の転記、HLEの採点はGPT-4oが行っている。第三者機関の検証値はまだ存在しない。
なぜ6Bで戦えるのか──発明は4つ
- GDN+QSA:4層のうち3層が履歴を固定サイズに圧縮する「覚える係」(Gated DeltaNet)、残り1層が重要箇所だけ選んで読む「探す係」(Qwen Sparse Attention)。QSAは文章をマイクロブロック単位に圧縮してから選ぶため、「どこが重要か探す作業」自体も安い。公式の表現では「GDNが効率よく覚え、QSAが正確に探す」。
- Gated Residual:情報の通り道(残差ストリーム)を4本に広げ、どこから読むかをゲートが動的に決める。残差はFP8保存に対応。
- N-gram埋め込み:直前の数トークンの並びをキーに2,000万件の辞書を引く外付け記憶(51B)。引く場所が事前に決まるためGPUではなくホストメモリに置いて非同期先読みできる──計算をほぼ増やさずに容量だけ盛る、新しいスケーリングの軸だ。
- 訓練レシピ:Muonオプティマイザ+再フィットしたスケーリング則。慣習だったバッチサイズのウォームアップを廃止し(実験では手数が18.8%増えるだけと判明)、本番訓練はロススパイクゼロで完走したと報告されている。
速度面では、100万トークン・キャッシュヒット率90%想定のプリフィルスループットがQwen3.7-Plus比8.6倍。カーネル単位でもプリフィル7.6倍・デコード4.9倍と、文章が長いほど差が開く設計になっている。
「6Bで動く=どのPCでも動く」ではない
誤解しやすい点をひとつ。6Bは「1トークンごとに使う量」であり、どの6Bを使うかはトークンごとに変わるため、メモリには125B全体を載せる必要がある。4bit量子化でも本体だけで65GB前後(筆者概算)で、一般的なPCには載らない。6Bの恩恵は「載せた後の速さ」と「サーバー原価の低さ=APIの安さ」に効く。個人が手元で動かすなら、同時に比較されているQwen3.8-27B(密モデル)の方がはるかに軽い。
体感:価格は2桁違う
この記事と動画を作っているのはClaude(Fable 5)で、当ラボの利用実績では入力$10/M・出力$50/Mを支払っている。qwen3.8-flashの発表価格はその**約60分の1(入力)**にあたる。品質が用途に足りるかは今後の検証次第だが、「同じ賢さの値段」が桁で下がる方向に業界が動いていることは、この1年の中国オープンウェイト勢の値付けが一貫して示している。
未確認事項・但し書き
- ベンチマークは全てQwen公式発表の社内評価値(第三者検証なし)
- APIは記事時点で未稼働。「ブログ公開直後に有効化」との公式記載のみ
- 価格・提供形態は2026年8月26日時点の発表内容
- 「約60分の1」の比較は当ラボのFable 5利用実績($10/$50)に基づく参考値
関連
APIが開通したら、恒例の手元検証で「6Bの実力」を確かめる続報を出す予定です。本記事は続報があり次第更新します。
出典・参照資料
この記事の解説動画
YouTubeで見る ↗AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。