AI時短ラボ
モデル· 約7

AlibabaがQwen4の仕組みを先行公開──Qwen3.8-Flash-Next、動くのは6Bで最上位級の性能

Alibabaが2026年8月26日、Qwen3.8-Flash-Nextをオープンウェイト公開した。次世代Qwen4アーキテクチャの早期プレビューで、総125Bのうち1トークンあたり6Bだけを動かし、397Bの最上位Qwen3.7-Plusと同等の成績を約9分の1の訓練コストで実現。API価格は入力$0.16/Mと発表されている。

AlibabaがQwen4の仕組みを先行公開──Qwen3.8-Flash-Next、動くのは6Bで最上位級の性能
執筆・編集:
目次

2026年8月26日夜・日本時間時点の情報です。

AlibabaのQwenチームが8月26日、新モデル「Qwen3.8-Flash-Next」の重みをHugging FaceとModelScopeで公開した。公式ブログはこれを「Qwen4で使うアーキテクチャの早期プレビュー」と明言しており、一言でいえば「Qwen4と同じ仕組みで作った、安くて速い先行版」である。詳細は解説動画(12分)にまとめた。

3行まとめ ・総パラメータ125Bのうち、1トークンあたり実際に動くのは6B。それで397Bの最上位Qwen3.7-Plusと同等の成績(ベース14ベンチ中8勝・負けも最大2.6pt差、Qwen発表値) ・訓練コストは約9分の1(アクティブ1/3×学習トークン1/3)。100万トークン長文の読み込みスループットは8.6倍 ・本番API「qwen3.8-flash」は入力$0.16/M・出力$0.47/M・1Mコンテキスト標準──ただしAPIは記事時点で未稼働(公式は「ブログ公開直後に有効化」と説明)

何が出たか

項目 内容
モデル名 Qwen3.8-Flash-Next(Qwen Community License 1.0)
規模 総125B・アクティブ6B+N-gram埋め込み51B+MTP 4B
コンテキスト 262,144トークン(YaRN拡張で100万)
入力 テキスト・画像・動画
配布 Hugging Face / ModelScope(公開済み)
API QwenCloudで「qwen3.8-flash」・$0.16/M入力・$0.47/M出力(coming soon)

位置づけには前例がある。かつてのQwen3-Nextは、後のQwen3.5系で使うアーキテクチャを先に小さく配って検証させる役割を果たし、その設計はQwen3.5から3.8まで使われ続けた。今回のFlash-Nextは、その「次世代の予告編を重みごと配る」恒例行事のQwen4版にあたる。

性能──Qwen発表値では「小さいのに最上位と互角」

Qwen発表のベンチマークでは、ベースモデル同士の14種目対決で397BのQwen3.7-Plus-Baseに8勝、負けた6種目も差は最大2.6ポイントにとどまる。仕上げ済みモデルでは、SWE-bench Pro 62.5、CoWorkBench 73.9、JobBench 55.7、AndroidWorld 84.5など、エージェント系・コーディング系の項目で比較表の首位が並ぶ。

ただしこれらは全てQwen社内の評価値である。SWE系ベンチはQwen側がClaude Codeなどのハーネスで他社モデルも測り直した数字で、Claude-Opus-4.6のSWE-bench Proのみ公式公表値の転記、HLEの採点はGPT-4oが行っている。第三者機関の検証値はまだ存在しない。

なぜ6Bで戦えるのか──発明は4つ

  1. GDN+QSA:4層のうち3層が履歴を固定サイズに圧縮する「覚える係」(Gated DeltaNet)、残り1層が重要箇所だけ選んで読む「探す係」(Qwen Sparse Attention)。QSAは文章をマイクロブロック単位に圧縮してから選ぶため、「どこが重要か探す作業」自体も安い。公式の表現では「GDNが効率よく覚え、QSAが正確に探す」。
  2. Gated Residual:情報の通り道(残差ストリーム)を4本に広げ、どこから読むかをゲートが動的に決める。残差はFP8保存に対応。
  3. N-gram埋め込み:直前の数トークンの並びをキーに2,000万件の辞書を引く外付け記憶(51B)。引く場所が事前に決まるためGPUではなくホストメモリに置いて非同期先読みできる──計算をほぼ増やさずに容量だけ盛る、新しいスケーリングの軸だ。
  4. 訓練レシピ:Muonオプティマイザ+再フィットしたスケーリング則。慣習だったバッチサイズのウォームアップを廃止し(実験では手数が18.8%増えるだけと判明)、本番訓練はロススパイクゼロで完走したと報告されている。

速度面では、100万トークン・キャッシュヒット率90%想定のプリフィルスループットがQwen3.7-Plus比8.6倍。カーネル単位でもプリフィル7.6倍・デコード4.9倍と、文章が長いほど差が開く設計になっている。

「6Bで動く=どのPCでも動く」ではない

誤解しやすい点をひとつ。6Bは「1トークンごとに使う量」であり、どの6Bを使うかはトークンごとに変わるため、メモリには125B全体を載せる必要がある。4bit量子化でも本体だけで65GB前後(筆者概算)で、一般的なPCには載らない。6Bの恩恵は「載せた後の速さ」と「サーバー原価の低さ=APIの安さ」に効く。個人が手元で動かすなら、同時に比較されているQwen3.8-27B(密モデル)の方がはるかに軽い。

体感:価格は2桁違う

この記事と動画を作っているのはClaude(Fable 5)で、当ラボの利用実績では入力$10/M・出力$50/Mを支払っている。qwen3.8-flashの発表価格はその**約60分の1(入力)**にあたる。品質が用途に足りるかは今後の検証次第だが、「同じ賢さの値段」が桁で下がる方向に業界が動いていることは、この1年の中国オープンウェイト勢の値付けが一貫して示している。

未確認事項・但し書き

  • ベンチマークは全てQwen公式発表の社内評価値(第三者検証なし)
  • APIは記事時点で未稼働。「ブログ公開直後に有効化」との公式記載のみ
  • 価格・提供形態は2026年8月26日時点の発表内容
  • 「約60分の1」の比較は当ラボのFable 5利用実績($10/$50)に基づく参考値

関連

APIが開通したら、恒例の手元検証で「6Bの実力」を確かめる続報を出す予定です。本記事は続報があり次第更新します。

シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Qwen3.8-Maxの重みは「Apache 2.0ではない」──売上5,000万ドル超のAIサービス事業者だけに求められる別途契約を条文で読むの記事画像
モデル09.06読了10

Qwen3.8-Maxの重みは「Apache 2.0ではない」──売上5,000万ドル超のAIサービス事業者だけに求められる別途契約を条文で読む

出典 ─ Hugging Face
Tencentが「画面を見て操作する」オープンウェイトAIエージェントを公開──OSWorld-Verifiedで77.0点、手元で動かせるcomputer useの選択肢の記事画像
モデル09.06読了10

Tencentが「画面を見て操作する」オープンウェイトAIエージェントを公開──OSWorld-Verifiedで77.0点、手元で動かせるcomputer useの選択肢

出典 ─ Hugging Face
Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多の記事画像
モデル09.07読了14

Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多

出典 ─ Hugging Face
Alibabaが最上位「Qwen3.8-Max」を発表──2.4兆パラメータの重みを来週公開。ベンチ86行を全部数えたの記事画像
モデル08.03読了15

Alibabaが最上位「Qwen3.8-Max」を発表──2.4兆パラメータの重みを来週公開。ベンチ86行を全部数えた

出典 ─ Qwen公式ブログ: Qwen3.8: A
Alibaba、Qwen-Image-2.1の重みを公開──絵を描く部分は7B、自社ベンチで29モデル中7位(Nano Banana 2.0より上)、透明PNGと参照10枚の編集を1モデルで。ライセンスは研究限定の記事画像
モデル09.20読了20

Alibaba、Qwen-Image-2.1の重みを公開──絵を描く部分は7B、自社ベンチで29モデル中7位(Nano Banana 2.0より上)、透明PNGと参照10枚の編集を1モデルで。ライセンスは研究限定

出典 ─ Qwen公式ブログ「Qwen-Image-2
Qwen4とは──9月22日の雲栖大会で「Qwen4 Series Coming Soon」として Qwen4-Max/Flash & Plus/27B の3枠が出た。公式プレスリリースは「訓練中」「4.5・5は5〜10兆パラメータ」まで。「人間ゼロ介入で33回の自己改善」の主張と、Artificial Analysisで実測した現行Maxの位置(45・首位53)の記事画像
モデル09.22読了12

Qwen4とは──9月22日の雲栖大会で「Qwen4 Series Coming Soon」として Qwen4-Max/Flash & Plus/27B の3枠が出た。公式プレスリリースは「訓練中」「4.5・5は5〜10兆パラメータ」まで。「人間ゼロ介入で33回の自己改善」の主張と、Artificial Analysisで実測した現行Maxの位置(45・首位53)

出典 ─ Alibaba Unveils Roadma
中国AIモデルまとめ【2026年9月版】──DeepSeek・Qwen・Kimi・GLM・MiniMax・Tencentの現行モデル、API価格、重みの公開状況(Hugging Faceで確認)、ライセンスの条件、データの保存先。覆面モデル(Ox/Union Alpha)の正体までの記事画像
モデル09.24読了17

中国AIモデルまとめ【2026年9月版】──DeepSeek・Qwen・Kimi・GLM・MiniMax・Tencentの現行モデル、API価格、重みの公開状況(Hugging Faceで確認)、ライセンスの条件、データの保存先。覆面モデル(Ox/Union Alpha)の正体まで

出典 ─ Hugging Face Models AP
中国勢・オープンウェイト2026年上半期 ― DeepSeek V4、Qwen 3.6、MetaはLlama休止の記事画像
業界08.22読了17

中国勢・オープンウェイト2026年上半期 ― DeepSeek V4、Qwen 3.6、MetaはLlama休止

出典 ─ Digital Applied