# Alibaba 開放 Qwen3.8-Flash-Next 權重，以 6B active parameters 探索 Qwen4 成本效率架構

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Qwen (@Alibaba_Qwen) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-08-26

> 原始來源：https://x.com/Alibaba_Qwen/status/2092591393424515114

## 證據與延伸閱讀

- [Alibaba 開放 Qwen3.8-Flash-Next 權重，以 6B active parameters 探索 Qwen4 成本效率架構。](https://qwen.ai/blog?id=qwen3.8-flash-next)
- [Qwen3.8-Flash API 定價 $0.16 與 $0.47](https://x.com/Alibaba_Qwen/status/2092591393424515114)
- [模型有 125B 參數與 51B N-gram 參數](https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next)
- [四個方向改造與多項架構升級](http://recipes.vllm.ai/Qwen/Qwen3.8-Flash-Next)
- [Arena.ai Code Arena 取得 1617 分](https://x.com/arena/status/2092634186784059659)

## 中文摘要

Alibaba 開放 Qwen3.8-Flash-Next 權重，以 6B active parameters 探索 Qwen4 成本效率架構。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/5a8dfbd301bc7bab.jpg)
> Qwen 的 Qwen3.8-Flash 發表宣傳圖，深色背景搭配藍色幾何光暈與幾何立體造型，正中以大字顯示產品名稱與「Now Available」字樣，下方標註「Qwen3.8-Flash-Next:Now Open Weights」。

Qwen3.8-Flash 的 production version 預計很快透過 QwenCloud API 提供，輸入價格為每 1M tokens 0.16 美元、輸出價格為每 1M tokens 0.47 美元。

**發布內容** Qwen3.8-Flash-Next 是 multimodal MoE 模型，也是 Qwen4 架構的 early preview。這次先開放權重，讓社群能在 Qwen4 完整模型建立前獨立評估新設計；至於名稱不同的 Qwen3.8-Flash production version，Qwen 表示將稍後透過 QwenCloud API 上線。模型主體有 125B parameters，另配置 51B N-gram Embedding parameters，但每個 token 只啟用 6B parameters。

**架構更新** 新模型從注意力、殘差、嵌入與最佳化器四個方向改造，重點如下：

- **GDN + QSA Hybrid Attention**：Gated DeltaNet（GDN）壓縮歷史資訊；Qwen Sparse Attention（QSA）則使用輕量 indexer，在 micro-block 粒度挑選重要 context，降低長序列 attention 的計算與索引成本。vLLM 的說明指出，每四層中有三層使用 GDN，第四層使用 QSA 精確擷取長距離資訊。
- **Gated Residual**：將 residual stream 擴展為 4 個平行 branches，透過動態 gating 控制跨層資訊的讀取與寫入，改善資訊流動與 training stability；來源也提到 residual state 可使用 FP8 保存，以減少記憶體流量。
- **N-gram Embedding**：利用 local context 對查找表進行 deterministic lookup，以很低的每 token 計算成本增加模型容量。51B 的 embedding table 可放在 host memory，並透過 asynchronous prefetching 與模型計算重疊。
- **Muon optimizer**：Qwen 重新調整正交化、Muon 與 AdamW 的參數分工，以及 fused parameter splitting，並針對新架構重新擬合 scaling law。
- **MTP**：vLLM recipe 指出模型內建 Multi-Token Prediction，可支援 speculative decoding。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/48692759bc5f0675.jpg)
> Qwen 的混合架構模型層級與運作流程圖，左側展示垂直堆疊的 Vocabulary Embedding、多層 GDN Layer 與 QSA Layer 及 MTP Modules，右側則以方框放大顯示包含 GR Read、GR Write、MoE、Qwen Sparse Attn 與 Gated DeltaNet 的 QSA Layer 與 GDN Layer 詳細內部結構，頂端標有 Qwen商標與 Hybrid Block 參數。

**效能與成本** Qwen 表示，Qwen3.8-Flash-Next 的 training cost 僅為 Qwen3.7-Plus 的 1/9，且整體表現超越 Qwen3.7-Plus，尤其在 coding 與 office tasks 有更明顯的提升。官方列出的評測結果包括 DeepSWE 1.1 得分 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、AndroidWorld 84.5，以及 MathVision（with CI）95.7。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/dfaa6753796c1d86.jpg)
> Qwen3.8-Flash-Next 在 DeepSWE 1.1 (58.7)、SWE-bench Pro (62.5)、CoWorkBench (73.9) 等多項 Coding 與 Agent 基準測試取得領先，但在 NL2Repo-Bench 與 HLE 等指標上分別落後 DeepSeek-V4-Flash-0731 與 Claude-Opus-4.6 (Max)。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d8fb2aaea24e959b.jpg)
> Qwen3.8-Flash-Next 在多數多模態 benchmark 領先；OSWorld 2.0 Binary 與 Qwen3.8-27B 並列 19.4，CharXiv Without CI 則以 84.6 落後 Qwen3.7-Plus 的 85.8。

模型原生支援 262K context，搭配 YaRN 可延伸至 1M。Qwen 貼文指出，在 1M-token context 下，QSA attention kernel 的 prefill 速度最多為 7.6 倍、decode 速度最多為 4.9 倍；在 prefix-cache hit rate 為 90% 時，Qwen3.8-Flash-Next 的 prefill throughput 為 Qwen3.7-Plus 的 8.6 倍。vLLM recipe 另引用 Qwen 的資料，稱在相同 1M-token 條件下可達到最高 10.2 倍 prefill 與 6.6 倍 decode 加速；兩組數字來自不同來源，不能直接視為同一項測試結果。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6ce91ab9444ab420.jpg)
> Qwen3.8-Flash-Next 在 1M context length 下的相對 Prefill Throughput 達到 8.6x，領先 Qwen3.8-27B (1.2x) 與基線 Qwen3.7-Plus (1.0x)。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/006280a828e359e1.jpg)
> Qwen3.8-Flash-Next-Base、Qwen3.8-27B-Base 與 Qwen3.7-Plus-Base 在多項基準測試展現各有高低的結果，其中 Qwen3.8-Flash-Next-Base 在 MMLU-Pro、SuperGPQA、BBH、GSM8K、EvalPlus、SWEBench-Pretrain、MGSM 與 MMMLU 取得最佳分數，而 Qwen3.7-Plus-Base 在 MMLU、MMLU-Redux、GPQA、MATH、MultiPL-E 與 INCLUDE 領先。

**外部評測** Arena.ai 表示，Qwen3.8-Flash-Next 在 Code Arena: WebDev 取得 1617 分，約排名第 8；在 open weights 模型中約排名第 3，並比 Qwen3.8-27B 高 22 分。不過這是早期 AutoEval 分數，由以 Arena 人類偏好資料訓練的 Reward Model 代替即時人類投票，後續排名仍可能隨 live votes 增加而變動，因此不宜當成最終排名。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/55fed109cac07d28.jpg)
> 來源：[@arena](https://x.com/arena/status/2092634186784059659)（回覆）｜Qwen3.8-Flash-Next 在 Code Arena: WebDev 取得 1617 分的 Arena Score，價格為每 1M tokens $0.39，並位於 Pareto Frontier 上。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/2da25a5ba2e88bd0.jpg)
> 來源：[@arena](https://x.com/arena/status/2092634189048971440)（回覆）｜Qwen3.8-Flash-Next 在 Code Arena WebDev Top 15 排行榜中取得 1,617 分的 Arena Score（AutoEval），排名約在第 8 名。

**部署與生態** Qwen 同步提供 Hugging Face 與 ModelScope 權重；Hugging Face 版本的模型檔案和設定檔相容於 Hugging Face Transformers、vLLM、SGLang 與 TokenSpeed。vLLM 宣布 day-0 支援，並已在 NVIDIA 與 AMD GPU 上驗證；目前建議使用容器映像 `vllm/vllm-openai:qwen38-flash-next`，而非 PyPI 安裝。N-gram Embedding 的 host-memory offload 需要至少 51 GB 加上 runtime headroom，且目前 offload 僅支援 NVIDIA 裝置；部署時可使用 `VLLM_PLE_CPU_OFFLOAD=1`，但這是來源所述的環境設定，實際使用仍需依硬體、版本與部署策略人工核對。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d4f99381b931e88d.jpg)
> 來源：[@vllm_project](https://x.com/vllm_project/status/2092600887873286157)（回覆）｜Qwen3.8-Flash-Next 模型資訊頁面，展示其架構預覽摘要、Hugging Face 連結及 vLLM 安裝指令與參數設定。

**限制與參考** vLLM recipe 將 262,144 tokens 列為原生上限，但單一 262K-token request 尚未完成測試；要使用 1M-token workload，必須明確啟用 static YaRN，並先評估較短 context 的品質。FP8 checkpoint 約需 172.78 GiB，BF16 約需 335.28 GiB；8 張 H200 應使用 TEP8，plain TP8 與該 checkpoint 不相容。初始實作也不支援 XPU、TPU 與 pipeline parallelism。相關資料可參考 [Qwen 官方說明](https://qwen.ai/blog?id=qwen3.8-flash-next)、[Technical Report](https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf)、[Hugging Face 權重](https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next) 與 [vLLM 部署 recipe](http://recipes.vllm.ai/Qwen/Qwen3.8-Flash-Next)。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/a24f98e48f52798f.png)
> 藍色幾何圖形標誌，採用三組對稱的弧形區塊交錯排列於透明背景上。

## 標籤

新產品, 開源專案, LLM, Alibaba, Qwen
