# Qwen3.8-Flash-Next 獲 NeMo AutoModel Day‑0 支援：180B Engram MoE 全參數微調 recipe 已公開

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Qwen (@Alibaba_Qwen) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-08-27

> 原始來源：https://x.com/alibaba_qwen/status/2092809475174666699

## 證據與延伸閱讀

- [Qwen3.8-Flash-Next 獲 NeMo AutoModel Day‑0 支援：180B Engram MoE 全參數微調 recipe 已公開](https://github.com/NVIDIA-NeMo/Automodel) — 官方 Repository · 最後核對：2026-08-27 · 支持主張：新增 Qwen3.8-Flash-Next 的 full-parameter fine-tuning model coverage，具體列出 180B hybrid-attention Engram MoE、FlexAttention sparse QSA、packed (THD) sequences、model-owned context parallelism，以及 HellaSwag EP64 recipe 和 model coverage page；root 還加入 fine-tuning/inference 的 Day 0 support 與 domain-specific use cases 說法。
- [NVIDIA NeMo AutoModel 對 Qwen3.8-Flash-Next 的支援 — @QwenDevs](https://x.com/QwenDevs/status/2092798419652022419) — 官方文件 · 最後核對：2026-08-27 · 支持主張：新增 Qwen3.8-Flash-Next 的 full-parameter fine-tuning model coverage，具體列出 180B hybrid-attention Engram MoE、FlexAttention sparse QSA、packed (THD) sequences、model-owned context parallelism，以及 HellaSwag EP64 recipe 和 model coverage page；root 還加入 fine-tuning/inference 的 Day 0 support 與 domain-specific use cases 說法。
- [Qwen3.8-Flash-Next model coverage](https://github.com/NVIDIA-NeMo/Automodel/blob/main/docs/model-coverage/llm/qwen/qwen3-8-flash-next.mdx) — 官方 Repository · 最後核對：2026-08-27 · 支持主張：NeMo AutoModel 已加入 Qwen3.8-Flash-Next 的 180B hybrid-attention Engram MoE 全參數微調支援，並提供 HellaSwag EP64 recipe。
- [Qwen3.8-Flash-Next HellaSwag EP64 recipe](https://github.com/NVIDIA-NeMo/Automodel/blob/main/examples/llm_finetune/qwen/qwen3_8_flash_next_180b_hellaswag_ep64.yaml) — 官方 Repository · 最後核對：2026-08-27 · 支持主張：NeMo AutoModel 已加入 Qwen3.8-Flash-Next 的 180B hybrid-attention Engram MoE 全參數微調支援，並提供 HellaSwag EP64 recipe。

## 中文摘要

Qwen3.8-Flash-Next 獲 NeMo AutoModel Day‑0 支援：180B Engram MoE 全參數微調 recipe 已公開

Qwen 與 Qwen Developers 公布 Qwen3.8-Flash-Next 的 Day‑0 微調與推論支援；其中可直接核對的實作更新，落在 NVIDIA NeMo AutoModel。NeMo 團隊已把這個模型加入官方 model coverage，並提供全參數微調 recipe，開發者不必先自行補一套模型接線與平行化範例。

NeMo AutoModel 把訓練目標描述為 180B 的 hybrid-attention Engram MoE。官方條目列出的關鍵組件包括 FlexAttention sparse QSA、packed（THD）sequences，以及由模型自行管理的 context parallelism；對應範例則是 HellaSwag EP64 recipe。這些名稱不是效能成績，而是目前官方支援到哪一層的具體線索：模型結構、序列打包與平行化設定都已進入可讀的程式碼與設定檔。

實際評估時，可以先做三件事：

- 從 [Qwen3.8-Flash-Next model coverage](https://github.com/NVIDIA-NeMo/Automodel/blob/main/docs/model-coverage/llm/qwen/qwen3-8-flash-next.mdx) 核對模型整合範圍。
- 讀 [HellaSwag EP64 recipe](https://github.com/NVIDIA-NeMo/Automodel/blob/main/examples/llm_finetune/qwen/qwen3_8_flash_next_180b_hellaswag_ep64.yaml)，確認自己的硬體拓樸、資料與訓練目標是否能沿用。
- 把 [Qwen Developers 的公告](https://x.com/QwenDevs/status/2092798419652022419) 與 [NeMo AutoModel repository](https://github.com/NVIDIA-NeMo/Automodel) 分開看：前者說明 Day‑0 微調／推論定位，後者提供這次可驗證的全參數微調實作。

目前來源沒有給出這份 recipe 的 benchmark、完整 GPU／記憶體需求、版本相容矩陣或預期訓練成本，也沒有證明任何環境都能直接執行。換句話說，這次更新縮短了 Qwen3.8-Flash-Next 進入 NeMo 訓練流程的前置工作，但「Day‑0 支援」不等於低成本、免調參或已完成特定推論部署。要採用前，仍應以 model coverage 與 recipe 的當前版本為準。

## 標籤

開源專案, Qwen, NVIDIA
