News

Qwen3.8-Flash-Next 上线:Qwen4 架构预览版,主打训练与推理效率

阿里巴巴通义千问团队于 2026 年 8 月 26 日发布 **Qwen3.8-Flash-Next**,作为 Qwen4 架构的早期开源预览版。该模型采用多模态 MoE 架构,主模型参数量 125B,额外配备 51B N-gram Embedding,每次推理仅激活 6B 参数。模型原生支持 262K 上下文,可扩展至 100 万 Token,在 Coding 和 Agent 任务上表现出较强性能,同时训练成本仅为 Qwen3.7-Plus 的约九分之一。

阿里巴巴通义千问团队于 2026 年 8 月 26 日正式发布 Qwen3.8-Flash-Next。该模型是 Qwen4 架构的早期预览版本,旨在让开源社区提前了解下一代架构的关键设计方向。

Qwen3.8-Flash-Next 采用多模态 MoE(混合专家)架构,主模型参数量为 1250 亿,额外配备 510 亿 N-gram Embedding 参数,每次推理仅激活 60 亿参数。模型原生支持 262,144 Token 上下文,可通过 YaRN 扩展至 100 万 Token。

架构:四大方向系统升级

据官方介绍,模型围绕四个方向进行了系统升级,这些创新将构成 Qwen4 系列的基础:

  • Attention:采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN 负责高效压缩历史信息,QSA 通过轻量级 Indexer 在 micro-block 粒度上筛选重要上下文。在 100 万 Token 场景下,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍4.9 倍的加速。
  • Residual:引入 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,可降低访存开销。
  • Embedding:引入 510 亿参数的 N-gram Embedding,利用局部上下文查表扩展模型容量。这些参数可卸载至 Host Memory,通过异步 Prefetch 与模型计算重叠,不长期占用 GPU 显存。
  • Optimization:采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化,针对新架构重新拟合了 Scaling Law。

Coding 与 Agent 表现

根据官方公布的基准测试结果(均为 Qwen 团队自报数据),该模型在软件工程和 Agent 任务上表现突出:

基准测试Qwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek-V4-Flash-0731Claude Opus 4.6 Max
DeepSWE 1.158.742.216.554.4--
SWE-bench Pro62.561.755.856.053.4
LiveCodeBench v691.990.389.690.688.8
GPQA Diamond91.789.290.390.891.3
CoWorkBench73.970.765.145.168.2

来源:Qwen 团队自报基准测试,发布于 2026 年 8 月 26 日

DeepSWE 1.1 中,新模型得分为 58.7%,在 SWE-bench Pro 中得分为 62.5%,分别比 DeepSeek-V4-Flash-0731 高出 4.3 和 6.5 个百分点。在 LiveCodeBench v6 中,模型达到 91.9%

上述数据均为官方自报,应作为早期性能信号而非独立验证结果看待。不同模型的测试配置、推理设置和评估环境可能存在差异。

多模态能力

Qwen3.8-Flash-Next 是一个多模态模型,支持文本、图像和视频输入,输出文本内容。在多模态相关测试中表现如下:

  • AndroidWorld:84.5%
  • MathVision(含 CI):95.7%
  • RealWorldQA:88.5%

模型的多模态能力还涵盖截图理解、手机和电脑操作、多模态工具调用等 Agent 场景。

效率与成本

效率是 Qwen3.8-Flash-Next 的核心设计目标。官方表示,其训练成本仅为 Qwen3.7-Plus 的约九分之一,推理成本同步下降。

生产版本 Qwen3.8-Flash 将在千问 AI 平台提供 API 服务,定价为:

  • 输入:1 元人民币 / 100 万 Token(约 $0.16)
  • 输出:3 元人民币 / 100 万 Token(约 $0.47)

该价格比 DeepSeek-V4-Flash 的非高峰时段定价低约 33%

开源与生态支持

模型权重已在 Hugging FaceModelScope 同步开源,采用 Qwen Community 1.0 许可证。官方同步发布了 FP8 量化版本以降低显存需求。

目前支持的本地推理框架包括 vLLM(0.28.0+ 版本)和 SGLang。vLLM 推荐的部署配置为:

  • GB300:最低 TP2,推荐 TP4 满配
  • 8x H200:使用 TEP8 配合 Triton MoE 后端

N-gram Embedding 表可卸载至主机内存,约需 51GB 主机内存及额外运行空间。

Qwen3.8-Flash-Next 的定位

Qwen3.8-Flash-Next 被定位为 Qwen4 架构的技术预览版,其核心目标是让社区提前了解下一代架构的设计方向,而非作为通用聊天模型推向市场。

对于开发者而言,该模型更适用于在 Coding Agent、软件工程和长上下文处理等场景中进行测试验证。

总体来看,Qwen3.8-Flash-Next 是通义千问在高效模型设计方向的一次重要探索。它通过稀疏激活、混合注意力和 N-gram 记忆等创新,在保持较强 Coding 与 Agent 能力的同时显著降低了训练和推理成本。随着更多独立评测和实际应用反馈的出现,该模型在不同任务上的实际表现将更加清晰。

#AI#LLM