News

Z.ai 发布 GLM-5.3-Flash:3200亿参数多模态模型,面向 Coding 与 Agent 场景优化

Z.ai 正式发布 GLM-5.3-Flash,这是 GLM-5 系列首个原生多模态模型。该模型采用 320B 总参数、18B 激活参数的 MoE 架构,并结合稀疏注意力与线性注意力,在 Coding、Agent 和长上下文任务中展现出较强性能,同时以较低的 API 价格提供服务。

Z.ai 于 2026 年 8 月 26 日正式发布 GLM-5.3-Flash。这是 GLM-5 系列首个原生多模态模型,官方将其定位为面向 Coding、Agent 和长上下文任务的高效率模型。

GLM-5.3-Flash 采用混合专家(MoE)架构,总参数量达到 3200 亿,但每次推理仅激活约 180 亿参数。模型支持最长约 100 万 Token 的上下文,并采用稀疏注意力与线性注意力相结合的架构,以降低长上下文场景下的计算和服务成本。

从匿名模型 Ox Alpha 到正式发布

GLM-5.3-Flash 的发布还有一个特别之处。在正式公布模型身份之前,Z.ai 曾将该模型以 Ox Alpha 的名称匿名部署到 OpenCode 和 OpenRouter 等平台,用于收集真实用户反馈。

Z.ai 表示,Ox Alpha 在测试期间迅速成为平台上使用较多的模型之一。公司随后确认,Ox Alpha 实际上就是 GLM-5.3-Flash。根据 Z.ai 的披露,这一阶段的相关推理流量全部运行在中国 AI 芯片上。

这一测试方式让 GLM-5.3-Flash 在正式发布之前就获得了一定规模的开发者实际使用反馈。不过,由于匿名测试的具体用户构成、任务分布和测试环境并不完全公开,因此相关反馈更适合作为早期使用信号,而不是严格的标准化评测结果。

Coding 和 Agent 表现成为重点

从目前公布的测试数据来看,GLM-5.3-Flash 的优势主要集中在 Coding 和 Agent 任务。

Terminal-Bench 2.1 中,GLM-5.3-Flash 得分为 84.3,GLM-5.2 为 81.0;在 DeepSWE v1.1 中,新模型达到 63.4,明显高于 GLM-5.2 的 46.2。

在 Agent 相关测试中,GLM-5.3-Flash 在 Toolathlon Verified 中获得 78.4 分,在 AutomationBench v1.0.6 中获得 48.8 分,而 GLM-5.2 分别为 59.9 和 26.2。

与部分闭源模型相比,GLM-5.3-Flash 在一些测试中的表现也已经比较接近。例如,在 Terminal-Bench 2.1 中,Claude Opus 4.8 为 85.0,GLM-5.3-Flash 为 84.3;在 Toolathlon Verified 中,二者分别为 76.2 和 78.4。

不过,这些数字并不意味着 GLM-5.3-Flash 在所有任务上都与顶级闭源模型具有相同能力。不同模型的测试配置、推理强度和工具环境可能存在差异,因此 Benchmark 更适合用于观察模型的能力范围,而不是作为绝对排名依据。

多模态能力加入 GLM-5 系列

GLM-5.3-Flash 的另一个重要变化是原生多模态能力。

Z.ai 表示,该模型使用了约 30 万亿 Token 的多模态预训练数据,可以处理图像以及文本信息,并进一步用于视觉 Agent 场景。

目前公布的视觉测试结果显示,GLM-5.3-Flash 在部分任务上表现突出。例如,在 CharXiv Reasoning with Tools 中获得 89.4 分,在 Chartography with Tools 中获得 78.0 分。

但在其他视觉测试中,其表现并非全面领先。例如,在 BabyVision 和 MVBench 等测试中,部分竞争模型获得了更高分数。因此,目前更适合将 GLM-5.3-Flash 看作一个同时具备视觉能力的 Coding/Agent 模型,而不是专门针对视觉任务优化的模型。

320B 参数与 18B 激活参数

GLM-5.3-Flash 的架构设计也是此次发布的重点。

模型拥有 320B 总参数和 18B 激活参数,并使用混合稀疏注意力与线性注意力的设计。Z.ai 表示,与 GLM-5.3 相比,该架构可以将 Attention 相关计算量降低约 3 倍,同时将 KV Cache 降低约 4.4 倍。

在 100 万 Token 长上下文场景中,这种设计可以降低模型推理过程中的计算和内存压力。模型还引入了 IndexPool,用于压缩索引器中的 Key 向量,以进一步降低长上下文处理成本。

需要注意的是,18B 激活参数并不意味着 GLM-5.3-Flash 是一个 18B 参数模型。320B 是模型的总参数规模,而 18B 表示单次推理过程中实际参与计算的参数规模,两者代表不同概念。

价格明显低于旗舰模型

GLM-5.3-Flash 的 API 定价也是此次发布的重要看点。

Z.ai 官方标准价格为:

  • 输入:$0.15 / 100 万 Token
  • 缓存输入:$0.03 / 100 万 Token
  • 输出:$0.50 / 100 万 Token

目前 Z.ai 还提供限时 50% 折扣,折扣价格分别为 $0.075、$0.015 和 $0.25 / 100 万 Token,活动预计持续至 2026 年 9 月 9 日。

Z.ai 同时公布的 Artificial Analysis Intelligence Index v4.1.1 得分为 57。这一结果使 GLM-5.3-Flash 进入当前高性能模型的竞争范围,而较低的 Token 成本则成为其主要竞争优势之一。

开放权重与本地部署

除了提供 API 服务之外,Z.ai 还公开了 GLM-5.3-Flash 的模型权重,并采用 MIT License

目前官方列出的本地推理框架包括 SGLang、vLLM 和 TokenSpeed。模型也已经被部分 AI 开发工具和平台接入,包括 OpenCode、Claude Code、Cline 等 Coding 工作流。

不过,由于 GLM-5.3-Flash 的总参数规模达到 320B,即使其单次推理只激活约 18B 参数,本地运行仍然需要相当规模的计算和显存资源。因此,“开放权重”并不意味着普通消费级电脑可以直接轻松运行完整模型。

GLM-5.3-Flash 的定位

从目前公布的信息和测试结果来看,GLM-5.3-Flash 的主要竞争方向并不是单纯追求通用聊天能力,而是将重点放在 Coding、工具调用、长上下文和 Agent 工作流上。

早期开发者反馈也主要集中在这些场景。Kilo Code 在模型正式发布后表示,其内部已经进行了数天测试,并认为 GLM-5.3-Flash 适合用于日常 Coding、常规实现、重构和测试代码生成等工作。

对于开发者而言,这意味着 GLM-5.3-Flash 更值得在真实 Agent 工作流中进行测试,例如让模型阅读代码库、修改多个文件、执行测试并根据结果继续修复,而不仅仅是比较普通问答的输出质量。

总体来看,GLM-5.3-Flash 是 GLM-5 系列一次明显面向效率和 Agent 应用的产品扩展。它通过 MoE、混合注意力和长上下文优化,在保持较强 Coding 与 Agent 能力的同时降低推理成本,并首次将原生多模态能力引入 GLM-5 系列。

随着更多独立评测和实际开发项目数据出现,GLM-5.3-Flash 在不同任务上的实际表现还将更加清晰。现阶段,它最值得关注的特点可以概括为:较强的 Coding 与 Agent 能力、原生多模态、超长上下文,以及相对较低的推理成本。

#AI#LLM