2026 年 8 月 26 日,智谱正式发布并开源 GLM-5.3-Flash(320B-A18B)。这是 GLM-5 系列首个原生多模态模型,总参数量为 3200 亿,但每次推理仅激活 180 亿参数。
智谱将其定位为兼顾前沿智能水平与低推理成本的 Flash 型模型,并在官方博客中以“Frontier Intelligence, Flash Cost”概括这一产品方向。
从性能来看,GLM-5.3-Flash 已进入当前全球前沿模型区间。
智谱披露,该模型在 Artificial Analysis Intelligence Index 中获得 57 分,与 Anthropic Claude Opus 4.8 持平;在智谱自研的 Z.ai Code Bench 体感评估中,GLM-5.3-Flash 的编程表现同样达到与 Claude Opus 4.8 相当的水平。与此同时,其整体能力已经超过参数规模更大的 GLM-5.2。
GLM-5.3-Flash 最值得关注的变化,是智谱没有继续单纯扩大模型参数,而是明显压低了实际推理时的激活规模。
GLM-5.3-Flash 采用 MoE 架构,总参数为 320B,每次仅激活 18B。相比之下,GLM-4.5 总参数约 355B、激活参数约 32B。也就是说,新模型在总参数规模基本接近的情况下,将单次推理需要调用的参数量进一步压低,从而为降低推理成本和提高生成速度留下了更大空间。
架构层面,GLM-5.3-Flash 还引入了稀疏注意力与线性注意力混合架构,并采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)。模型层数由此前 GLM-4.5 的 92 层缩减至 45 层,同时使用约 30T Token 的最新多模态预训练数据。
这也是 GLM-5 系列首次真正转向原生多模态。
与 8 月中旬发布、主要聚焦代码和 Agent 能力的 GLM-5.3 不同,GLM-5.3-Flash 从训练阶段便面向多模态输入设计,可以统一处理文本、图像等信息。此前在 OpenRouter 上匿名出现的 Ox Alpha 已展示出文本、图片和视频输入能力,并拥有 1048576 Token、即约 100 万 Token 的上下文窗口。
而 GLM-5.3-Flash 正是此前引发开发者大量猜测的 Ox Alpha。
Ox Alpha 于 8 月 20 日以匿名模型身份出现在 OpenRouter,没有公布开发者和真实型号,并在测试期间免费开放。由于其编程、Agent 和长上下文表现突出,开发者社区一度围绕其真实身份展开大量讨论。
在正式发布前,开发者已经从 tokenizer、推理参数以及 API 错误行为等技术特征中发现,Ox Alpha 与 GLM-5 系列高度相似。
价格则是 GLM-5.3-Flash 另一个重点。
智谱披露,GLM-5.3-Flash 的定价仅为 GLM-5.3 的 1/10。在限时折扣期间,价格进一步降至 GLM-5.3 的 1/20,约为 Claude Opus 4.8 的 1/40。
作为对比,GLM-5.3 当前 API 定价约为每百万 Token 输入 1.4 美元、输出 4.4 美元。
这也使 GLM-5.3-Flash 的产品定位与 GLM-5.3 出现明显分工。
GLM-5.3 更接近智谱面向复杂编程、长程 Agent 和高难度推理任务的旗舰模型;GLM-5.3-Flash 则通过 320B-A18B 架构,将前沿模型能力压缩到更低的实际激活规模,并进一步将调用成本压低一个数量级。
两款模型发布时间只相隔不到两周。
8 月 14 日,智谱刚发布 GLM-5.3,并称其内部 Code Bench 编程能力较 GLM-5.2 提升约 50%。如今 GLM-5.3-Flash 在更小激活参数规模下,性能已经超过 GLM-5.2,并在部分综合和编程评估中进入 Claude Opus 4.8 所在的能力区间。
更值得注意的是,此次智谱并没有先发布 API、再等待数周开放模型,而是直接宣布 GLM-5.3-Flash 开源。
从 GLM-5.3 到 GLM-5.3-Flash,智谱最新一轮模型迭代的方向已经十分清晰,旗舰模型继续追求能力上限,而 Flash 型号开始集中解决推理成本、激活参数量和部署效率。
在大模型性能差距不断缩小之后,竞争重点正在进一步向“同等能力需要多少钱、多少算力”转移。GLM-5.3-Flash 以 18B 激活参数进入前沿模型能力区间,同时将价格压至 GLM-5.3 的 1/10,也让这一轮竞争进一步从参数规模转向推理效率。
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。