GLM-5.3-FlashX

原生多模态 · 混合稀疏注意力架构

以光速思考

GLM-5.3-FlashX 每秒生成 200 个 token。
眼前这片光,由 26 万个粒子实时演算——去扰动它。

架构

320B 装进
18B 里

混合专家架构:288 个路由专家,每个 token 只唤醒 8 个。稀疏注意力与线性注意力交错排布,长上下文的算力与显存开销同步下降。

0B总参数量
0B每 token 激活
0层34 KDA + 11 DSA
每一次前向传播:路由器点亮 8 / 288 个专家
34 × KDA 线性注意力 11 × DSA 稀疏注意力 对比 GLM-5.3:注意力计算量 −3.01×,KV 缓存 −4.44×
速度
0.0tokens / 秒

同一个大脑,
快了五倍

FlashX 与 Flash 共享同一个基座,智能完全一致。改变的是推理基础设施:十万张国产芯片上的定制推理栈,把生成速度推到 200 tokens/s。

Flash 基准按官方「5× 提升」口径折算为 40 tok/s;Artificial Analysis 第三方实测约 64 tok/s。

LIVE · 本次已生成 0 tokens
上下文

一百万 token,
看得见

右边这块 1024 × 1024 的方块,每一个像素就是 1 个 token——恰好 1,048,576 个,是 FlashX 的完整上下文窗口。常见的 128K 上下文,只占它的八分之一。

鼠标移上去,用放大镜逐个数。

131,072单次最大输出 tokens
$0.075每百万 token 缓存读取
30T多模态预训练语料
基准

更少的激活参数,
更高的分数

18B 的激活参数,打出接近旗舰的编码与智能体成绩;第三方实测把智能/成本曲线推到了新的位置。

跨代提升 · 得分(越高越好)
Terminal-Bench 2.1 · 通过率 %

数据来源:智谱 GLM-5.3-Flash 官方博客(2026-08)与开放平台文档;多数分数为厂商自报,独立验证仍在进行。Artificial Analysis 独立实测:智能指数 57,单任务成本 $0.045。

$0.37输入 / 百万 token
$1.25输出 / 百万 token
3×GLM Coding Plan 额度
MIT权重开源,可自部署

FlashX

原生多模态 · 1M 上下文 · 200 tokens/s · SGLang / vLLM / TokenSpeed 可部署

这一页由 GLM-5.3-FlashX 写成——三个文件,零依赖,手写 WebGL。
你刚刚看到的一切,都是它对「牛逼」二字的回答。

PS:按下 F,再看一次爆发