原生多模态 · 混合稀疏注意力架构
以光速思考
GLM-5.3-FlashX 每秒生成 200 个 token。
眼前这片光,由 26 万个粒子实时演算——去扰动它。
架构
320B 装进
18B 里
混合专家架构:288 个路由专家,每个 token 只唤醒 8 个。稀疏注意力与线性注意力交错排布,长上下文的算力与显存开销同步下降。
0B总参数量
0B每 token 激活
0层34 KDA + 11 DSA
34 × KDA 线性注意力
11 × DSA 稀疏注意力
对比 GLM-5.3:注意力计算量 −3.01×,KV 缓存 −4.44×
速度
0.0tokens / 秒
同一个大脑,
快了五倍
FlashX 与 Flash 共享同一个基座,智能完全一致。改变的是推理基础设施:十万张国产芯片上的定制推理栈,把生成速度推到 200 tokens/s。
Flash 基准按官方「5× 提升」口径折算为 40 tok/s;Artificial Analysis 第三方实测约 64 tok/s。
上下文
一百万 token,
看得见
右边这块 1024 × 1024 的方块,每一个像素就是 1 个 token——恰好 1,048,576 个,是 FlashX 的完整上下文窗口。常见的 128K 上下文,只占它的八分之一。
鼠标移上去,用放大镜逐个数。
131,072单次最大输出 tokens
$0.075每百万 token 缓存读取
30T多模态预训练语料
基准
更少的激活参数,
更高的分数
18B 的激活参数,打出接近旗舰的编码与智能体成绩;第三方实测把智能/成本曲线推到了新的位置。
数据来源:智谱 GLM-5.3-Flash 官方博客(2026-08)与开放平台文档;多数分数为厂商自报,独立验证仍在进行。Artificial Analysis 独立实测:智能指数 57,单任务成本 $0.045。
$0.37输入 / 百万 token
$1.25输出 / 百万 token
3×GLM Coding Plan 额度
MIT权重开源,可自部署
FlashX
原生多模态 · 1M 上下文 · 200 tokens/s · SGLang / vLLM / TokenSpeed 可部署
这一页由 GLM-5.3-FlashX 写成——三个文件,零依赖,手写 WebGL。
你刚刚看到的一切,都是它对「牛逼」二字的回答。
PS:按下 F,再看一次爆发