更高吞吐
输出速度最高 200 tokens/s,适合对延迟敏感的场景:实时对话、智能体循环、IDE 助手和高并发生产环境。
由 Z.ai(智谱)于 2026 年 9 月 18 日正式发布。GLM-5.3-FlashX 输出速度最高 200 tokens/s,智能水平与 GLM-5.3-Flash 保持一致,依托 10 万张国产芯片和优化后的推理基础设施。通过 TokenRa 按量计费。
GLM-5.3-FlashX 是 GLM-5.3-Flash 的高速版本,由 Z.ai(智谱)于 2026 年 9 月 18 日正式发布。GLM-5.3-Flash 此前以代号 Ox Alpha 进行预览,上线后在全球开发者中快速普及。面对激增的需求,Z.ai 进一步投入基础设施和推理优化,依托 10 万张国产芯片,推出了输出速度最高 200 tokens/s 的 FlashX。
输出速度最高 200 tokens/s,适合对延迟敏感的场景:实时对话、智能体循环、IDE 助手和高并发生产环境。
FlashX 完整保留 GLM-5.3-Flash 的推理、编程和多模态能力,不以质量换速度。
与 GLM-5.3-Flash 采用相同的按量计费:输入 $0.14/百万、输出 $0.52/百万,提速不加价。
FlashX 是速度更快的版本,两者架构和智能水平相同,按你的延迟要求选择即可。
| 维度 | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| 速度 | 标准 | 最高 200 tok/s |
| 智能水平 | 前沿水平 | 前沿水平(相同) |
| 架构 | 3200 亿总参数 / 180 亿激活 MoE | 3200 亿总参数 / 180 亿激活 MoE |
| 上下文 | 约 130 万 tokens | 约 130 万 tokens |
| 模态 | 文本 · 图像 · 视频 → 文本 | 文本 · 图像 · 视频 → 文本 |
| 价格(输入) | $0.14 / 100 万 tokens | $0.14 / 100 万 tokens |
| 价格(输出) | $0.52 / 100 万 tokens | $0.52 / 100 万 tokens |
| 基础设施 | 标准推理 | 10 万张国产芯片 + 优化推理 |
GLM-5.3-FlashX 不替代 GLM-5.3-Flash。对速度要求不高的场景,可以继续使用 GLM-5.3-Flash。两个版本的实时价格和速率限制请在 TokenRa 控制台核对。
FlashX 针对吞吐和延迟关键的场景做了优化,同时不牺牲智能水平。
注册 TokenRa 账户,打开控制台创建 API 密钥,确认 GLM-5.3-FlashX 已为你的账户启用,然后从服务端发送兼容 OpenAI 的请求。密钥请保存在服务端,并在投入生产前核对实际的模型标识。
注册后打开 TokenRa 控制台。
在密钥页面创建一个密钥,并保存在服务端。
确认已启用的模型 ID glm-5.3-flashx,用代表性负载测试,再加上生产控制。
curl https://tokenra.io/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"glm-5.3-flashx","messages":[{"role":"user","content":"写一个 Python 列表排序函数"}]}'GLM-5.3-FlashX 的价格与 GLM-5.3-Flash 一致:通过 TokenRa 使用时,输入每 100 万 tokens 0.14 美元,输出每 100 万 tokens 0.52 美元,缓存读取每 100 万 tokens 0.04 美元。开始使用无需绑定信用卡。投入生产前请在 TokenRa 控制台核对实时价格。
GLM-5.3-FlashX 的标准输入价格。
GLM-5.3-FlashX 的生成输出价格。
当前的 RPM 和额度限制请查看 TokenRa 控制台。
GLM-5.3-FlashX 由 Z.ai(智谱)开发和运营,此前以代号 Ox Alpha 进行预览。TokenRa 以路由网关的形式提供 API 访问,不是该模型的开发者或所有者。
提示词和生成内容由提供方保留,不用于训练。在发送敏感或受监管的信息之前,请查阅提供方和 TokenRa 的相关条款。
GLM-5.3-FlashX 是 GLM-5.3-Flash 的高速版本,由 Z.ai(智谱)于 2026 年 9 月 18 日正式发布,输出速度最高 200 tokens/s,智能水平保持不变。
FlashX 输出速度最高可达 200 tokens/s,适合实时和高并发场景。GLM-5.3-Flash 为标准速度,智能水平相同。
不更贵。价格与 GLM-5.3-Flash 一致:输入 $0.14/百万 tokens,输出 $0.52/百万 tokens。实时价格请查看控制台。
注册 TokenRa 账户,创建 API 密钥,在请求中使用模型标识 glm-5.3-flashx。
是的,支持文本、图像和视频输入(输出为文本),以实际启用的集成为准。
由 Z.ai(智谱)开发。TokenRa 是 API 路由网关,不是该模型的开发方。
GLM-5.3-FlashX 由 Z.ai(智谱)开发。提供方及相关名称属于其各自权利人。TokenRa 以路由网关的形式提供 API 访问,不是该模型的开发者或所有者。