TokenRa模型广场
GLM-5.3-FlashX · 最高 200 tokens/s · 通过 TokenRa 按量计费

GLM-5.3-FlashX:最高 200 tok/s,智能水平不变

由 Z.ai(智谱)于 2026 年 9 月 18 日正式发布。GLM-5.3-FlashX 输出速度最高 200 tokens/s,智能水平与 GLM-5.3-Flash 保持一致,依托 10 万张国产芯片和优化后的推理基础设施。通过 TokenRa 按量计费。

最高 200 tok/sGLM-5.3 系列中最快。
$0.14 输入每 100 万输入 tokens。
$0.52 输出每 100 万输出 tokens。

同等智能水平下的 200 tok/s

GLM-5.3-FlashX 是 GLM-5.3-Flash 的高速版本,由 Z.ai(智谱)于 2026 年 9 月 18 日正式发布。GLM-5.3-Flash 此前以代号 Ox Alpha 进行预览,上线后在全球开发者中快速普及。面对激增的需求,Z.ai 进一步投入基础设施和推理优化,依托 10 万张国产芯片,推出了输出速度最高 200 tokens/s 的 FlashX。

01

更高吞吐

输出速度最高 200 tokens/s,适合对延迟敏感的场景:实时对话、智能体循环、IDE 助手和高并发生产环境。

02

智能水平不变

FlashX 完整保留 GLM-5.3-Flash 的推理、编程和多模态能力,不以质量换速度。

03

价格一致

与 GLM-5.3-Flash 采用相同的按量计费:输入 $0.14/百万、输出 $0.52/百万,提速不加价。

GLM-5.3-FlashX 与 GLM-5.3-Flash 对比

FlashX 是速度更快的版本,两者架构和智能水平相同,按你的延迟要求选择即可。

维度GLM-5.3-FlashGLM-5.3-FlashX
速度标准最高 200 tok/s
智能水平前沿水平前沿水平(相同)
架构3200 亿总参数 / 180 亿激活 MoE3200 亿总参数 / 180 亿激活 MoE
上下文约 130 万 tokens约 130 万 tokens
模态文本 · 图像 · 视频 → 文本文本 · 图像 · 视频 → 文本
价格(输入)$0.14 / 100 万 tokens$0.14 / 100 万 tokens
价格(输出)$0.52 / 100 万 tokens$0.52 / 100 万 tokens
基础设施标准推理10 万张国产芯片 + 优化推理

两个版本同时提供

GLM-5.3-FlashX 不替代 GLM-5.3-Flash。对速度要求不高的场景,可以继续使用 GLM-5.3-Flash。两个版本的实时价格和速率限制请在 TokenRa 控制台核对。

适用场景

FlashX 针对吞吐和延迟关键的场景做了优化,同时不牺牲智能水平。

  • 需要亚秒级响应的实时对话和会话式智能体。
  • 包含多次串行工具调用的智能体循环,累积延迟影响明显。
  • 需要即时反馈的 IDE 助手和行内代码补全。
  • 延迟预算严格的高并发生产服务。
  • 长上下文推理场景,端到端延迟主要由输出 token 生成速度决定。

如何接入 GLM-5.3-FlashX API

注册 TokenRa 账户,打开控制台创建 API 密钥,确认 GLM-5.3-FlashX 已为你的账户启用,然后从服务端发送兼容 OpenAI 的请求。密钥请保存在服务端,并在投入生产前核对实际的模型标识。

1

创建 TokenRa 账户

注册后打开 TokenRa 控制台。

2

创建 API 密钥

在密钥页面创建一个密钥,并保存在服务端。

3

发送测试请求

确认已启用的模型 ID glm-5.3-flashx,用代表性负载测试,再加上生产控制。

curl https://tokenra.io/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"glm-5.3-flashx","messages":[{"role":"user","content":"写一个 Python 列表排序函数"}]}'

GLM-5.3-FlashX 价格

GLM-5.3-FlashX 的价格与 GLM-5.3-Flash 一致:通过 TokenRa 使用时,输入每 100 万 tokens 0.14 美元,输出每 100 万 tokens 0.52 美元,缓存读取每 100 万 tokens 0.04 美元。开始使用无需绑定信用卡。投入生产前请在 TokenRa 控制台核对实时价格。

输入

$0.14 / 100 万 tokens

GLM-5.3-FlashX 的标准输入价格。

输出

$0.52 / 100 万 tokens

GLM-5.3-FlashX 的生成输出价格。

速率限制

按账户区分

当前的 RPM 和额度限制请查看 TokenRa 控制台。

Z.ai(智谱)

GLM-5.3-FlashX 由 Z.ai(智谱)开发和运营,此前以代号 Ox Alpha 进行预览。TokenRa 以路由网关的形式提供 API 访问,不是该模型的开发者或所有者。

数据处理

提示词和生成内容由提供方保留,不用于训练。在发送敏感或受监管的信息之前,请查阅提供方和 TokenRa 的相关条款。

生产接入清单

  • API 密钥保存在服务端,并按环境隔离凭据。
  • 在依赖之前,核对 200 tok/s 的吞吐和支持的输入模态是否与实际集成一致。
  • 用代表性的编程、智能体、推理和视觉上下文负载做测试。
  • 设置明确的超时、有限重试、请求追踪和应用层预算控制。
  • 结合自身场景审查数据处理方式、提供方条款、隐私要求和输出权利。

常见问题

GLM-5.3-FlashX 是什么?

GLM-5.3-FlashX 是 GLM-5.3-Flash 的高速版本,由 Z.ai(智谱)于 2026 年 9 月 18 日正式发布,输出速度最高 200 tokens/s,智能水平保持不变。

GLM-5.3-FlashX 比 GLM-5.3-Flash 快多少?

FlashX 输出速度最高可达 200 tokens/s,适合实时和高并发场景。GLM-5.3-Flash 为标准速度,智能水平相同。

GLM-5.3-FlashX 更贵吗?

不更贵。价格与 GLM-5.3-Flash 一致:输入 $0.14/百万 tokens,输出 $0.52/百万 tokens。实时价格请查看控制台。

如何获取 API 密钥?

注册 TokenRa 账户,创建 API 密钥,在请求中使用模型标识 glm-5.3-flashx

GLM-5.3-FlashX 支持相同的输入类型吗?

是的,支持文本、图像和视频输入(输出为文本),以实际启用的集成为准。

谁开发 GLM-5.3-FlashX?

由 Z.ai(智谱)开发。TokenRa 是 API 路由网关,不是该模型的开发方。

GLM-5.3-FlashX 由 Z.ai(智谱)开发。提供方及相关名称属于其各自权利人。TokenRa 以路由网关的形式提供 API 访问,不是该模型的开发者或所有者。