2.8T 稀疏 MoE
896 个专家中每个 token 路由 16 个专家,另有 2 个共享专家。总容量很大,而稀疏路由限制了单 token 的实际激活量。
使用一个 TokenRa API Key 调用 Moonshot AI 的 Kimi K3,用于研究分析、长文档处理、知识库问答和 Agent 工作流。接入前请在控制台确认当前可用的模型版本、上下文表现与实际价格。
Kimi K3 是 Moonshot AI 于 2026 年 7 月 16 日发布的开放权重多模态推理模型。它采用稀疏 Mixture-of-Experts 架构,总参数量 2.8T,每个 token 激活约 104B 参数,上下文窗口为 1,048,576 token。
896 个专家中每个 token 路由 16 个专家,另有 2 个共享专家。总容量很大,而稀疏路由限制了单 token 的实际激活量。
在单次上下文中处理大型代码库、长文档、多轮历史和工具定义。
在同一个模型中读取文本、图片和视频,再结合视觉反馈、工具调用与推理继续推进 Agent 流程。
Kimi K3 适合对上下文处理能力要求较高的任务。评测时请使用与真实用户一致的文档体量、语种和检索噪声。
Kimi K3 结合了 Kimi Delta Attention、Attention Residuals、Stable LatentMoE,以及基于 MXFP4 权重和 MXFP8 激活的量化感知训练。以上为 Moonshot AI 官方的技术说明,描述的是架构与扩展效率,并不等于在所有任务上都能获得同等加速。
reasoning_effort 设置为 low、high 或 max。tool_choice 和 JSON Schema 结构化输出,便于 Agent 集成。从控制台获取已启用的模型 ID,使用兼容 OpenAI 的对话接口发起请求。文档组装、检索和引用校验应保留在你自己的应用层。
把指令与原文分开,保留来源标识,并在发送请求前剔除无关内容。
检查每条结论是否有给定上下文支撑,并明确定义证据缺失时应用如何处理。
裁剪过期对话轮次,谨慎做历史摘要,限制输出长度,并随文档和会话增长持续监控用量。
curl https://tokenra.io/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"kimi-k3","messages":[{"role":"user","content":"请基于给定资料做摘要,并标注每条结论的来源。"}]}'
Kimi K3 官方参考价格为:每 100 万缓存输入 token $0.30,每 100 万非缓存输入 token $3.00,每 100 万输出 token $15.00。TokenRa 是 API 网关,渠道配置按账户区分。本页出现某个模型系列,并不代表每个版本或每项能力都已对所有账户开放。
请在模型目录或控制台确认准确的模型标识、接口地址、支持的参数、计费单位和当前费率,并以这些实时数据为准。
可用性取决于你的账户已启用的渠道。请在实时模型目录和控制台确认当前的模型标识与访问权限。
创建 TokenRa API Key,确认已启用的模型标识,并按对应能力的文档格式发起请求。适用的文本模型使用兼容 OpenAI 的接口;多媒体模型可能采用异步任务方式。
官方参考价格为每 100 万缓存输入 token $0.30、非缓存输入 $3.00、输出 $15.00。实际费率会因模型版本和生效渠道而变化,测试前请在实时模型目录或控制台确认计费单位与当前费率。
Kimi K3 提供 1,048,576 token 的上下文窗口,可用于大型代码库、长文档和多轮对话历史。
可以。TokenRa 把凭据和账户级用量集中在一处。但不同模型的请求字段和实际表现仍有差异,切换生产流量前请先做回归评测。
「Kimi」「Moonshot AI」及相关名称可能为其各自权利人的商标。TokenRa 是独立的 API 网关,本页不是官方厂商页面,也不构成任何背书。
最后更新:2026 年 9 月