TokenRa模型目录
通过 TokenRa 接入长上下文大模型

Kimi K3 API:1M 上下文多模态 Agent 模型

使用一个 TokenRa API Key 调用 Moonshot AI 的 Kimi K3,用于研究分析、长文档处理、知识库问答和 Agent 工作流。接入前请在控制台确认当前可用的模型版本、上下文表现与实际价格。

Kimi K3 是什么

Kimi K3 是 Moonshot AI 于 2026 年 7 月 16 日发布的开放权重多模态推理模型。它采用稀疏 Mixture-of-Experts 架构,总参数量 2.8T,每个 token 激活约 104B 参数,上下文窗口为 1,048,576 token。

01

2.8T 稀疏 MoE

896 个专家中每个 token 路由 16 个专家,另有 2 个共享专家。总容量很大,而稀疏路由限制了单 token 的实际激活量。

02

1,048,576 token 上下文

在单次上下文中处理大型代码库、长文档、多轮历史和工具定义。

03

原生多模态 Agent

在同一个模型中读取文本、图片和视频,再结合视觉反馈、工具调用与推理继续推进 Agent 流程。

适用场景

Kimi K3 适合对上下文处理能力要求较高的任务。评测时请使用与真实用户一致的文档体量、语种和检索噪声。

  • 研究助理:对比多份给定资料,给出可追溯来源的结论。
  • 文档审阅流水线:抽取条款、实体、风险点或结构化记录。
  • 知识库问答:基于检索到的段落作答,并设置明确的引用约束。
  • 长周期 Agent 或客服会话:需要精细管理对话历史。

架构与 Agent 能力

Kimi K3 结合了 Kimi Delta Attention、Attention Residuals、Stable LatentMoE,以及基于 MXFP4 权重和 MXFP8 激活的量化感知训练。以上为 Moonshot AI 官方的技术说明,描述的是架构与扩展效率,并不等于在所有任务上都能获得同等加速。

  • 原生多模态:MoonViT-V2 视觉编码支持文本、图片和视频输入,适合需要视觉反馈的工作流。
  • 推理控制:思考始终开启,可通过 reasoning_effort 设置为 lowhighmax
  • 工具能力:支持 Function calling、tool_choice 和 JSON Schema 结构化输出,便于 Agent 集成。
  • 开放权重:Kimi K3 使用 Kimi K3 License,而非无限制的 Apache 或 MIT 许可。

接入方式与上下文控制策略

从控制台获取已启用的模型 ID,使用兼容 OpenAI 的对话接口发起请求。文档组装、检索和引用校验应保留在你自己的应用层。

1

整理并标注上下文

把指令与原文分开,保留来源标识,并在发送请求前剔除无关内容。

2

校验回答是否有依据

检查每条结论是否有给定上下文支撑,并明确定义证据缺失时应用如何处理。

3

控制上下文增长

裁剪过期对话轮次,谨慎做历史摘要,限制输出长度,并随文档和会话增长持续监控用量。

curl https://tokenra.io/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"kimi-k3","messages":[{"role":"user","content":"请基于给定资料做摘要,并标注每条结论的来源。"}]}'

可用性、模型 ID 与价格

Kimi K3 官方参考价格为:每 100 万缓存输入 token $0.30,每 100 万非缓存输入 token $3.00,每 100 万输出 token $15.00。TokenRa 是 API 网关,渠道配置按账户区分。本页出现某个模型系列,并不代表每个版本或每项能力都已对所有账户开放。

接入前请以控制台为准

请在模型目录或控制台确认准确的模型标识、接口地址、支持的参数、计费单位和当前费率,并以这些实时数据为准。

上线前检查清单

  • API Key 只保存在服务端,并按环境或业务线区分凭据。
  • 在接入真实流量前,设置明确的超时、有上限的重试和请求追踪。
  • 用有代表性的输入做评测,不要默认不同版本可以直接互换。
  • 在控制台监控用量和成本,并在应用侧增加预算与限额。
  • 结合自身场景确认服务条款、隐私要求和输出内容的权利归属。

Kimi K3 API 常见问题

TokenRa 上可以调用 Kimi K3 吗?

可用性取决于你的账户已启用的渠道。请在实时模型目录和控制台确认当前的模型标识与访问权限。

如何接入 Kimi K3 API?

创建 TokenRa API Key,确认已启用的模型标识,并按对应能力的文档格式发起请求。适用的文本模型使用兼容 OpenAI 的接口;多媒体模型可能采用异步任务方式。

Kimi K3 API 价格是多少?

官方参考价格为每 100 万缓存输入 token $0.30、非缓存输入 $3.00、输出 $15.00。实际费率会因模型版本和生效渠道而变化,测试前请在实时模型目录或控制台确认计费单位与当前费率。

Kimi K3 的上下文窗口有多大?

Kimi K3 提供 1,048,576 token 的上下文窗口,可用于大型代码库、长文档和多轮对话历史。

之后可以切换到其他模型吗?

可以。TokenRa 把凭据和账户级用量集中在一处。但不同模型的请求字段和实际表现仍有差异,切换生产流量前请先做回归评测。

「Kimi」「Moonshot AI」及相关名称可能为其各自权利人的商标。TokenRa 是独立的 API 网关,本页不是官方厂商页面,也不构成任何背书。

最后更新:2026 年 9 月