NezhaGateNezhaGate
对话

Kimi K3

⧉
kimi-k3

Kimi K3 是 Moonshot(月之暗面)新一代旗舰模型,擅长长文本理解、多文档分析与中文写作,Agent 与工具调用能力出色。它始终先思考再作答,思考过程在 reasoning_content 返回;采样温度由模型固定,传入的 temperature / top_p 会被忽略。支持工具调用、流式输出与提示缓存(重复的长前缀按缓存价结算)。完全兼容 OpenAI 接口,把 model 改成 kimi-k3 即可接入;按量计费、失败不计费。

文本对话长文本Agent工具调用OpenAI 兼容

为什么选它

月之暗面新一代旗舰:2.8 万亿参数开放权重,约 100 万 token 上下文

能力亮点

  • 2.8 万亿参数、开放权重,是目前最大的开放权重模型之一
  • 约 100 万 token 上下文(1,048,576),长资料可以整份放进去
  • 默认开启思考,思考过程在 reasoning_content 里单独返回,不混进正文
  • 支持工具调用、流式输出和提示缓存,重复的长前缀按缓存价计费
  • OpenAI 兼容接口,现有 SDK 只改 base_url 和 model

价格对比

NezhaGate官方价 输入$1.8$3 输出$9$15

每百万 token,美元 · 立省 ↓40%

复制即可调用

curl
curl https://nezhagate.com/v1/chat/completions -H "Authorization: Bearer YOUR_API_KEY" -H "Content-Type: application/json" -d '{"model": "kimi-k3", "messages": [{"role": "user", "content": "Hello"}]}'
Python
from openai import OpenAI

client = OpenAI(api_key="YOUR_API_KEY", base_url="https://nezhagate.com/v1")
r = client.chat.completions.create(model="kimi-k3", messages=[{"role": "user", "content": "Hello"}])
print(r.choices[0].message.content)

把 YOUR_API_KEY 换成控制台里创建的 Key。

在线测试

直接试一下 Kimi K3 的效果(登录后可用)。

Input

高级设置
联网搜索
记忆 · 多轮上下文

对话

开始对话在下方输入消息开始

关于 Kimi K3

Kimi K3 是 Moonshot(月之暗面)的新一代旗舰模型,在 NezhaGate 以 OpenAI 兼容接口提供。它擅长长文本理解、多文档分析与中文写作,Agent 与工具调用能力出色。模型始终先思考再作答:思考过程在 message.reasoning_content 返回,正文在 content。采样温度由模型固定,请求里的 temperature / top_p 会被网关忽略,不会报错。支持工具调用、流式输出与提示缓存,把 model 改成 kimi-k3 即可接入;按量计费、失败不计费。

应用场景

长文档与多文档分析

合同、论文、财报等长材料的摘要、比对与问答,实测在 10 万+ token 的文档里也能精准定位信息。

Agent 与工具调用

支持 OpenAI 格式的 tools / tool_calls,适合检索增强、函数调用与多步任务编排。

中文写作

长文、报告、营销文案与润色,中文表达自然流畅。

复杂推理

先思考再作答,适合数学、逻辑与需要多步推导的问题,思考过程可在 reasoning_content 查看。

如何选择

长文本、多文档与 Agent 任务优先选 Kimi K3;追求更低成本的日常对话可以选 DeepSeek V4.1 Flash 或 GLM-5.3,切换只需改 model 字段。

常见问题

temperature 参数有用吗?
Kimi K3 的采样温度由模型固定,请求里的 temperature 和 top_p 会被网关忽略(不会报错),输出风格由模型自身决定。
能关闭思考吗?
不能。Kimi K3 始终先思考再作答,思考 token 按输出价计入 usage.completion_tokens。想要更短的回答,可以在提示词里要求简洁。
长回答需要注意什么?
生成很长的内容(耗时超过约 2 分钟)时,请用 stream=true 流式接收,非流式请求可能因超时中断。max_tokens 小于 256 时,网关会自动提高到 256,避免思考把预算耗尽。
支持提示缓存吗?
支持。重复使用的长前缀(例如同一份长文档)会命中缓存,命中部分按缓存价结算,比输入价低得多。
失败的调用会扣费吗?
不会。只有正常返回的调用才按实际用量结算,上游报错与超时不会动你的余额。

相关模型

探索其它可接入的模型。

查看全部 →