NezhaGateNezhaGate
对话

GLM-5.3

⧉
glm-5.3
模型类型 GLM-5.3Flash

GLM-5.3 是智谱(Z.ai)GLM-5 系列的新一代旗舰模型,面向编码、Agent 工作流与复杂推理,中英文写作表现稳定。它始终先思考再作答,思考过程在 reasoning_content 返回;支持工具调用与流式输出。完全兼容 OpenAI 接口,把 model 改成 glm-5.3 即可接入。按量计费、失败不计费,命中缓存的输入按缓存价结算。

文本对话编码Agent思考模式OpenAI 兼容

在线测试

直接试一下 GLM-5.3 的效果(登录后可用)。

Input

高级设置
联网搜索
记忆 · 多轮上下文

对话

开始对话在下方输入消息开始

关于 GLM-5.3

GLM-5.3 是智谱(Z.ai)GLM-5 系列的新一代旗舰模型,面向编码、Agent 工作流与复杂推理,在 NezhaGate 以 OpenAI 兼容接口提供。它始终先思考再作答:思考过程在 message.reasoning_content 返回,正文在 content,只读 content 的客户端无需改动。支持工具调用(function calling)与流式输出,命中缓存的输入按缓存价结算。把 model 改成 glm-5.3 即可接入,按量计费、失败不计费。

应用场景

编码助手

代码生成、重构、解释与审查,思考后再作答,适合需要多步推导的编程任务。

Agent 工作流

支持 OpenAI 格式的工具调用,可接入各类 Agent 框架完成检索、调用与多步规划。

中英文写作

文案、报告、邮件与翻译,中文表达自然,适合面向国内外用户的内容生产。

复杂问答与分析

需要推理链条的分析、比较与决策类问题,思考过程可在 reasoning_content 查看。

如何选择

需要更强的编码、Agent 与推理能力选 GLM-5.3;任务简单、量大、看重成本时选 GLM-5.3 Flash。两者同属 GLM-5.3 家族,切换只改 model 字段。

常见问题

能关闭思考吗?
不能。GLM-5.3 始终先思考再作答,思考 token 按输出价计入 usage.completion_tokens。想要更短更省的回答,可以在提示词里要求简洁,或改用 GLM-5.3 Flash。
和 GLM-5.3 Flash 有什么区别?
GLM-5.3 是旗舰版,编码、Agent 与复杂推理更强;Flash 更轻、单价更低,适合大批量、较简单的任务。两者接入方式完全相同。
max_tokens 设得很小会怎样?
思考 token 也计入输出。上游对小于 1024 的 max_tokens 会按 1024 执行;若预算被思考用完,content 可能为空、finish_reason 为 length,按 usage 里的实际 token 计费。建议 max_tokens 至少留 1024 以上。
支持工具调用和流式输出吗?
都支持。tools / tool_calls 使用 OpenAI 格式;stream=true 时以 SSE 分块返回,思考内容在 delta.reasoning_content。
失败的调用会扣费吗?
不会。只有正常返回的调用才按实际用量结算,上游报错与超时不会动你的余额。

相关模型

探索其它可接入的模型。

查看全部 →