NezhaGateNezhaGate
对话

GLM-5.3 Flash

⧉
glm-5.3-flash
模型类型 GLM-5.3Flash

GLM-5.3 Flash 是 GLM-5.3 家族的轻量版,单价更低,适合大批量、较简单的对话与文本处理任务。与 GLM-5.3 一样始终先思考再作答(思考过程在 reasoning_content 返回),支持工具调用与流式输出。完全兼容 OpenAI 接口,把 model 改成 glm-5.3-flash 即可接入。按量计费、失败不计费。

文本对话轻量低成本工具调用OpenAI 兼容

在线测试

直接试一下 GLM-5.3 Flash 的效果(登录后可用)。

Input

高级设置
联网搜索
记忆 · 多轮上下文

对话

开始对话在下方输入消息开始

关于 GLM-5.3 Flash

GLM-5.3 Flash 是智谱(Z.ai)GLM-5.3 家族的轻量版,在 NezhaGate 以 OpenAI 兼容接口提供。它单价更低,适合大批量、较简单的对话与文本处理;与 GLM-5.3 一样始终先思考再作答,思考过程在 message.reasoning_content 返回,正文在 content。支持工具调用与流式输出。把 model 改成 glm-5.3-flash 即可接入,按量计费、失败不计费。

应用场景

大批量文本处理

分类、打标签、信息抽取与格式整理,单价低,适合规模化跑批。

摘要与改写

长文摘要、润色、改写与翻译,成本可控。

轻量客服与问答

常见问题回复、意图识别等高频、简单的对话场景。

Agent 里的简单步骤

在 Agent 流程中承担判断、路由、格式转换等简单步骤,把 GLM-5.3 留给难题。

如何选择

任务简单、量大、看重成本时选 GLM-5.3 Flash;需要更强的编码、Agent 与推理能力时换 GLM-5.3。两者同属 GLM-5.3 家族,切换只改 model 字段。

常见问题

和 GLM-5.3 有什么区别?
Flash 是轻量版,单价更低,适合大批量、较简单的任务;GLM-5.3 是旗舰版,编码、Agent 与复杂推理更强。两者接入方式完全相同。
能关闭思考吗?
不能。GLM-5.3 Flash 始终先思考再作答,思考 token 按输出价计入 usage.completion_tokens。想要更短的回答,可以在提示词里要求简洁。
max_tokens 设得很小会怎样?
思考 token 也计入输出。上游对小于 1024 的 max_tokens 会按 1024 执行;若预算被思考用完,content 可能为空、finish_reason 为 length,按 usage 里的实际 token 计费。建议 max_tokens 至少留 1024 以上。
支持工具调用和流式输出吗?
都支持。tools / tool_calls 使用 OpenAI 格式;stream=true 时以 SSE 分块返回,思考内容在 delta.reasoning_content。
失败的调用会扣费吗?
不会。只有正常返回的调用才按实际用量结算,上游报错与超时不会动你的余额。

相关模型

探索其它可接入的模型。

查看全部 →