NezhaGateNezhaGate
对话

DeepSeek V4.1 Flash

⧉
deepseek-v4.1-flash
模型类型 V4.10731

DeepSeek V4.1 Flash 是 DeepSeek 当前的 Flash 模型(官方 API 中的 deepseek-flash),默认开启思考,思考过程在 reasoning_content 返回;传 thinking={"type":"disabled"} 即可关闭思考、直接作答。支持工具调用与流式输出。完全兼容 OpenAI 接口,把 model 改成 deepseek-v4.1-flash 即可接入。全天统一价,不分高峰低谷;按量计费、失败不计费。

文本对话思考模式工具调用高性价比OpenAI 兼容

在线测试

直接试一下 DeepSeek V4.1 Flash 的效果(登录后可用)。

Input

高级设置
联网搜索
记忆 · 多轮上下文

对话

开始对话在下方输入消息开始

关于 DeepSeek V4.1 Flash

DeepSeek V4.1 Flash 是 DeepSeek 当前的 Flash 模型(官方 API 名 deepseek-flash),在 NezhaGate 以 OpenAI 兼容接口提供。它默认先思考再作答,思考过程在 message.reasoning_content 返回,正文始终在 content;传 thinking={"type":"disabled"} 可关闭思考,简单任务更快、更省。支持工具调用(function calling)与流式输出。把 model 改成 deepseek-v4.1-flash 即可接入;全天统一价,不分高峰低谷,按量计费、失败不计费。

应用场景

日常对话与问答

客服、知识问答、写作助手等高频场景,单价低、响应快,适合大规模接入。

代码与推理

开启思考后先推理再作答,适合代码生成、数学与多步逻辑题。

Agent 与工具调用

支持 OpenAI 格式的 tools / tool_calls,可直接接入 Agent 框架做检索、函数调用与多步任务。

批量文本处理

分类、抽取、摘要、改写等批量任务可关闭思考,直接出结果,成本更低。

如何选择

需要 DeepSeek 最新 Flash 能力时选 V4.1;已经按 V4 Flash 调好提示词、希望版本固定时选 0731 快照。更难的编码与 Agent 任务可以对比 GLM-5.3,两者都只需改 model 字段。

常见问题

和 DeepSeek V4 Flash 0731 有什么区别?
V4.1 是 DeepSeek 当前的 Flash 版本;0731 是固定下来的 V4 Flash 快照,行为不会随上游更新而变化。两者在 NezhaGate 同价,接入方式完全相同。
怎么关闭思考?
在请求里加 "thinking": {"type": "disabled"},模型会跳过思考直接作答,reasoning_content 为空、输出 token 更少。不传时默认开启思考。
max_tokens 设得很小会怎样?
这是思考模型,思考 token 也计入输出。上游对小于 1024 的 max_tokens 会按 1024 执行,实际输出(含思考)可能超过你设的值,按 usage 里的实际 token 计费。只要短答案时,建议关闭思考。
支持工具调用和流式输出吗?
都支持。tools / tool_calls 使用 OpenAI 格式;stream=true 时以 SSE 分块返回,思考内容在 delta.reasoning_content。
失败的调用会扣费吗?
不会。只有正常返回的调用才按实际用量结算,上游报错与超时不会动你的余额。

相关模型

探索其它可接入的模型。

查看全部 →