NezhaGateNezhaGate
对话

Qwen3.8 Flash

⧉
qwen3.8-flash
模型类型 Max0902Flash

Qwen3.8 Flash 是 Qwen3.8 家族的轻量快速版,单价低、吞吐高,适合批处理与高并发任务,实测短问题 2.5–6 秒返回。它始终先思考再作答(思考过程在 reasoning_content 返回),支持工具调用、JSON 输出、流式输出与图片输入(公网图片链接与 base64 都可以)。文本块上的 cache_control 会被接受,上游可能对重复的长前缀走缓存;是否命中由上游决定,计费以返回的 usage 为准(报告为缓存命中的部分按缓存价结算)。完全兼容 OpenAI 接口,把 model 改成 qwen3.8-flash 即可接入;按量计费、失败不计费。

文本对话轻量低成本图片理解OpenAI 兼容

在线测试

直接试一下 Qwen3.8 Flash 的效果(登录后可用)。

Input

高级设置
联网搜索
记忆 · 多轮上下文

对话

开始对话在下方输入消息开始

关于 Qwen3.8 Flash

Qwen3.8 Flash 是阿里云通义千问 Qwen3.8 家族的轻量快速版,在 NezhaGate 以 OpenAI 兼容接口提供。单价低、吞吐高,适合批处理与高并发任务,实测短问题 2.5–6 秒返回。模型始终先思考再作答,思考过程在 message.reasoning_content 返回。支持工具调用、JSON 输出、流式输出与图片输入(公网链接与 base64 都可以);也接受 cache_control,上游可能对重复的长前缀走缓存,是否命中由上游决定,计费以返回的 usage 为准(报告为缓存命中的部分按缓存价结算)。把 model 改成 qwen3.8-flash 即可接入,按量计费、失败不计费。

应用场景

批量文本处理

分类、抽取、摘要、改写等大批量任务,单价低,适合高并发跑批。

图片识别与 OCR

读取截图、票据、商品图中的文字与内容,公网图片链接和 base64 都能直接传。

日常对话与客服

知识问答、写作助手等高频场景,响应快、成本低。

Agent 与工具调用

支持 OpenAI 格式的 tools / tool_calls 与 JSON 输出,适合做轻量 Agent 的执行步骤。

如何选择

任务简单、量大、看重成本和速度时选 Qwen3.8 Flash;需要更强的推理、代码与 Agent 能力时换 Qwen3.8 Max,要固定版本选 0902 快照。三者同属 Qwen3.8 家族,切换只改 model 字段。

常见问题

怎么开启提示缓存?
cache_control 会被接受:在 messages 的文本块上加 "cache_control": {"type": "ephemeral"}(content 写成 [{"type": "text", "text": "...", "cache_control": {"type": "ephemeral"}}])。上游可能对重复的长前缀走缓存,但是否命中由上游决定,不保证命中。计费以返回的 usage 为准:usage.prompt_tokens_details.cached_tokens 里报告为缓存命中的部分按缓存价结算,其余按输入价。
能关闭思考吗?
不能。Qwen3.8 Flash 始终先思考再作答,enable_thinking、reasoning_effort、thinking_budget 不会关闭思考;思考 token 按输出价计入 usage.completion_tokens。想要更短的回答,可以在提示词里要求简洁。
图片怎么传?
在 messages 的 content 里用 image_url 传入,公网图片链接和 base64 data URI 都可以。实测能准确读出图中文字、识别图中物体。
和 Qwen3.8 Max 有什么区别?
Flash 更轻、更快、更便宜,适合大批量和较简单的任务;Max 是 3.8 代旗舰,复杂推理、代码与 Agent 能力更强。两者接入方式相同,只改 model 字段。
失败的调用会扣费吗?
不会。只有正常返回的调用才按实际用量结算,上游报错与超时不会动你的余额。

相关模型

探索其它可接入的模型。

查看全部 →