Qwen3.8 Flash
⧉Qwen3.8 Flash 是 Qwen3.8 家族的轻量快速版,单价低、吞吐高,适合批处理与高并发任务,实测短问题 2.5–6 秒返回。它始终先思考再作答(思考过程在 reasoning_content 返回),支持工具调用、JSON 输出、流式输出与图片输入(公网图片链接与 base64 都可以)。文本块上的 cache_control 会被接受,上游可能对重复的长前缀走缓存;是否命中由上游决定,计费以返回的 usage 为准(报告为缓存命中的部分按缓存价结算)。完全兼容 OpenAI 接口,把 model 改成 qwen3.8-flash 即可接入;按量计费、失败不计费。
在线测试
直接试一下 Qwen3.8 Flash 的效果(登录后可用)。
Input
高级设置
对话
关于 Qwen3.8 Flash
Qwen3.8 Flash 是阿里云通义千问 Qwen3.8 家族的轻量快速版,在 NezhaGate 以 OpenAI 兼容接口提供。单价低、吞吐高,适合批处理与高并发任务,实测短问题 2.5–6 秒返回。模型始终先思考再作答,思考过程在 message.reasoning_content 返回。支持工具调用、JSON 输出、流式输出与图片输入(公网链接与 base64 都可以);也接受 cache_control,上游可能对重复的长前缀走缓存,是否命中由上游决定,计费以返回的 usage 为准(报告为缓存命中的部分按缓存价结算)。把 model 改成 qwen3.8-flash 即可接入,按量计费、失败不计费。
应用场景
分类、抽取、摘要、改写等大批量任务,单价低,适合高并发跑批。
读取截图、票据、商品图中的文字与内容,公网图片链接和 base64 都能直接传。
知识问答、写作助手等高频场景,响应快、成本低。
支持 OpenAI 格式的 tools / tool_calls 与 JSON 输出,适合做轻量 Agent 的执行步骤。
如何选择
任务简单、量大、看重成本和速度时选 Qwen3.8 Flash;需要更强的推理、代码与 Agent 能力时换 Qwen3.8 Max,要固定版本选 0902 快照。三者同属 Qwen3.8 家族,切换只改 model 字段。
常见问题
怎么开启提示缓存?
能关闭思考吗?
图片怎么传?
和 Qwen3.8 Max 有什么区别?
失败的调用会扣费吗?
相关模型
探索其它可接入的模型。
Qwen3.8 Max
通义千问 3.8 代旗舰 · 推理、代码与 Agent
Qwen3.8 Max 0902
Qwen3.8 Max 固定快照 · 版本稳定
DeepSeek V4.1 Flash
DeepSeek 当前主力 Flash 模型 · 思考可开关
GLM-5.3 Flash
GLM-5.3 轻量版 · 大批量低成本
Gemini 3.6 Flash
新一代高速思考模型 · 四档思考预算