NezhaGateNezhaGate
Chat

Qwen3.8 Flash

⧉
qwen3.8-flash
Tipo de modelo Max0902Flash

Qwen3.8 Flash es la versión ligera y rápida de la familia Qwen3.8, con un precio unitario bajo y alto rendimiento para trabajos por lotes y alta concurrencia; en nuestras pruebas respondió a preguntas cortas en 2,5-6 segundos. Siempre piensa antes de responder (el razonamiento llega en reasoning_content) y admite llamadas a herramientas, salida JSON, streaming y entrada de imágenes (enlaces públicos o base64). También acepta cache_control en un bloque de texto, y el proveedor puede servir desde caché un prefijo largo repetido; si acierta o no lo decide el proveedor, y la facturación sigue el usage devuelto (lo que se reporte como acierto de caché se liquida a la tarifa de caché). Totalmente compatible con OpenAI: indica model=qwen3.8-flash. Pago por uso y sin cargo por las llamadas fallidas.

ChatLigeroBajo costeEntrada de imágenesCompatible con OpenAI

Prueba en directo

Prueba Qwen3.8 Flash aquí mismo (disponible tras iniciar sesión).

Entrada

Avanzado
Búsqueda web
Memoria · multiturno

Conversación

Empieza una conversaciónEscribe un mensaje abajo para empezar

Acerca de Qwen3.8 Flash

Qwen3.8 Flash es la versión ligera y rápida de la familia Qwen3.8 de Alibaba Cloud, servida en NezhaGate mediante la API compatible con OpenAI. Tiene un precio unitario bajo y alto rendimiento para trabajos por lotes y alta concurrencia; en nuestras pruebas respondió a preguntas cortas en 2,5-6 segundos. Siempre piensa antes de responder, con el razonamiento en message.reasoning_content. Admite llamadas a herramientas, salida JSON, streaming y entrada de imágenes (enlaces públicos o base64); también acepta cache_control, y el proveedor puede servir desde caché un prefijo largo repetido: si acierta o no lo decide el proveedor, y la facturación sigue el usage devuelto (lo que se reporte como acierto de caché se liquida a la tarifa de caché). Indica model=qwen3.8-flash; pago por uso y sin cargo por las llamadas fallidas.

Casos de uso

Procesamiento de texto por lotes

Clasificación, extracción, resumen y reescritura a gran volumen, con un precio unitario bajo que encaja en lotes de alta concurrencia.

Reconocimiento de imágenes y OCR

Lee el texto y el contenido de capturas de pantalla, recibos y fotos de producto; funcionan tanto los enlaces públicos como base64.

Chat diario y atención al cliente

Preguntas sobre una base de conocimiento y asistentes de redacción que necesitan respuestas rápidas y baratas.

Agentes y llamadas a herramientas

tools / tool_calls en formato OpenAI y salida JSON para los pasos de ejecución de un agente ligero.

Cómo elegir

Elige Qwen3.8 Flash cuando las tareas son sencillas, de gran volumen y sensibles al coste y la velocidad; pasa a Qwen3.8 Max para un razonamiento, una programación y un trabajo con agentes más potentes, o a la instantánea 0902 para una versión fija. Los tres pertenecen a la familia Qwen3.8, así que cambiar es solo modificar el campo model.

Preguntas frecuentes

¿Cómo activo la caché de prompts?
cache_control se acepta: añade "cache_control": {"type": "ephemeral"} a un bloque de texto de messages (escribe el content como [{"type": "text", "text": "...", "cache_control": {"type": "ephemeral"}}]). El proveedor puede servir desde caché un prefijo largo repetido, pero si acierta o no lo decide el proveedor y los aciertos no están garantizados. La facturación sigue el usage devuelto: la parte reportada en usage.prompt_tokens_details.cached_tokens se liquida a la tarifa de caché y el resto a la tarifa de entrada.
¿Puedo desactivar el razonamiento?
No. Qwen3.8 Flash siempre piensa antes de responder, y enable_thinking, reasoning_effort o thinking_budget no lo desactivan. Los tokens de razonamiento se facturan a la tarifa de salida dentro de usage.completion_tokens. Para respuestas más cortas, pide brevedad en el prompt.
¿Cómo envío una imagen?
Pon un image_url en el content del mensaje; sirven tanto los enlaces públicos a imágenes como los data URI en base64. En nuestras pruebas leyó con precisión el texto de la imagen y reconoció los objetos que aparecían.
¿En qué se diferencia de Qwen3.8 Max?
Flash es más ligero, rápido y barato, pensado para gran volumen y tareas más sencillas; Max es el buque insignia de la generación 3.8, más potente en razonamiento complejo, programación y agentes. Ambos se integran igual: solo cambia el campo model.
¿Se cobran las llamadas fallidas?
No. Solo se liquidan, según el uso real, las llamadas que responden con normalidad; los errores del proveedor y los tiempos de espera agotados nunca tocan tu saldo.

Modelos relacionados

Descubre otros modelos que puedes integrar.

Ver todo →