NezhaGateNezhaGate
Chat

DeepSeek V4.1 Flash

⧉
deepseek-v4.1-flash
Tipo de modelo V4.10731

DeepSeek V4.1 Flash es el modelo Flash actual de DeepSeek (deepseek-flash en la API oficial). El razonamiento viene activado por defecto y se devuelve en reasoning_content; envía thinking={"type":"disabled"} para desactivarlo y obtener una respuesta directa. Admite llamadas a herramientas y streaming. Totalmente compatible con OpenAI: indica model=deepseek-v4.1-flash. Un único precio todo el día, sin tarifa de hora punta; pago por uso y sin cargo por las llamadas fallidas.

ChatModo de razonamientoLlamadas a herramientasBajo costeCompatible con OpenAI

Prueba en directo

Prueba DeepSeek V4.1 Flash aquí mismo (disponible tras iniciar sesión).

Entrada

Avanzado
Búsqueda web
Memoria · multiturno

Conversación

Empieza una conversaciónEscribe un mensaje abajo para empezar

Acerca de DeepSeek V4.1 Flash

DeepSeek V4.1 Flash es el modelo Flash actual de DeepSeek (deepseek-flash en la API oficial), servido en NezhaGate mediante la API compatible con OpenAI. Por defecto piensa antes de responder: el razonamiento llega en message.reasoning_content y la respuesta siempre en content. Envía thinking={"type":"disabled"} para desactivar el razonamiento y obtener respuestas más rápidas y baratas en tareas sencillas. Admite llamadas a herramientas (function calling) y streaming. Indica model=deepseek-v4.1-flash; un único precio todo el día sin tarifa de hora punta, pago por uso y sin cargo por las llamadas fallidas.

Casos de uso

Chat y preguntas del día a día

Atención al cliente, preguntas sobre una base de conocimiento y asistentes de escritura: su precio unitario bajo y sus respuestas rápidas encajan con tráfico de gran volumen.

Programación y razonamiento

Con el razonamiento activado, el modelo analiza el problema antes de responder, algo útil para generar código, matemáticas y lógica de varios pasos.

Agentes y llamadas a herramientas

tools / tool_calls en formato OpenAI se conectan directamente a frameworks de agentes para búsquedas, llamadas a funciones y tareas de varios pasos.

Procesamiento masivo de texto

Clasificación, extracción, resúmenes y reescritura pueden ejecutarse con el razonamiento desactivado para obtener el resultado directo y más barato.

Cómo elegir

Elige V4.1 para usar el Flash más reciente de DeepSeek, y la instantánea 0731 cuando tus prompts ya están ajustados a V4 Flash y quieres fijar la versión. Para programación y agentes más exigentes, compáralo con GLM-5.3: cambiar es solo modificar el campo model.

Preguntas frecuentes

¿En qué se diferencia de DeepSeek V4 Flash 0731?
V4.1 es la versión Flash actual de DeepSeek; 0731 es una instantánea fija de V4 Flash cuyo comportamiento no cambia con las actualizaciones del proveedor. En NezhaGate ambas cuestan lo mismo y se llaman exactamente igual.
¿Cómo desactivo el razonamiento?
Añade "thinking": {"type": "disabled"} a la petición. El modelo se salta el paso de razonamiento y responde directamente, reasoning_content queda vacío y usas menos tokens de salida. Si omites el campo, el razonamiento está activado.
¿Qué pasa si pongo un max_tokens muy pequeño?
Es un modelo de razonamiento, así que los tokens de razonamiento cuentan como salida. El proveedor trata cualquier max_tokens inferior a 1024 como 1024, de modo que la salida (razonamiento incluido) puede superar el valor que indicaste, y se factura por los tokens reales de usage. Para respuestas cortas, desactiva el razonamiento.
¿Admite llamadas a herramientas y streaming?
Sí, ambas. tools / tool_calls usan el formato de OpenAI; con stream=true la respuesta llega en fragmentos SSE y el razonamiento se transmite en delta.reasoning_content.
¿Se cobran las llamadas fallidas?
No. Solo se liquidan, según el uso real, las llamadas que responden con normalidad; los errores del proveedor y los tiempos de espera agotados nunca tocan tu saldo.

Modelos relacionados

Descubre otros modelos que puedes integrar.

Ver todo →