NezhaGateNezhaGate
Chat

GLM-5.3

⧉
glm-5.3
Tipo de modelo GLM-5.3Flash

GLM-5.3 es el nuevo modelo insignia de la serie GLM-5 de Z.ai (Zhipu), pensado para programación, flujos de agentes y razonamiento complejo, con una redacción fiable en chino e inglés. Siempre piensa antes de responder, con el razonamiento en reasoning_content, y admite llamadas a herramientas y streaming. Totalmente compatible con OpenAI: indica model=glm-5.3. Pago por uso, sin cargo por las llamadas fallidas, y la entrada en caché se liquida a la tarifa de caché.

ChatProgramaciónAgentesModo de razonamientoCompatible con OpenAI

Prueba en directo

Prueba GLM-5.3 aquí mismo (disponible tras iniciar sesión).

Entrada

Avanzado
Búsqueda web
Memoria · multiturno

Conversación

Empieza una conversaciónEscribe un mensaje abajo para empezar

Acerca de GLM-5.3

GLM-5.3 es el nuevo modelo insignia de la serie GLM-5 de Z.ai (Zhipu), pensado para programación, flujos de agentes y razonamiento complejo, y servido en NezhaGate mediante la API compatible con OpenAI. Siempre piensa antes de responder: el razonamiento llega en message.reasoning_content y la respuesta en content, así que los clientes que solo leen content no necesitan cambios. Admite llamadas a herramientas (function calling) y streaming, y la entrada en caché se liquida a la tarifa de caché. Indica model=glm-5.3; pago por uso y sin cargo por las llamadas fallidas.

Casos de uso

Asistente de programación

Generación, refactorización, explicación y revisión de código; razona antes de responder, algo útil en tareas de programación de varios pasos.

Flujos de agentes

Las llamadas a herramientas en formato OpenAI se conectan con frameworks de agentes para búsquedas, llamadas a funciones y planificación en varios pasos.

Redacción en chino e inglés

Textos comerciales, informes, correos y traducción con un chino natural, para contenidos dirigidos a públicos de China y del resto del mundo.

Preguntas complejas y análisis

Análisis, comparaciones y decisiones que necesitan una cadena de razonamiento, que puedes revisar en reasoning_content.

Cómo elegir

Elige GLM-5.3 para programación, agentes y razonamiento más exigentes, y GLM-5.3 Flash cuando las tareas sean sencillas, de gran volumen y sensibles al coste. Ambos pertenecen a la familia GLM-5.3, así que cambiar es solo modificar el campo model.

Preguntas frecuentes

¿Puedo desactivar el razonamiento?
No. GLM-5.3 siempre piensa antes de responder, y los tokens de razonamiento se facturan a la tarifa de salida dentro de usage.completion_tokens. Para respuestas más cortas y baratas, pide concisión en el prompt o cambia a GLM-5.3 Flash.
¿En qué se diferencia de GLM-5.3 Flash?
GLM-5.3 es el buque insignia, más fuerte en programación, agentes y razonamiento complejo; Flash es más ligero y tiene un precio unitario menor, ideal para tareas sencillas de gran volumen. Ambos se llaman exactamente igual.
¿Qué pasa si pongo un max_tokens muy pequeño?
Los tokens de razonamiento cuentan como salida. El proveedor trata cualquier max_tokens inferior a 1024 como 1024; si el razonamiento agota el presupuesto, content puede llegar vacío con finish_reason length, y se factura por los tokens reales de usage. Deja max_tokens en 1024 o más.
¿Admite llamadas a herramientas y streaming?
Sí, ambas. tools / tool_calls usan el formato de OpenAI; con stream=true la respuesta llega en fragmentos SSE y el razonamiento se transmite en delta.reasoning_content.
¿Se cobran las llamadas fallidas?
No. Solo se liquidan, según el uso real, las llamadas que responden con normalidad; los errores del proveedor y los tiempos de espera agotados nunca tocan tu saldo.

Modelos relacionados

Descubre otros modelos que puedes integrar.

Ver todo →