NezhaGateNezhaGate
Chat

Kimi K3

⧉
kimi-k3

Kimi K3 es el nuevo modelo insignia de Moonshot AI, fuerte en comprensión de documentos largos, análisis de varios documentos y redacción en chino, con un uso excelente de agentes y herramientas. Siempre piensa antes de responder, con el razonamiento en reasoning_content; la temperatura de muestreo la fija el modelo, así que temperature / top_p en la petición se ignoran. Admite llamadas a herramientas, streaming y caché de prompts (un prefijo largo repetido se liquida a la tarifa de caché). Totalmente compatible con OpenAI: indica model=kimi-k3. Pago por uso y sin cargo por las llamadas fallidas.

ChatTextos largosAgentesLlamadas a herramientasCompatible con OpenAI

Por qué este modelo

El nuevo buque insignia de Moonshot: 2,8 billones de parámetros, pesos abiertos y un contexto de cerca de 1M de tokens

Puntos fuertes

  • 2,8 billones de parámetros con pesos abiertos, uno de los mayores modelos abiertos hasta la fecha
  • Cerca de 1M de tokens de contexto (1.048.576): pásale un documento largo entero
  • Razona por defecto; el razonamiento llega aparte en reasoning_content y nunca se mezcla con la respuesta
  • Llamadas a herramientas, streaming y caché de prompts; un prefijo largo repetido se factura a precio de caché
  • Compatible con OpenAI: en tu código con el SDK solo cambian base_url y model

Precio frente al oficial

NezhaGatePrecio de lista Entrada$1.8$3 Salida$9$15

Por 1M de tokens, en USD · Ahorras ↓40%

Copia y llama

curl
curl https://nezhagate.com/v1/chat/completions -H "Authorization: Bearer YOUR_API_KEY" -H "Content-Type: application/json" -d '{"model": "kimi-k3", "messages": [{"role": "user", "content": "Hello"}]}'
Python
from openai import OpenAI

client = OpenAI(api_key="YOUR_API_KEY", base_url="https://nezhagate.com/v1")
r = client.chat.completions.create(model="kimi-k3", messages=[{"role": "user", "content": "Hello"}])
print(r.choices[0].message.content)

Sustituye YOUR_API_KEY por una clave creada en tu consola.

Prueba en directo

Prueba Kimi K3 aquí mismo (disponible tras iniciar sesión).

Entrada

Avanzado
Búsqueda web
Memoria · multiturno

Conversación

Empieza una conversaciónEscribe un mensaje abajo para empezar

Acerca de Kimi K3

Kimi K3 es el nuevo modelo insignia de Moonshot AI, servido en NezhaGate mediante la API compatible con OpenAI. Es fuerte en comprensión de documentos largos, análisis de varios documentos y redacción en chino, con un uso excelente de agentes y herramientas. Siempre piensa antes de responder: el razonamiento llega en message.reasoning_content y la respuesta en content. La temperatura de muestreo la fija el modelo, así que la pasarela ignora temperature / top_p de la petición sin devolver error. Admite llamadas a herramientas, streaming y caché de prompts. Indica model=kimi-k3; pago por uso y sin cargo por las llamadas fallidas.

Casos de uso

Documentos largos y análisis de varios documentos

Resúmenes, comparaciones y preguntas sobre contratos, artículos o informes financieros extensos; hemos verificado que localiza la información con precisión en documentos de más de 100K tokens.

Agentes y llamadas a herramientas

tools / tool_calls en formato OpenAI para búsqueda aumentada, llamadas a funciones y orquestación de tareas de varios pasos.

Redacción en chino

Textos largos, informes, textos comerciales y corrección de estilo con un chino natural y fluido.

Razonamiento complejo

Piensa antes de responder, útil en matemáticas, lógica y problemas de varios pasos; el razonamiento se puede revisar en reasoning_content.

Cómo elegir

Para textos largos, varios documentos y tareas de agentes, elige primero Kimi K3. Para conversación diaria a menor coste, DeepSeek V4.1 Flash o GLM-5.3 también sirven; cambiar es solo modificar el campo model.

Preguntas frecuentes

¿Sirve el parámetro temperature?
La temperatura de muestreo de Kimi K3 la fija el modelo, así que la pasarela ignora temperature y top_p de la petición (sin devolver error). El estilo de salida lo decide el propio modelo.
¿Puedo desactivar el razonamiento?
No. Kimi K3 siempre piensa antes de responder, y los tokens de razonamiento se facturan a la tarifa de salida dentro de usage.completion_tokens. Para respuestas más cortas, pide concisión en el prompt.
¿Qué debo tener en cuenta con respuestas largas?
Para contenidos largos que tarden más de unos 2 minutos en generarse, usa stream=true; una petición sin streaming puede cortarse por tiempo de espera. Si max_tokens es menor que 256, la pasarela lo sube a 256 para que el razonamiento no agote el presupuesto.
¿Admite caché de prompts?
Sí. Un prefijo largo repetido, como el mismo documento extenso, acierta en la caché, y la parte acertada se liquida a la tarifa de caché, muy inferior a la de entrada.
¿Se cobran las llamadas fallidas?
No. Solo se liquidan, según el uso real, las llamadas que responden con normalidad; los errores del proveedor y los tiempos de espera agotados nunca tocan tu saldo.

Modelos relacionados

Descubre otros modelos que puedes integrar.

Ver todo →