NezhaGate
Vídeo

Wan 3.0

wan3.0-video
Tipo de modelo StandardPrime

Wan 3.0 (Tongyi Wanxiang) es el modelo de vídeo todoterreno de Alibaba. Un solo endpoint y el material elige el modo: sin material es texto a vídeo, una imagen como primer fotograma, dos imágenes como primer y último fotograma, varias imágenes como referencia multiimagen y un vídeo de referencia para reescribir vídeo. Duración de 2 a 30 segundos de segundo en segundo, tres resoluciones 480P / 720P / 1080P, cinco relaciones de aspecto, hasta 10 imágenes de referencia, 5 vídeos de referencia y 5 audios de referencia; la salida incluye audio. Asíncrono: envías y luego consultas el id del trabajo para obtener un enlace mp4 estable rehospedado. Facturado por segundo; los trabajos fallidos se reembolsan íntegramente.

Texto a vídeoImagen a vídeo1080PHasta 30 s

Prueba en directo · Playground

Prueba Wan 3.0 aquí mismo (disponible tras iniciar sesión)。

Input

Vídeo
0 / 5000 bytes
Con varias referencias, menciónalas en el prompt como @Image1 / @Image2; por ejemplo: «el personaje de @Image1 aparece en la escena de @Image2». Sin esas marcas, el modelo decide por su cuenta.
El render suele tardar entre 5 y 20 minutos; si el backend está saturado puede superar los 60 (esperamos hasta 90). Consulta el id del trabajo en lugar de reenviarlo: cada reenvío se factura por separado. Se factura por segundo y se reembolsa íntegramente si falla. Límite del prompt: 5000 bytes (unos 1666 caracteres chinos).

Output

video
Los resultados aparecerán aquí al ejecutar.

Acerca de Wan 3.0

Wan 3.0 (Tongyi Wanxiang) es el modelo de vídeo todo en uno de Alibaba y la línea de vídeo más versátil de aquí: un solo endpoint cubre texto a vídeo, primer fotograma, primer y último fotograma, referencia multiimagen y edición de vídeo, elegidos con parámetros en vez de cambiando de modelo. Cualquier entero de 2 a 30 segundos, 480P / 720P / 1080P, relaciones de aspecto 16:9 / 9:16 / 1:1 / 4:3 / 3:4, hasta 10 imágenes de referencia, 5 vídeos de referencia y 5 pistas de audio de referencia, y cada clip sale con pista de audio. Asíncrono: POST /v1/videos/generations devuelve al instante HTTP 202 y un id de trabajo; consulta GET /v1/videos/jobs/{id} hasta status=succeeded y lee data[0].url, un mp4 rehospedado por nosotros, así que no caduca a las 24 horas como sí lo hace el enlace del proveedor.

Casos de uso

Cinco modos, un endpoint

Texto a vídeo, primer fotograma, primer y último fotograma, referencia multiimagen y edición de vídeo, todo elegido con parámetros.

Planos largos

Hasta 30 segundos para piezas narrativas de una sola toma.

Composición multimaterial

Diez imágenes de referencia más vídeo y audio de referencia: alimenta personaje, escena y ritmo a la vez.

Edición de vídeo

Dale un vídeo de referencia y una frase para recomponer el estilo del metraje o cambiar el movimiento de cámara.

Cómo elegir

Elígelo para clips de más de 15 segundos, para alimentarlo con muchas imágenes más vídeo y audio a la vez, o para 1080P nativo; coge Prime cuando tengas prisa. Para unos pocos segundos sin referencias multimaterial, la línea Seedance también sirve.

Preguntas frecuentes

¿Cómo cambio entre los cinco modos?
Solo con parámetros: si no envías nada es texto a vídeo; una imagen se usa por defecto como primer fotograma; dos imágenes con image_role=first_frame dan primer y último fotograma; más de dos pasan por defecto a referencia multiimagen; y añadir video_references lo convierte en una edición de vídeo. Combinar imágenes y un vídeo requiere image_role=reference.
¿Se contaminan entre sí las imágenes de referencia?
Sí. Con cuatro referencias, el modelo trató a todas las personas visibles en CUALQUIERA de ellas como sujeto candidato: el clip empezó con el personaje previsto y más tarde cortó a una segunda persona que solo aparecía en una referencia de escena. Mantén las referencias de escena sin más personas, o nombra al sujeto con @Image1 en el prompt.
¿Cómo se factura y las referencias cuestan aparte?
Por segundo: coste = (duración de salida + la duración de cada vídeo de referencia) x la tarifa de esa resolución. Las imágenes y el audio de referencia son gratis. La retención al enviar usa ese número y el cargo final usa el mismo, así que siempre coinciden; un render fallido o caducado se reembolsa íntegramente. Como los segundos de vídeo de referencia se facturan, hay que indicar su duración de forma explícita.
¿Cuál es la diferencia entre Standard y Prime?
Solo la velocidad y el precio: las capacidades son idénticas punto por punto. El mismo clip de 2 segundos tardó unos 2 min 45 s en Standard y unos 37 s en Prime, y Prime cuesta alrededor de un tercio más por segundo. Si no tienes prisa, usa Standard.
¿Cuánto tarda un render?
Un clip de 2 segundos ronda los 2-3 minutos en Standard; un clip de 5 segundos con cuatro imágenes de referencia midió unos 11 minutos. Prime es notablemente más rápido. Consulta el id del trabajo cada 10-15 segundos en lugar de esperar de forma síncrona.

Modelos relacionados

Descubre otros modelos que puedes integrar.

Ver todo →
GPT-5.6 Sol Chat

GPT-5.6 Sol

gpt-5.6-sol

Buque insignia de frontera para programación agéntica

$2.00/1M entrada · $12.00/1M salida ↓75% Ver →
GPT-5.6 Terra Chat

GPT-5.6 Terra

gpt-5.6-terra

Modelo equilibrado de programación agéntica para el día a día

$1.20/1M entrada · $7.00/1M salida ↓77% Ver →
GPT-5.6 Luna Chat

GPT-5.6 Luna

gpt-5.6-luna

Modelo rápido y económico de programación agéntica

$0.80/1M entrada · $4.80/1M salida ↓68% Ver →
GPT-5.5 Chat

GPT-5.5

gpt-5.5

Modelo insignia de chat y razonamiento

$0.70/1M entrada · $4.20/1M salida ↓86% Ver →
GPT-6 Astra Chat

GPT-6 Astra

gpt-6-astra

Buque insignia de nueva generación de OpenAI · contexto de 1,05M

$2.80/1M entrada · $14.00/1M salida ↓72% Ver →
GPT Image 2 Imagen

GPT Image 2

gpt-image-2

Modelo de alta calidad para texto a imagen e imagen a imagen

$0.015/img y más Ver →
GPT Image 2.5 Flare Imagen

GPT Image 2.5 Flare

gpt-image-2.5-flare

Modelo de imagen de nueva generación · limpio y suave

$0.015/img y más Ver →
GPT Image 2.5 Sunburst Imagen

GPT Image 2.5 Sunburst

gpt-image-2.5-sunburst

Modelo de imagen de nueva generación · más textura

$0.015/img y más Ver →
Nano Banana 2 Imagen

Nano Banana 2

nano-banana-2

Modelo de alta calidad para texto a imagen e imagen a imagen

$0.025/img y más Ver →
Nano Banana Pro Imagen

Nano Banana Pro

nano-banana-pro

Modelo insignia para texto a imagen e imagen a imagen

$0.040/img y más Ver →
Claude Sonnet 4.6 Chat

Claude Sonnet 4.6

claude-sonnet-4-6

Modelo equilibrado y eficiente para chat y código

$1.50/1M entrada · $7.50/1M salida ↓50% Ver →
Claude Opus 5 Chat

Claude Opus 5

claude-opus-5

Buque insignia de nueva generación de Anthropic

$4.00/1M entrada · $20.00/1M salida Ver →
Claude Fable 5 Chat

Claude Fable 5

claude-fable-5

Serie Fable de Anthropic · narrativa y textos largos

$8.00/1M entrada · $40.00/1M salida Ver →
Gemini 3.1 Pro Chat

Gemini 3.1 Pro

gemini-3.1-pro

Modelo insignia de razonamiento de nueva generación de Google

$0.50/1M entrada · $3.00/1M salida ↓75% Ver →
Gemini 3.8 Flash Chat

Gemini 3.8 Flash

gemini-3.8-flash

El Flash más reciente · razonamiento adaptativo

$0.60/1M entrada · $3.60/1M salida ↓7% Ver →
Gemini 3.7 Flash Chat

Gemini 3.7 Flash

gemini-3.7-flash

Flash anterior · razonamiento adaptativo

$0.60/1M entrada · $3.60/1M salida ↓7% Ver →
Gemini 3.6 Flash Chat

Gemini 3.6 Flash

gemini-3.6-flash

Modelo rápido de nueva generación · cuatro presupuestos de razonamiento

$0.60/1M entrada · $3.60/1M salida Ver →
Gemini 3.6 Flash High Chat

Gemini 3.6 Flash High

gemini-3.6-flash-high

Nivel de razonamiento profundo

$0.60/1M entrada · $3.60/1M salida Ver →
Gemini 3.6 Flash Low Chat

Gemini 3.6 Flash Low

gemini-3.6-flash-low

El nivel más rápido y económico

$0.60/1M entrada · $3.60/1M salida Ver →
Gemini 3.6 Flash Tiered Chat

Gemini 3.6 Flash Tiered

gemini-3.6-flash-tiered

Razonamiento por niveles automático

$0.60/1M entrada · $3.60/1M salida Ver →
Gemini 3 Flash Chat

Gemini 3 Flash

gemini-3-flash-preview

Modelo de chat rápido, de baja latencia y económico

$0.30/1M entrada · $1.20/1M salida ↓57% Ver →
Gemini 3.5 Flash Chat

Gemini 3.5 Flash

gemini-3.5-flash

Modelo rápido con razonamiento de nueva generación

$0.45/1M entrada · $2.70/1M salida ↓70% Ver →
Gemini 2.5 Flash Chat

Gemini 2.5 Flash

gemini-2.5-flash

Chat rápido, de baja latencia y económico

$0.30/1M entrada · $1.20/1M salida ↓46% Ver →
Veo 3.1 Vídeo

Veo 3.1

veo-3.1

Texto / imagen a vídeo · varios niveles · varias resoluciones

$0.075/clip+ Ver →
Seedance 2.5 Vídeo

Seedance 2.5

seedance-2.5

Texto / imagen a vídeo · hasta 30 segundos

$0.158/s Ver →
Seedance 2.0 Vídeo

Seedance 2.0

seedance-2.0

Texto / imagen a vídeo · de 5 a 15 segundos

$0.150/s Ver →
Seedance 2.0 Fast Vídeo

Seedance 2.0 Fast

seedance-2.0-fast

Baja latencia · el coste más bajo

$0.100/s Ver →
Seedance 2.0 Mini Vídeo

Seedance 2.0 Mini

seedance-2.0-mini

Nivel de entrada · el coste más bajo

$0.066/s Ver →
Wan 3.0 Prime Vídeo

Wan 3.0 Prime

wan3.0-video-prime

Las mismas capacidades · varias veces más rápido

$0.160/s Ver →
MiniMax H3 Vídeo

MiniMax H3

minimax-h3

1080P · audio nativo

$0.036/s Ver →
Grok Imagine Video 1.5 Vídeo

Grok Imagine Video 1.5

grok-imagine-video-1.5

Facturado por clip · hasta 15 segundos

$0.300/clip+ Ver →