Wan 3.0
⧉Wan 3.0 (Tongyi Wanxiang) es el modelo de vídeo todoterreno de Alibaba. Un solo endpoint y el material elige el modo: sin material es texto a vídeo, una imagen como primer fotograma, dos imágenes como primer y último fotograma, varias imágenes como referencia multiimagen y un vídeo de referencia para reescribir vídeo. Duración de 2 a 30 segundos de segundo en segundo, tres resoluciones 480P / 720P / 1080P, cinco relaciones de aspecto, hasta 10 imágenes de referencia, 5 vídeos de referencia y 5 audios de referencia; la salida incluye audio. Asíncrono: envías y luego consultas el id del trabajo para obtener un enlace mp4 estable rehospedado. Facturado por segundo; los trabajos fallidos se reembolsan íntegramente.
Prueba en directo · Playground
Prueba Wan 3.0 aquí mismo (disponible tras iniciar sesión)。
Input
VídeoOutput
videoAcerca de Wan 3.0
Wan 3.0 (Tongyi Wanxiang) es el modelo de vídeo todo en uno de Alibaba y la línea de vídeo más versátil de aquí: un solo endpoint cubre texto a vídeo, primer fotograma, primer y último fotograma, referencia multiimagen y edición de vídeo, elegidos con parámetros en vez de cambiando de modelo. Cualquier entero de 2 a 30 segundos, 480P / 720P / 1080P, relaciones de aspecto 16:9 / 9:16 / 1:1 / 4:3 / 3:4, hasta 10 imágenes de referencia, 5 vídeos de referencia y 5 pistas de audio de referencia, y cada clip sale con pista de audio. Asíncrono: POST /v1/videos/generations devuelve al instante HTTP 202 y un id de trabajo; consulta GET /v1/videos/jobs/{id} hasta status=succeeded y lee data[0].url, un mp4 rehospedado por nosotros, así que no caduca a las 24 horas como sí lo hace el enlace del proveedor.
Casos de uso
Texto a vídeo, primer fotograma, primer y último fotograma, referencia multiimagen y edición de vídeo, todo elegido con parámetros.
Hasta 30 segundos para piezas narrativas de una sola toma.
Diez imágenes de referencia más vídeo y audio de referencia: alimenta personaje, escena y ritmo a la vez.
Dale un vídeo de referencia y una frase para recomponer el estilo del metraje o cambiar el movimiento de cámara.
Cómo elegir
Elígelo para clips de más de 15 segundos, para alimentarlo con muchas imágenes más vídeo y audio a la vez, o para 1080P nativo; coge Prime cuando tengas prisa. Para unos pocos segundos sin referencias multimaterial, la línea Seedance también sirve.
Preguntas frecuentes
¿Cómo cambio entre los cinco modos?
¿Se contaminan entre sí las imágenes de referencia?
¿Cómo se factura y las referencias cuestan aparte?
¿Cuál es la diferencia entre Standard y Prime?
¿Cuánto tarda un render?
Modelos relacionados
Descubre otros modelos que puedes integrar.
GPT-5.6 Sol
Buque insignia de frontera para programación agéntica
GPT-5.6 Terra
Modelo equilibrado de programación agéntica para el día a día
GPT-5.6 Luna
Modelo rápido y económico de programación agéntica
GPT-5.5
Modelo insignia de chat y razonamiento
GPT-6 Astra
Buque insignia de nueva generación de OpenAI · contexto de 1,05M
GPT Image 2
Modelo de alta calidad para texto a imagen e imagen a imagen
GPT Image 2.5 Flare
Modelo de imagen de nueva generación · limpio y suave
GPT Image 2.5 Sunburst
Modelo de imagen de nueva generación · más textura
Nano Banana 2
Modelo de alta calidad para texto a imagen e imagen a imagen
Nano Banana Pro
Modelo insignia para texto a imagen e imagen a imagen
Claude Sonnet 4.6
Modelo equilibrado y eficiente para chat y código
Claude Opus 5
Buque insignia de nueva generación de Anthropic
Claude Fable 5
Serie Fable de Anthropic · narrativa y textos largos
Gemini 3.1 Pro
Modelo insignia de razonamiento de nueva generación de Google
Gemini 3.8 Flash
El Flash más reciente · razonamiento adaptativo
Gemini 3.7 Flash
Flash anterior · razonamiento adaptativo
Gemini 3.6 Flash
Modelo rápido de nueva generación · cuatro presupuestos de razonamiento
Gemini 3.6 Flash High
Nivel de razonamiento profundo
Gemini 3.6 Flash Low
El nivel más rápido y económico
Gemini 3.6 Flash Tiered
Razonamiento por niveles automático
Gemini 3 Flash
Modelo de chat rápido, de baja latencia y económico
Gemini 3.5 Flash
Modelo rápido con razonamiento de nueva generación
Gemini 2.5 Flash
Chat rápido, de baja latencia y económico
Veo 3.1
Texto / imagen a vídeo · varios niveles · varias resoluciones
Seedance 2.5
Texto / imagen a vídeo · hasta 30 segundos
Seedance 2.0
Texto / imagen a vídeo · de 5 a 15 segundos
Seedance 2.0 Fast
Baja latencia · el coste más bajo
Seedance 2.0 Mini
Nivel de entrada · el coste más bajo
Wan 3.0 Prime
Las mismas capacidades · varias veces más rápido
MiniMax H3
1080P · audio nativo
Grok Imagine Video 1.5
Facturado por clip · hasta 15 segundos