NezhaGateNezhaGate
Видео

Wan 3.0

⧉
wan3.0-video
Тип модели StandardPrime

Wan 3.0 (Tongyi Wanxiang) — универсальная видеомодель от Alibaba. Один эндпоинт, режим выбирается по входным данным: без материалов — текст в видео, одно изображение — как первый кадр, два изображения — как первый и последний кадр, несколько изображений — как мультиреференс, референсное видео — для переработки видео. Длительность 2-30 секунд с шагом в одну секунду, три разрешения 480P / 720P / 1080P, пять соотношений сторон, до 10 референсных изображений, 5 референсных видео и 5 референсных аудиофрагментов; на выходе есть звук. Асинхронно: отправьте запрос, затем опрашивайте job id, чтобы получить перезалитую ссылку на mp4 (хранится 60 дней). Оплата по секундам; при неудаче — полный возврат.

Текст в видеоИзображение в видео1080PДо 30 с

Примеры клипов

Все созданы с помощью NezhaGate. Нажмите на клип, чтобы прослушать его.
Beneath the Walls of Troy HD-оригинал
Myth Awakens HD-оригинал
Grandma's Birthday HD-оригинал

Онлайн-тест · Песочница

Попробуйте Wan 3.0 прямо здесь (доступно после входа).

Ввод

Видео
0 / 5000 байт
При использовании нескольких референсов обращайтесь к ним в промпте как @Image1 / @Image2, например: «персонаж с @Image1 стоит в сцене с @Image2». Без токенов модель решает сама.
Рендеринг обычно занимает 5-20 min; при высокой нагрузке на бэкенде может превышать 60 min (мы ждём до 90). Опрашивайте ID задачи, а не отправляйте запрос заново - каждая повторная отправка оплачивается отдельно. Оплата посекундная, при сбое — полный возврат. Лимит промпта 5000 байт (примерно 1666 китайских иероглифов).

Вывод

video
Результаты появятся здесь после запуска.
🕑 Результаты хранятся 60 дней, затем автоматически удаляются — скачайте всё, что хотите сохранить.

О Wan 3.0

Wan 3.0 (Tongyi Wanxiang) — универсальная видеомодель от Alibaba и самая разноплановая линейка видео здесь: один эндпоинт покрывает текст в видео, первый кадр, первый+последний кадр, референс по нескольким изображениям и редактирование видео — режим выбирается параметрами, а не переключением модели. Любое целое число от 2 до 30 секунд, 480P / 720P / 1080P, соотношения сторон 16:9 / 9:16 / 1:1 / 4:3 / 3:4, до 10 референсных изображений, 5 референсных видео и 5 референсных аудиодорожек, и каждый клип идёт со звуковой дорожкой. Асинхронно: POST /v1/videos/generations сразу возвращает HTTP 202 и id задачи; опрашивайте GET /v1/videos/jobs/{id}, пока status=succeeded, и читайте data[0].url — mp4, перезалитый к нам и хранящийся 60 дней (исходная ссылка у провайдера живёт всего 24 часа), так что скачайте его до этого срока.

Сценарии использования

Пять режимов, один эндпоинт

Текст в видео, первый кадр, первый+последний кадр, референс по нескольким изображениям и редактирование видео — всё выбирается параметрами.

Длинные дубли

До 30 секунд для повествовательных сцен одним планом.

Композиция из нескольких материалов

Десять референсных изображений плюс референсные видео и аудио — подайте персонажа, сцену и ритм одновременно.

Редактирование видео

Передайте референсное видео и одно предложение, чтобы изменить стиль отснятого материала или движение камеры.

Как выбрать

Выбирайте её для клипов длиннее 15 секунд, для одновременной подачи множества изображений вместе с видео и аудио, или ради нативного 1080P; берите Prime, если поджимает время. Для нескольких секунд без референсов из нескольких материалов подойдёт и линейка Seedance.

Частые вопросы

Как переключаться между пятью режимами?
Только параметрами: не передавайте ничего — получится текст в видео; одно изображение по умолчанию становится первым кадром; два изображения с image_role=first_frame дают первый+последний кадр; больше двух по умолчанию дают референс по нескольким изображениям; добавление video_references превращает запрос в редактирование видео. Для сочетания изображений и видео нужен image_role=reference.
Перемешиваются ли несколько референсных изображений между собой?
Да. При четырёх референсах модель восприняла как потенциального субъекта любого человека, видимого хотя бы на одном из них — клип начался с нужного персонажа, а затем переключился на второго человека, который присутствовал только на референсе сцены. Держите референсы сцены свободными от посторонних людей либо называйте нужный субъект через @Image1 в промпте.
Как рассчитывается оплата и стоят ли референсы дополнительно?
Посекундно: стоимость = (длительность результата + длительность каждого референсного видео) x тариф для данного разрешения. Референсные изображения и аудио бесплатны. Резерв при отправке рассчитывается по этому же числу, и итоговое списание использует то же число, поэтому они всегда равны; при сбое или тайм-ауте рендера резерв возвращается полностью. Поскольку секунды референсных видео тоже оплачиваются, их длительность нужно указывать явно.
В чём разница между Standard и Prime?
Только скорость и цена — возможности идентичны, один в один. Один и тот же 2-секундный клип занял на Standard около 2m45s, а на Prime — около 37s, при этом Prime стоит за секунду примерно на треть дороже. Если время не поджимает, используйте Standard.
Сколько времени занимает рендер?
2-секундный клип занимает на Standard около 2-3 минут; 5-секундный клип с четырьмя референсными изображениями занял около 11 минут. Prime заметно быстрее. Опрашивайте id задачи вместо синхронного ожидания, каждые 10-15 секунд.

Похожие модели

Изучите другие модели, которые можно подключить.

Смотреть все →