Skip to main content
Изображения, видео, музыка и речь генерируются через задачи, потому что рендер занимает от секунд до нескольких минут.
1

Запустите

POST /v1/{images|videos|music|audio}/jobs с моделью нужного типа. В ответе сразу приходят id, status: "pending" и estimated_cost.
2

Опрашивайте

GET /v1/{kind}/jobs/{id} каждые 3–5 секунд, пока status не станет completed или failed. Задача выполняется, даже если вы перестали опрашивать.
3

Скачайте

У каждого элемента output есть url (…/v1/{kind}/jobs/{id}/content?index=N). Файл отдаётся с тем же X-API-KEY, поддерживаются Range-запросы.
Точный срок — в expires_at; после него вернётся 410 content_expired. Одновременно можно запускать ограниченное число задач (429 too_many_jobs).

Изображения

POST /v1/images/jobs — генерация по тексту или редактирование, если переданы input_images. Одно изображение на задачу.

Видео

POST /v1/videos/jobs. Режим определяется по входным данным: текст; image_url (+ last_frame_url) — изображение в видео; reference_image_urls / video_urls — по референсам; video_url + image_url — контроль движения.

Музыка

POST /v1/music/jobs. Только prompt — модель сама напишет текст и выберет стиль. Поля: lyrics (до 5000), style (до 1000), title (до 200), instrumental. Некоторые модели возвращают два трека по цене одного.

Речь и звук

POST /v1/audio/jobs. Синтез речи — text + voice; диалог — dialogue (реплики с text и voice); звуковые эффекты — text + duration_seconds (до 30); выделение голоса — audio_url. Дополнительно: language_code, speed (0.7–1.2), stability, similarity_boost.

Пример

Ошибки задачи

Неудачная задача не оплачивается. Референсные файлы должны быть доступны по https без авторизации.