Перейти к содержимому
EN

Grok Imagine Video 1.5

Grok Imagine Video 1.5 (x-ai/grok-imagine-video-1.5) — модель генерации видео от xAI: создаёт ролики по текстовому описанию, а необязательное стартовое изображение задаёт сцену. Управляет движением объекта и камеры, темпом, атмосферой и физикой поведения, сохраняя визуальную целостность, и генерирует синхронные звуковые эффекты, эмбиенс и диалоги. Генерация асинхронная: POST /v1/videos возвращает задачу, дальше опрос статуса и скачивание mp4.

Поле Описание
model x-ai/grok-imagine-video-1.5 (или короткое grok-imagine-video-1.5)
prompt Описание сцены, обязательное
seconds Любое целое от 1 до 15; по умолчанию 1
size Размер WxH из таблицы ниже; по умолчанию 1280x720
input_reference Image-to-video: одна картинка как стартовый кадр, {"image_url": "data:image/...;base64,..."}
input_references Reference-to-video: от 2 до 7 картинок в массиве, тоже только data:-URL — потолок апстрима xAI
seed Не поддерживается: seed у модели false, запрос с этим полем вернёт 400

Двадцать один допустимый размер — семь соотношений сторон в трёх разрешениях:

Соотношение 480p 720p 1080p
16:9 852x480 1280x720 1920x1080
9:16 480x852 720x1280 1080x1920
1:1 480x480 720x720 1080x1080
4:3 640x480 960x720 1440x1080
3:4 480x640 720x960 1080x1440
3:2 720x480 1080x720 1620x1080
2:3 480x720 720x1080 1080x1620

Значение вне списка вернёт 400 с перечнем допустимых вариантов — сверяйтесь с полем sizes в каталоге, если сомневаетесь.

import requests
job = requests.post(
"https://api.mixen.ai/v1/videos",
headers={"Authorization": f"Bearer {API_KEY}"},
json={
"model": "x-ai/grok-imagine-video-1.5",
"prompt": "Спорткар разгоняется по ночному шоссе, неон отражается в мокром асфальте, камера обгоняет машину и уходит вбок",
"seconds": "6",
"size": "1280x720",
},
).json()
print(job["id"], job["status"])

Картинка передаётся одной строкой data:-URL — внешние ссылки не принимаются:

import base64
import requests
with open("scene.jpg", "rb") as f:
img = "data:image/jpeg;base64," + base64.b64encode(f.read()).decode()
job = requests.post(
"https://api.mixen.ai/v1/videos",
headers={"Authorization": f"Bearer {API_KEY}"},
json={
"model": "x-ai/grok-imagine-video-1.5",
"prompt": "Камера медленно наезжает на героя, ветер теребит одежду, слышен дождь",
"seconds": "8",
"size": "1280x720",
"input_reference": {"image_url": img},
},
).json()
print(job["id"], job["status"])

От двух до семи образцов — модель собирает сцену из референсов:

{
"model": "x-ai/grok-imagine-video-1.5",
"prompt": "Персонаж из первого кадра осматривает локацию из второго, настороженное движение",
"seconds": "6",
"size": "1280x720",
"input_references": [
"data:image/png;base64,iVBORw0...",
"data:image/png;base64,iVBORw0..."
]
}

Дальше как обычно: GET /v1/videos/{id} раз в 5–10 секунд до completed, затем GET /v1/videos/{id}/content за mp4. Полный цикл — гайд по видео.

Тарификация посекундная и зависит от разрешения: 480p — 10.6954 ₽ ($0.12) за секунду, 720p — 18.717 ₽ ($0.21), 1080p — 33.4232 ₽ ($0.375). Сверх посекундной ставки каждая входная картинка — стартовый кадр или референс — добавляет $0.01 к стоимости ролика. Списывается фактическая длительность × ставка размера. Актуальные цены — каталог.

  • Длительности от 1 до 15 секунд — непрерывный ряд и самый короткий старт среди видео-моделей каталога.
  • Семь форматов кадра, включая редкие 3:2 и 2:3, в разрешениях 480p, 720p и 1080p.
  • Синхронный звук: эффекты, эмбиенс и диалоги генерируются вместе с роликом.
  • Режиссура в промпте: движение объекта и камеры, темп, атмосфера и физика поведения.
  • Картинки — только data:-URL: один стартовый кадр или до 7 референсов (у других видео-моделей до 9).
  • Каждая входная картинка добавляет $0.01 к цене — на роликах с полным набором референсов это заметно.

Все модели — в каталоге. Общий порядок работы с видео — гайд по видео.