Loading...
Loading...
Семейство видеомоделей Google: создаёт ролики по текстовым промптам или референсным изображениям, оптимизировано под скорость.
0/7 элементов
Войдите, чтобы запускать модели
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Оценочная стоимость генерации по длительности и разрешению. Вы платите только за то, что запускаете.
Omni Flash — это gemini-omni-flash-preview от Google, видеомодель семейства Gemini, а не Veo, — и собственная подача DeepMind укладывается в одно предложение: «Считайте, что Gemini Omni — это Nano Banana, только для видео». Мы держим её capability reference-to-video как google/omni-flash/reference-to-video и берём $0.10 за каждую секунду готового видео 720p. Восьмисекундный ролик по умолчанию, соответственно, стоит $0.80, звук включён.
Обратите внимание на единицу. Никто здесь не продаёт ролик за фиксированную сумму, так что любую цифру, которую вы сравниваете, нужно умножить на длину, которую вы намерены отрисовать.
Есть сценарий, но нет изображений, которые надо перенести в кадр? Тогда нужный вам endpoint — Veo 3.1 Fast text-to-video: он стартует с одного prompt, и на нашей платформе стоит несравнимо меньше. Ниже мы честно к этому вернёмся.
Наша позиция против других мест, где эту модель можно вызвать, проверено 26 августа 2026 года:
| API-провайдер | За секунду (720p) | Ролик 8 секунд | против E2X |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | мы на 23% дешевле |
| Atlas Cloud | $0.135 | $1.08 | мы на 26% дешевле |
| Runware | $0.10 | $0.80 | наравне |
| Google Gemini API | $0.10 | $0.80 | наравне |
Цены и условия продуктов со временем меняются; проверьте актуальные цены каждого провайдера, прежде чем принимать решение о покупке. Цены Google Batch или Flex не эквивалентны напрямую стандартному on-demand API request, поскольку планирование, доступность и условия обработки отличаются; поэтому они исключены из этого сравнения. Это ограниченное по охвату сравнение, а не утверждение, что E2X — самый дешёвый вариант в мире при любой конфигурации.
Мы не будем это приукрашивать: на этой модели мы идём вровень со ставкой Google, а не подрезаем её, и экономия реальна только против fal.ai и Atlas. Референсные изображения почти не заметны в счёте — Google считает изображение за 2040 токенов, так что три штуки обходятся примерно в цент. Поле, которое двигает ваш счёт, — это duration.
Смысл этого endpoint — непрерывность. Дайте модели объект — человека, продукт, декорацию, образ, — опишите сцену, в которой его никогда не снимали, и объект переживёт эту поездку.
Приложить можно несколько референсов, а не один. Опубликованные примеры Google доходят до шести; официального максимума не задокументировано, а сторонние цифры противоречат друг другу, поэтому мы не станем печатать своё число. Стройте под небольшую горстку и проверяйте собственный потолок.
Звук генерируется вместе с картинкой, а не прикручивается сверху. Он синхронизируется с действием, и вы управляете им из того же prompt: попросите дождь по жестяной крыше и низкий тон помещения — именно это и вернётся. Отдельной звуковой дорожки, чтобы редактировать её потом, нет.
Десять секунд — потолок. Наш enum duration открывает 4, 6, 8 и 10; модель Google работает от 3 до 10 секунд, и 10 — это жёстко. Ни endpoint для продления, ни интерполяции. Всё, что длиннее, — работа по сшивке в вашем собственном монтажном софте, и непрерывность между склейками становится вашей проблемой.
720p, 24 кадра в секунду, и это весь список. В нашем поле resolution есть значения 1080p и 4k, а Google указывает более высокие разрешения как «скоро», но сегодня модель возвращает 720p. Оставьте значение по умолчанию. Страница провайдера, рекламирующая здесь 1080p, опережает собственную документацию Google.
Ждите примерно 45 секунд обработки на стандартный ролик — это замеренный p50 от eachlabs, а не официальная цифра, так что планируйте с ней, а не обещайте её.
Обязательных полей два: image_urls и prompt. Сгенерируйте ключ в дашборде, держите его на сервере, который вы контролируете, затем отправьте job.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "Кроссовок с изображения 1 стоит на мокром асфальте, позади отъезжает автобус. Медленный наезд. Фоновый трафик и лёгкий дождь, без музыки.",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
Ответ несёт job ID. Видео занимает минуты, поэтому опрашивайте неспешно — или пропустите polling и передайте webhookUrl в теле submit:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"Женщина с референса идёт по ночному рынку, неоновые вывески отражаются на её куртке. Съёмка с рук. Гул толпы и далёкое шипение сковородок.",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
Статусы идут pending → processing → completed либо приходят к failed или cancelled. Живая schema и цена лежат в машиночитаемой спецификации, если вам удобнее читать их программно.
Сравнение, которое имеет значение, и оно этой странице не льстит:
| Модель | Наша цена (8 с, 720p, звук) | Когда брать |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | Несколько референсов должны остаться консистентными или нужен ролик на 10 секунд |
| Veo 3.1 Fast reference-to-video | $0.12 | До трёх референсов, 8 секунд и вам нужен счёт поменьше |
| Veo 3.1 Fast image-to-video | $0.12 | Один кадр, который надо оживить |
| Veo 3.1 Fast text-to-video | $0.12 | Исходного материала нет вовсе |
Veo 3.1 Fast на нашей платформе стоит долю от Omni Flash и вдобавок доходит до 1080p и 4K, чего Omni Flash сейчас не может. По прайсу самого Google обе стоят одни и те же $0.10 за секунду 720p — разрыв открывает наша скидка. Так что начинайте с Veo Fast. Возвращайтесь сюда, когда вас блокирует её потолок в три референса, когда нужны те самые лишние две секунды или когда вам нужно поведение видеоредактора, стоящее за формулировкой «Nano Banana для видео». Больше вариантов лежит в категории reference-to-video, а весь каталог моделей — на одной странице.
Public Preview означает, что шероховатости задокументированы, а не спрятаны. Прочтите это до того, как строить:
Пишите кадр, а не историю. Один объект, одно движение камеры, одно состояние света — а затем скажите, как это звучит, потому что звук выходит из того же prompt, и тишина — это выбор, который вы делаете вслух.
Подписывайте вложения, когда их идёт больше одного: «изображение 1 — бутылка, изображение 2 — крупный план этикетки». Больше ничто не скажет модели, какой референс главный. Держите язык камеры простым: «медленный наезд», «статично», «съёмка с рук в проводке» бьют абзац операторских рассуждений.
Каждый ролик несёт водяной знак SynthID — невидимый зрителям, определяемый программно — и content credentials C2PA прикрепляются по умолчанию. Ни один провайдер, работающий с этой моделью, не может их выключить, мы в том числе. Если договор с клиентом запрещает помеченные ИИ материалы, решите это до интеграции.
Перекладывайте свои результаты в собственное хранилище прямо в обработчике завершения. URL результатов — не постоянные адреса, а видео, которое вы не можете забрать, — это видео, за которое вы платите дважды.
Это gemini-omni-flash-preview от Google, модель генерации и редактирования видео из семейства Gemini, а не из семейства Veo. DeepMind описывает её как «Nano Banana, только для видео» — акцент на том, чтобы консистентно переносить референсы и редактировать существующий материал, тогда как Veo целится в кинематографичную генерацию с нуля. Она находится в Public Preview.
$0.80. Мы берём $0.10 за секунду вывода 720p, так что счёт определяется длиной: четырёхсекундный ролик — $0.40, десятисекундный максимум — $1.00. Такой была наша ставка на момент проверки 26 августа 2026 года.
Больше одного, и задокументированные примеры Google доходят до шести — но официальный максимум не опубликован. Источники вне Google называют разные потолки и противоречат друг другу, поэтому мы не станем повторять цифру, которую не можем проверить. Протестируйте собственные payload, прежде чем проектировать под конкретное количество.
Сегодня — нет. Она выдаёт 720p при 24 кадрах в секунду, а более высокие разрешения Google указывает как «скоро». Если 1080p или 4K нужны прямо сейчас, Veo 3.1 Fast достаёт до обоих.
Для большинства задач — Veo 3.1 Fast. Восьмисекундный ролик со звуком на нашей платформе стоит там $0.12 против $0.80 здесь, и она доходит до 4K. Выбирайте Omni Flash, когда вам нужно больше трёх референсных изображений, длительность в 10 секунд или её поведение видеоредактора.
Да, нативно и синхронно с действием на экране. Вы управляете им из того же prompt — назовите атмосферу, эффекты или попросите музыку. Звук нельзя отредактировать потом через API, так что изменение означает перерисовку.
Да. Каждый результат несёт водяной знак SynthID, невидимый зрителям, но читаемый средствами детекции, плюс включённые по умолчанию content credentials C2PA. Ни один провайдер не даёт параметра, чтобы отключить хоть то, хоть другое.
Только за пределами ЕЭЗ, Швейцарии и Великобритании — в этих регионах Google ограничивает редактирование загруженного видео. Самой генерации reference-to-video это не касается. Учтите также, что видеореференсы схема принимает, но обрабатывает некорректно, поэтому отправляйте изображения.