Loading...
Loading...
텍스트 프롬프트나 참조 이미지로 영상 클립을 만드는 구글 비디오 모델 제품군. 빠른 결과물에 최적화되어 있습니다.
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)재생 시간 및 해상도별 예상 생성 비용입니다. 실행한 만큼만 요금이 청구됩니다.
Omni Flash는 Google의 gemini-omni-flash-preview입니다. Veo가 아니라 Gemini 계열의 비디오 모델이고, DeepMind 자신의 소개는 한 문장입니다. "Gemini Omni를 Nano Banana의 비디오판이라고 생각하십시오." 저희는 그 reference-to-video capability를 google/omni-flash/reference-to-video로 운영하며 완성된 720p 영상 1초마다 $0.10을 청구합니다. 따라서 기본값인 8초 클립은 오디오를 포함해 $0.80입니다.
단위를 눈여겨보십시오. 여기서 클립을 정액으로 파는 곳은 없으므로, 비교하시는 어떤 수치든 렌더링하실 길이를 곱하셔야 합니다.
대본은 있는데 컷으로 가져갈 이미지가 없으신가요? 그렇다면 Veo 3.1 Fast text-to-video가 원하시는 endpoint입니다. prompt 하나에서 시작하고, 저희 플랫폼에서는 비용이 극적으로 낮습니다. 아래에서 이 이야기를 솔직하게 다시 하겠습니다.
2026년 8월 26일에 확인한, 이 모델을 호출하실 수 있는 다른 곳들에 대한 저희 위치입니다.
| API 프로바이더 | 초당 (720p) | 8초 클립 | E2X 대비 |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | 저희가 23% 저렴 |
| Atlas Cloud | $0.135 | $1.08 | 저희가 26% 저렴 |
| Runware | $0.10 | $0.80 | 동일 |
| Google Gemini API | $0.10 | $0.80 | 동일 |
가격과 제품 조건은 시간이 지나면서 변경될 수 있습니다. 구매를 결정하기 전에 각 프로바이더의 현재 가격을 확인하시기 바랍니다. Google의 Batch 또는 Flex 가격은 스케줄링, 가용성, 처리 조건이 다르기 때문에 표준 온디맨드 API request와 직접 동등하지 않으며, 따라서 이 비교에서는 제외했습니다. 이는 특정 범위에 한정된 비교이며, E2X가 모든 구성에서 세계에서 가장 저렴하다는 주장은 아닙니다.
포장하지 않겠습니다. 이 모델에서 저희는 Google의 요율을 밑도는 것이 아니라 맞추고 있으며, 절감이 실재하는 상대는 fal.ai와 Atlas뿐입니다. 참조 이미지는 거의 티가 나지 않습니다. Google은 이미지 하나를 2,040 token으로 계산하므로 세 장이면 1센트 남짓입니다. 청구서를 움직이는 필드는 duration입니다.
이 endpoint의 요점은 연속성입니다. 모델에 피사체를 건네시고 — 인물, 제품, 세트, 룩 — 그것이 촬영된 적 없는 장면을 묘사하시면, 피사체가 그 여정을 살아남습니다.
참조는 하나가 아니라 여러 장을 붙이실 수 있습니다. Google이 공개한 예시는 여섯 장까지 갑니다. 공식적인 최대치는 문서화된 바 없고 서드파티 수치들은 서로 어긋나므로, 저희는 숫자를 적지 않겠습니다. 몇 장 수준으로 설계하시고 여러분의 상한을 직접 시험해 보십시오.
오디오는 그림에 덧붙는 것이 아니라 함께 생성됩니다. 동작에 동기화되고, 같은 prompt에서 조종하십니다. 양철 지붕에 떨어지는 비와 낮은 룸 톤을 요청하시면 그것이 돌아옵니다. 나중에 편집할 별도의 오디오 트랙은 없습니다.
천장은 10초입니다. 저희 duration enum은 4, 6, 8, 10을 노출합니다. Google의 모델은 3초에서 10초까지 돌아가고 10초는 단단한 상한입니다. 확장 endpoint도, 보간도 없습니다. 그보다 길면 여러분의 편집기에서 이어 붙이는 작업이고, 컷 사이의 연속성은 여러분 몫이 됩니다.
720p, 24 fps, 목록은 그것으로 끝입니다. 저희 resolution 필드가 1080p와 4k 값을 담고 있고 Google도 더 높은 해상도를 곧 제공한다고 적어 두었지만, 오늘 이 모델이 돌려주는 것은 720p입니다. 기본값에 두십시오. 여기서 1080p를 광고하는 프로바이더 페이지는 Google 자신의 문서보다 앞서 나간 것입니다.
표준 클립 하나에 처리 시간 약 45초를 예상하십시오. eachlabs에서 측정한 p50이지 공식 수치가 아니므로, 약속의 근거가 아니라 계획의 근거로 쓰십시오.
필수 필드는 둘입니다. image_urls와 prompt. 대시보드에서 key를 생성해 여러분이 통제하는 서버에 두시고 job을 전송하십시오.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "이미지 1의 스니커즈가 젖은 아스팔트 위에 놓여 있고 뒤로 버스가 출발한다. 느린 푸시인. 주변 교통 소음과 가랑비, 음악 없음.",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
응답에는 job ID가 실려 있습니다. 영상은 몇 분이 걸리니 천천히 polling하시거나, polling을 건너뛰고 submit body에 webhookUrl을 넘기십시오.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"참조 이미지 속 여자가 야시장을 걸어가고, 네온 간판이 그녀의 재킷에 반사된다. 핸드헬드. 군중의 웅성거림과 멀리서 나는 튀김 소리.",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
상태는 pending → processing → completed로 움직이거나 failed 또는 cancelled에 도달합니다. 프로그래밍 방식으로 읽으시는 편이 좋다면 최신 schema와 가격은 기계 판독용 명세에 있습니다.
의미 있는 비교이고, 이 페이지에 유리하지 않습니다.
| 모델 | 저희 가격 (8초, 720p, 오디오) | 이럴 때 고르십시오 |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | 참조 여럿이 일관되어야 하거나, 10초 클립이 필요할 때 |
| Veo 3.1 Fast reference-to-video | $0.12 | 참조 최대 세 장, 8초, 그리고 더 낮은 청구서를 원할 때 |
| Veo 3.1 Fast image-to-video | $0.12 | 움직이게 하고 싶은 스틸 프레임 하나가 있을 때 |
| Veo 3.1 Fast text-to-video | $0.12 | 소스 자료가 아예 없을 때 |
저희 플랫폼에서 Veo 3.1 Fast는 Omni Flash의 몇 분의 일 값입니다. 게다가 Omni Flash가 현재 하지 못하는 1080p와 4K에 닿습니다. Google 자사 정가에서는 둘 다 720p 기준 초당 $0.10으로 같습니다. 격차를 여는 것은 저희의 할인입니다. 그러니 Veo Fast에서 시작하십시오. 참조 세 장 상한이 여러분을 막고 있을 때, 그 2초가 더 필요할 때, 또는 "비디오판 Nano Banana"라는 틀 뒤에 있는 영상 편집 거동을 원하실 때 여기로 돌아오십시오. 더 많은 선택지는 reference-to-video 카테고리에 있고, 모델 카탈로그 전체는 한 페이지입니다.
Public Preview라는 말은 거친 부분이 감춰지지 않고 문서화되어 있다는 뜻입니다. 만들기 전에 읽으십시오.
이야기가 아니라 컷을 쓰십시오. 피사체 하나, 카메라 무브 하나, 조명 조건 하나. 그다음 그것이 어떤 소리를 내는지 말씀하십시오. 오디오가 같은 prompt에서 나오고, 침묵도 소리 내어 하시는 선택이기 때문입니다.
한 장보다 많이 들어갈 때는 첨부에 라벨을 붙이십시오. "이미지 1은 병, 이미지 2는 라벨 클로즈업"처럼요. 어느 참조가 주인공인지 모델에 알려 줄 다른 방법은 없습니다. 카메라 언어는 담백하게 유지하십시오. "느린 푸시인", "고정", "핸드헬드 팔로우"가 촬영 기법을 늘어놓은 한 문단을 이깁니다.
모든 클립에는 SynthID watermark가 실리고 — 보는 사람에게는 보이지 않지만 프로그래밍 방식으로는 탐지됩니다 — C2PA 콘텐츠 자격 증명이 기본으로 첨부됩니다. 저희를 포함해 이 모델을 운영하는 어떤 프로바이더도 이를 끌 수 없습니다. 고객 계약이 라벨이 붙은 AI 자산을 금지한다면 통합 전에 정리하십시오.
완료 핸들러 안에서 출력물을 여러분의 스토리지로 다시 호스팅하십시오. 결과 URL은 영구 주소가 아니며, 가져올 수 없는 영상은 값을 두 번 치르는 영상입니다.
Google의 gemini-omni-flash-preview로, Veo 계열이 아니라 Gemini 계열의 영상 생성·편집 모델입니다. DeepMind는 이를 "Nano Banana, 다만 비디오판"이라고 설명합니다. 무게 중심이 참조를 일관되게 나르는 것과 기존 푸티지를 편집하는 데 실려 있는 반면, Veo는 맨바닥에서의 시네마틱 생성을 겨냥합니다. 현재 Public Preview 상태입니다.
$0.80입니다. 저희는 720p 출력 1초당 $0.10을 청구하므로 길이가 청구서를 좌우합니다. 4초 클립은 $0.40, 최대치인 10초는 $1.00입니다. 2026년 8월 26일 확인 시점의 저희 요율입니다.
한 장보다는 많고, Google이 문서화한 예시는 여섯 장까지 갑니다. 다만 공식적인 최대치는 공개되어 있지 않습니다. Google 밖의 출처들은 서로 다른 상한을 인용하며 어긋나므로, 저희는 검증할 수 없는 숫자를 되풀이하지 않겠습니다. 특정 개수를 전제로 설계하시기 전에 여러분의 페이로드로 직접 시험해 보십시오.
오늘은 아닙니다. 24 fps의 720p를 출력하며, Google은 더 높은 해상도를 곧 제공한다고 적어 두었습니다. 지금 1080p나 4K가 필요하시면 Veo 3.1 Fast가 둘 다에 닿습니다.
대부분의 작업에는 Veo 3.1 Fast입니다. 저희 플랫폼에서 오디오가 있는 8초 클립이 여기 $0.80 대비 $0.12이고, 4K까지 갑니다. 참조 이미지가 세 장보다 많이 필요하거나, 10초 길이가 필요하거나, 그 영상 편집 거동이 필요하실 때 Omni Flash를 고르십시오.
네, 네이티브로, 그리고 화면 속 동작과 동기화되어 있습니다. 같은 prompt에서 연출하십니다. 앰비언스와 효과음에 이름을 붙이시거나 음악을 요청하십시오. 오디오는 API를 통해 사후에 편집할 수 없으므로, 변경은 곧 재렌더링을 뜻합니다.
네. 모든 출력에 보는 사람은 볼 수 없지만 탐지 도구는 읽을 수 있는 SynthID watermark가 실리고, 여기에 더해 C2PA 콘텐츠 자격 증명이 기본으로 켜져 있습니다. 둘 중 어느 것도 비활성화하는 파라미터를 제공하는 프로바이더는 없습니다.
EEA와 스위스, 영국 바깥에서만 가능합니다. Google이 그 지역에서는 업로드 영상 편집을 제한합니다. Reference-to-video 생성 자체는 영향을 받지 않습니다. 또한 비디오 참조는 schema가 받아들이지만 올바르게 처리되지 않으므로, 이미지를 보내셔야 한다는 점도 유념하십시오.