Loading...
Loading...
더 빠르고 저렴한 Veo 3.1 등급. 텍스트·이미지·참조 이미지 기반 영상 생성과 시작·끝 프레임 전환을 지원합니다.
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)재생 시간 및 해상도별 예상 생성 비용입니다. 실행한 만큼만 요금이 청구됩니다.
같은 얼굴, 같은 재킷, 같은 가게 앞이 클립 한 묶음 전체에 걸쳐 살아남아야 할 때 쓰시는 endpoint입니다. 저희는 Google의 Veo 3.1 Fast를 google/veo-3.1-fast/reference-to-video로 운영하며, 참조 이미지 최대 세 장을 담은 image_urls 배열을 받고 초 단위로 청구합니다. 초당 $0.01이고 오디오가 켜져 있으면 ×1.5입니다. 여기서는 모든 클립이 8초이므로, 소리가 있는 720p에서 가격은 클립당 $0.12입니다.
이미지 한 장이면 충분하고 클립이 더 짧으면 도움이 되시겠습니까? Veo 3.1 Fast image-to-video를 쓰십시오. 시작 프레임 하나를 움직이게 하고 4초나 6초도 내어 줍니다. 업로드할 것이 아예 없으신가요? Veo 3.1 Fast text-to-video는 prompt만으로 돌아갑니다.
이 모델에서 초 단위 계량은 보편적입니다. Google도, fal.ai도, Replicate도 그렇게 하고 저희도 그렇습니다. reference-to-video는 8초로 고정되어 있으므로, 아래 표가 유일하게 의미 있는 구성입니다. 2026년 8월 26일에 확인한 오디오가 있는 720p 기준 수치입니다.
| API 프로바이더 | 과금 방식 | 요율 (720p, 오디오 켬) | 8초 클립 | 저희 대비 |
|---|---|---|---|---|
| E2X (현재) | 초당 | $0.01/s ×1.5 오디오 | $0.12 | — |
| Google Gemini API | 초당 | $0.10/s | $0.80 | 저희 가격의 6.7배 |
| fal.ai | 초당 | $0.15/s | $1.20 | 저희 가격의 10배 |
| Replicate | 초당 | $0.15/s | $1.20 | 저희 가격의 10배 |
| E2X 정가 (할인 전) | 초당 | $0.10/s ×1.5 | $1.20 | 저희의 할인 전 요율 |
마지막 줄을 두 마켓플레이스와 견주어 읽으십시오. 저희 정가는 8초 클립에 $1.20으로, 정확히 fal.ai와 Replicate가 청구하는 값입니다. 오늘 여러분은 그 10분의 1을 내시고, 그러고도 Google 자사 API보다 6.7배 아래에 떨어집니다. 이 격차는 동일한 모델에 걸린 현행 할인이지, 기능을 덜어 낸 티어가 아닙니다.
1080p는 의도적으로 가격을 매기십시오. fal.ai와 Replicate는 720p → 1080p 단계를 추가 비용 없이 포함하지만 Google은 더 높은 초당 요율을 받습니다. 저희 쪽에서도 해상도는 배수입니다. 현재 수치는 이 모델의 llms.txt에 있습니다.
가격과 제품 조건은 시간이 지나면서 변경될 수 있습니다. 구매를 결정하기 전에 각 프로바이더의 현재 가격을 확인하시기 바랍니다. Google의 Batch 또는 Flex 가격은 스케줄링, 가용성, 처리 조건이 다르기 때문에 표준 온디맨드 API request와 직접 동등하지 않으며, 따라서 이 비교에서는 제외했습니다. 이는 특정 범위에 한정된 비교이며, E2X가 모든 구성에서 세계에서 가장 저렴하다는 주장은 아닙니다.
Google의 제한은 명시적입니다. "콘텐츠를 안내하기 위해 최대 세 장의 참조 이미지를 사용하십시오"라고 되어 있고, 그들의 schema에서는 "스타일 및 콘텐츠 참조로 사용할 최대 세 장의 이미지"로 설명합니다. 셋입니다. 네 장째는 모델이 받아들이는 범위 바깥입니다.
그 예산이 결정을 강요하는데, 이 endpoint에서 흥미로운 부분이 바로 그것입니다. 세 자리를 표류하면 안 되는 것에 쓰십시오. 캠페인 촬영이라면 보통 이렇게 갑니다. 진행자의 깨끗한 인물 사진 하나, 의상이 보이는 전신 컷 하나, 장소 사진 하나. 그러면 세트 안의 모든 클립이 같은 사람, 같은 옷, 같은 장소로 돌아옵니다. 여러분은 prompt만 바꾸십니다.
제품 작업은 다르게 나뉩니다. 오브젝트의 두 각도, 브랜드 컬러 처리 프레임 하나. 원리는 같습니다. 참조가 정체성을 나르고, prompt가 동작을 나릅니다.
이것은 image-to-video의 일이 아닙니다. 거기서는 여러분의 이미지가 곧 첫 프레임입니다. 여기서 참조는 안내이고, 오프닝 프레임은 그것들로부터 생성됩니다. 정확히 승인된 스틸에서 시작하는 클립이 필요하신가요? 그건 다른 endpoint입니다.
Google의 규칙은 이렇게 읽힙니다. duration은 "확장이나 참조 이미지를 사용할 때, 또는 1080p 및 4k 해상도에서 '8'이어야 합니다." 참조 이미지가 그 목록에 있으므로, 다른 두 endpoint가 제공하는 4초와 6초 선택지는 여기 존재하지 않습니다. 저희 schema는 여전히 duration enum을 보여 주지만, 이 capability에서 유효한 값은 "8" 하나뿐입니다.
그에 맞춰 예산을 잡으십시오. 클립 여섯 개짜리 시퀀스는 출력 48초이고, 저희에게서는 $0.72, fal.ai나 Replicate에서는 $7.20입니다.
필수 필드: prompt와 image_urls.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/reference-to-video",
"input": {
"prompt": "이미지 1의 여자가 이미지 2의 코트를 입고, 이미지 3의 로비로 걸어 들어와 빗물을 털어 낸다. 그녀가 올려다보며 말한다: \"기다렸구나.\" 따뜻한 텅스텐 조명, 대리석에 울리는 소리.",
"image_urls": [
"https://example.com/talent-portrait.jpg",
"https://example.com/wardrobe-coat.jpg",
"https://example.com/lobby-set.jpg"
],
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
전송하면 job ID가 돌아옵니다. polling하시거나 webhook을 등록하십시오.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/reference-to-video",
input: {
prompt:
"이미지 1의 마스코트가 이미지 2의 조리대 위로 폴짝 뛰어올라 컵을 쓰러뜨리고 얼어붙는다. 삑삑거리는 발소리, 도자기 부딪히는 소리, 그리고 정적.",
image_urls: [
"https://example.com/mascot-turnaround.png",
"https://example.com/kitchen-set.jpg",
],
aspect_ratio: "9:16",
resolution: "720p",
duration: "8",
has_sound: "true",
seed: 60411,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
상태는 pending → processing → completed로 가거나 failed / cancelled에서 끝납니다. job당 4분 안팎을 계획하십시오. Google의 공식 창은 하한 11초, 피크 시 6분입니다. 생성 결과들이 서로 운을 맞추기를 원하시면 세트 전체에 같은 seed를 재사용하십시오.
동일한 가중치, 동일한 초당 가격입니다. endpoint는 여러분 입력의 형태가 고릅니다.
| Endpoint | 길이 선택지 | 8초 클립, 720p + 오디오 | 이럴 때 고르십시오 |
|---|---|---|---|
| Veo 3.1 Fast reference-to-video | 8초 전용 | $0.12 | 이미지 최대 3장이 여러 클립에 걸쳐 얼굴·의상·장소를 고정해야 할 때 |
| Veo 3.1 Fast image-to-video | 4 / 6 / 8초 | $0.12 | 스틸 하나가 말 그대로 첫 프레임이 되어야 할 때 |
| Veo 3.1 Fast text-to-video | 4 / 6 / 8초 | $0.12 | prompt만 있고 업로드할 것이 없을 때 |
| Omni Flash reference-to-video | — | $0.80 (기본 구성) | 다른 제품군. Veo의 결이 원하는 것이 아닐 때 |
저희는 여러분이 돈을 덜 쓰시길 바랍니다. 이미지 한 장으로 일이 된다면 image-to-video가 같은 가격이면서 4초와 6초 클립을 열어 줍니다. 4초 버전은 $0.06으로, 여기서 내시는 고정 8초의 절반입니다. 여러 클립에 걸친 일관성이 실제 요구사항일 때 이 endpoint로 오십시오. 다른 것들이 못 하는 단 하나가 그것이기 때문입니다. 이 카테고리의 나머지는 reference-to-video 아래에 있고, 그 밖의 모든 것은 모델 카탈로그에 있습니다.
모델은 라벨 없는 배열을 받습니다. 페이로드 안에는 두 번째 자리가 두 번째 캐릭터가 아니라 의상이었다고 말해 주는 것이 아무것도 없습니다. 그러니 prompt에서 말씀하십시오.
번호로 지시하는 것이 통합니다. "이미지 1의 여자", "이미지 2의 코트", "이미지 3의 로비". 단어 몇 개면, 뒤섞인 출력을 만들어 내던 모호함의 대부분이 사라집니다.
습관 세 가지 더.
참조마다 역할을 하나씩 주십시오. 인물과 제품, 방이 한꺼번에 담긴 복잡한 사진은 무엇을 신경 쓰셨는지 모델더러 추측하라는 것입니다. 바싹 크롭하십시오.
정체성을 말로 한 번 더 쓰십시오. "같은 짧은 은발, 같은 둥근 안경"은 참조가 보여 주는 것을 보강합니다. 값싼 보험입니다.
대사를 적어 쓰십시오. Google은 오디오를 네이티브로 생성하고 그들의 API에는 끄는 스위치가 없으므로, 소리는 어느 쪽이든 발생합니다. 말소리, 효과음, 앰비언스요. 대사를 인용하시면 맞는 프레임에 떨어집니다.
Google은 영어를 완전히 지원하고 이 모델에 대해 다른 언어는 평가하지 않았으므로, 지시문 텍스트는 영어로 유지하십시오. 인용된 대사는 장면이 필요로 하는 어떤 언어여도 됩니다.
다운로드까지 이틀. 생성된 영상에 대한 Google의 보관 기간은 이틀입니다. "생성 후 2일 이내에 영상을 다운로드해야 합니다." 일주일에 걸쳐 만드는 클립 스무 개짜리 캠페인이라면 이것은 각주가 아니라 아키텍처 결정입니다. job이 완료되는 즉시 outputs[0].url을 여러분의 스토리지로 복사하십시오.
모든 출력에 SynthID. Google의 감지되지 않는 watermark가 모든 Veo 영상에 적용되며 그들의 플랫폼을 통해 검증할 수 있습니다. 어떤 프로바이더도 이를 비활성화할 수 없습니다.
인물 생성은 지역 제한이 있습니다. EU와 영국, 스위스, MENA에서 personGeneration은 allow_adult로 제한됩니다.
참조 세트를 버전 관리하십시오. 일관성은 매번 바이트 단위로 동일한 참조를 보내는 데 달려 있습니다. batch 중간에 다시 내보낸 인물 사진으로 바꿔 넣으면 티가 납니다.
저희는 출력 1초당 $0.01을 청구하고, 오디오가 켜져 있으면 ×1.5입니다. 이 endpoint는 8초로 고정되어 있으므로 소리가 있는 720p 클립은 $0.12입니다. 더 높은 해상도에는 자체 배수가 붙으니, 1080p batch를 계획하시기 전에 실시간 모델 페이지를 확인하십시오.
최대 세 장입니다. Google 문서는 콘텐츠를 안내하기 위해 최대 세 장의 참조 이미지를 사용할 수 있다고 말하며, 그들의 schema는 이를 스타일 및 콘텐츠 참조로 설명합니다. 더 적어도 괜찮고, 두 장이 흔합니다.
참조 이미지가 관여할 때마다 Google이 8초를 요구하기 때문입니다. 1080p와 4k를 다루는 규칙과 같습니다. 4초나 6초가 필요하신가요? 대신 image-to-video나 text-to-video endpoint를 쓰십시오. 같은 모델, 같은 초당 가격입니다.
Image-to-video는 이미지 하나를 말 그대로 오프닝 프레임으로 만듭니다. Reference-to-video는 이미지 최대 세 장을 정체성과 의상, 스타일 또는 장소에 대한 안내로 받은 뒤, 그것들과 일관된 오프닝 프레임을 생성합니다. 특정한 첫 프레임보다 여러 클립에 걸친 일관성이 더 중요할 때 참조를 쓰십시오.
네. Google은 대사와 효과음, 앰비언스를 네이티브로 생성하며 자사 API에는 이를 비활성화할 방법이 없습니다. 저희는 기본값 true로 has_sound를 노출하고, 그 설정이 ×1.5 가격 배수를 적용합니다.
모든 Veo 출력에는 AI 생성 콘텐츠를 위한 Google의 감지되지 않는 표식인 SynthID가 실리며, 그들의 플랫폼에서 검증할 수 있습니다. 저희를 포함해 어떤 프로바이더도 이를 끌 수 없습니다.
저희는 대략 4분을 잡습니다. Google은 최소 11초, 피크 시 최대 6분을 게시하므로, 클립 세트 전체를 돌리실 때는 polling 루프를 열어 두시는 대신 webhookUrl을 쓰십시오.