Loading...
Loading...
더 빠르고 저렴한 Veo 3.1 등급. 텍스트·이미지·참조 이미지 기반 영상 생성과 시작·끝 프레임 전환을 지원합니다.
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)재생 시간 및 해상도별 예상 생성 비용입니다. 실행한 만큼만 요금이 청구됩니다.
Veo 3.1 Fast는 속도에 맞춰 튜닝된 Google의 Veo 3.1입니다. 같은 해상도, 같은 4/6/8초 길이, 같은 상시 네이티브 오디오를 더 빠르게 돌려주고 더 낮은 가격에 내놓습니다. 저희는 이를 google/veo-3.1-fast/text-to-video로 제공하며 출력 1초 단위로 청구합니다. 초당 $0.01이고, 오디오 트랙이 켜져 있으면 ×1.5입니다. 소리가 들어간 8초 720p 클립은 $0.12가 됩니다. 업로드할 것은 없습니다. prompt가 입력의 전부입니다.
대신 살아 움직이게 하고 싶은 스틸 이미지가 있으신가요? 그렇다면 Veo 3.1 Fast image-to-video 쪽입니다. 같은 모델에 시작 프레임 하나가 붙습니다. 여러 컷에 걸쳐 같은 얼굴과 같은 재킷이 살아남아야 하시나요? 그건 Veo 3.1 Fast reference-to-video입니다.
이 모델을 진지하게 제공하는 모든 프로바이더가 초 단위로 청구하며, 저희도 그렇습니다. 그래서 정직한 비교는 고정된 구성 하나뿐입니다. 2026년 8월 26일에 확인한 오디오가 켜진 720p 기준입니다.
| API 프로바이더 | 과금 방식 | 요율 (720p, 오디오 켬) | 8초 클립 | 저희 대비 |
|---|---|---|---|---|
| E2X (현재) | 초당 | $0.01/s ×1.5 오디오 | $0.12 | — |
| Google Gemini API | 초당 | $0.10/s | $0.80 | 저희 가격의 6.7배 |
| fal.ai | 초당 | $0.15/s | $1.20 | 저희 가격의 10배 |
| Replicate | 초당 | $0.15/s | $1.20 | 저희 가격의 10배 |
| E2X 정가 (할인 전) | 초당 | $0.10/s ×1.5 | $1.20 | 저희의 할인 전 요율 |
마지막 줄을 fal.ai, Replicate와 견주어 읽으십시오. 8초 클립에 대한 저희 정가는 $1.20으로, 정확히 그들이 받는 값입니다. 오늘 여러분이 내시는 것은 그 10분의 1이고, 동일한 request에서 Google 자사 API보다도 여전히 6.7배 낮습니다.
한 가지 미묘한 지점을 두고 예산을 잡으십시오. 720p → 1080p는 fal.ai와 Replicate에서 무료지만, Google은 그에 대해 초당 더 받습니다. 저희 쪽에서도 해상도는 배수이므로, 1080p 파이프라인을 확정하시기 전에 이 모델의 llms.txt에서 최신 수치를 가져오십시오.
가격과 제품 조건은 시간이 지나면서 변경될 수 있습니다. 구매를 결정하기 전에 각 프로바이더의 현재 가격을 확인하시기 바랍니다. Google의 Batch 또는 Flex 가격은 스케줄링, 가용성, 처리 조건이 다르기 때문에 표준 온디맨드 API request와 직접 동등하지 않으며, 따라서 이 비교에서는 제외했습니다. 이는 특정 범위에 한정된 비교이며, E2X가 모든 구성에서 세계에서 가장 저렴하다는 주장은 아닙니다.
대부분의 text-to-video 모델은 무음 MP4를 건네고 소리는 여러분 몫으로 남깁니다. Veo 3.1 Fast는 그러지 않습니다. Google의 API는 오디오를 네이티브로 생성하며 거기서는 이를 끌 수 없습니다. 동기화된 대사와 폴리, 룸 톤이 그림과 나란히 만들어져 프레임에 물려 있습니다. Google이 문서화한 예시 prompt 자체에 대사가 들어 있습니다.
그것이 호출 하나의 가치를 바꿉니다. "생선 장수가 상자를 쾅 내려놓으며 방금 들어왔어요, 5분 전에라고 외친다"라고 쓰시면 쾅 소리와 외침이 맞는 프레임에서 나옵니다. 나중에 음악을 입혀야 하는 무언극이 아니라요. 소셜 컷과 애니매틱에서는 후반 공정 하나가 통째로 사라집니다.
여러분이 고르실 수 있는 것들입니다.
has_sound, 기본값 true이며 ×1.5 배수를 발생시킵니다.한 클립의 상한은 8초입니다. 시퀀스는 여러 번의 호출입니다.
대시보드에서 key를 만들어 서버 쪽에 두시고 job을 전송하십시오. 필수 항목은 prompt뿐입니다.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/text-to-video",
"input": {
"prompt": "밤, 비에 젖어 번들거리는 오사카 골목을 따라가는 핸드헬드 샷. 라멘 가게 주인이 노렌을 들어 올리자 김이 쏟아져 나오고, 지나가는 자전거를 향해 외친다: \"오늘 마지막 한 그릇!\" 네온 반사가 물웅덩이 위에서 떨린다.",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
저희는 job ID를 돌려 드립니다. polling하시거나, 하지 않으셔도 됩니다.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/text-to-video",
input: {
prompt:
"일지에 무언가를 적고 있는 등대지기를 향한 느린 푸시인. 바람이 유리창을 덜컹거린다. 그녀가 중얼거린다, \"사흘째 밤, 아직도 신호가 없다.\" 등대 불빛이 4초마다 그녀의 얼굴을 훑고 지나간다.",
aspect_ratio: "9:16",
resolution: "720p",
duration: "6",
has_sound: "true",
seed: 41205,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
상태는 pending → processing → completed로 흐르거나 failed / cancelled에 도달합니다. 대신 webhookUrl을 보내 주시면 저희가 부르겠습니다. job당 4분 안팎을 잡으십시오. Google은 하한 11초와 피크 시간대 상한 6분을 게시하므로, 상한을 기준으로 설계하십시오.
schema 함정 하나. duration과 resolution은 문자열입니다. 8이 아니라 "8"입니다.
같은 가중치, 같은 초당 가격, 서로 다른 정문 셋입니다. 이미 가지고 계신 입력이 결정합니다.
| Endpoint | 8초 클립, 720p + 오디오 | 이럴 때 고르십시오 |
|---|---|---|
| Veo 3.1 Fast text-to-video | $0.12 | 글자 말고는 아무것도 없을 때 — 그리고 4초나 6초를 원할 때 |
| Veo 3.1 Fast image-to-video | $0.12 | 스틸 한 장이 있고 그것이 첫 프레임이 되어야 할 때 |
| Veo 3.1 Fast reference-to-video | $0.12 | 인물, 제품, 장소가 여러 컷에 걸쳐 동일해야 할 때 |
가격은 승부를 가르지 않으니 브리프를 따르십시오. 클라이언트가 이미 키 비주얼을 승인했다면, 그것을 시작 프레임으로 보내는 편이 산문으로 다시 묘사하는 것보다 낫습니다. 클립 여섯 개가 하나의 캠페인처럼 보여야 한다면 참조를 최대 세 장까지 실으십시오. 다만 reference-to-video는 8초를 강제하며 예외가 없다는 점은 알아 두십시오. 이 endpoint는 더 짧은 길이를 유지하므로, 스토리보드를 거친 모션으로 채우는 가장 저렴한 방법입니다. 저희가 운영하는 나머지는 text-to-video 카테고리와 전체 모델 카탈로그에 있습니다.
prompt를 사운드 믹스가 딸린 샷 리스트로 다루십시오. 형용사보다 바늘을 크게 움직이는 것이 네 가지입니다.
카메라 무브에 이름을 붙이십시오. "고정 와이드", "느린 달리 인", "핸드헬드 팔로우" — 모델은 이것들을 존중합니다. 모호한 프레이밍은 표류하고 확신 없는 움직임을 돌려줍니다.
대사는 인용부호 안에 쓰십시오. 짧은 줄로, 클립당 한두 개. 8초는 길지 않습니다. 바꿔 말한 의도("그가 격려하는 무언가를 말한다")는 웅얼거리는 채움말을 만들어 냅니다.
앰비언스를 요청하십시오. 양철 지붕에 떨어지는 비, 냉장고 소음, 멀리 지나가는 차량. 지정하지 않으시면 모델이 사운드 베드를 지어내고, 그것이 여러분 편집과 맞지 않을 수 있습니다.
빛이 무엇을 하고 있는지 말씀하십시오. 흐린 날 정오, 나트륨 가로등, 실내 등 하나. 조명이 Fast 티어 클립을 의도된 것으로 읽히게 할지, 렌더로 읽히게 할지를 결정합니다.
영어는 완전히 지원됩니다. Google은 여기서 다른 언어를 평가하지 않았습니다. 말하게 하고 싶은 언어로 대사를 쓰시되, 영어 밖에서는 편차가 더 클 것을 예상하십시오.
48시간 안에 다운로드하십시오. Google은 파일을 이틀 동안 보관합니다. 그들의 표현은 생성 후 2일 이내에 영상을 다운로드해야 한다는 것입니다. outputs[0].url을 읽는 바로 그 job 안에서 모든 출력을 여러분의 버킷으로 복사하십시오. CDN 링크는 아카이브가 아닙니다.
모든 프레임에 SynthID가 실립니다. Google의 감지되지 않는 watermark가 모든 Veo 출력에 적용되며, 그들의 검증 플랫폼에서 확인할 수 있습니다. 저희를 포함해 누구도 이를 끌 수 없습니다.
인물에 대한 지역 규정. EU와 영국, 스위스, MENA에서는 personGeneration이 allow_adult로 제한됩니다.
저희는 초 단위로 청구합니다. 출력 1초당 $0.01이며, 오디오가 활성화되면 1.5가 곱해집니다. 소리가 있는 8초 720p 클립은 $0.12, 6초는 $0.09, 4초는 $0.06입니다. 720p를 넘는 해상도에는 자체 배수가 붙습니다.
저희가 확인한 구성과 날짜 기준 — 8초, 720p, 오디오 켬, 2026년 8월 26일 — 으로는 그렇습니다. 저희가 $0.12, 그쪽이 $1.20입니다. 저희 자체 할인 전 정가가 바로 그 $1.20입니다. 이 격차는 할인이지 다른 제품이 아닙니다.
저희 schema는 has_sound를 노출하며 기본값을 true로 둡니다. Google 자사 Gemini API는 끄는 스위치를 아예 제공하지 않으므로, 오디오는 이 모델이 무엇인지의 일부로 여기시는 편이 낫습니다. 저희 image-to-video endpoint에서도 마찬가지입니다. ×1.5 가격 배수의 이유이기도 합니다.
한 번의 호출에서 8초입니다. 이 endpoint에서는 4초나 6초를 요청하실 수 있지만, 1080p와 4k는 온전한 8초를 요구합니다. 더 긴 시퀀스는 여러 job을 직접 이어 붙이시거나, reference-to-video로 룩을 고정하신다는 뜻입니다.
16:9와 9:16뿐이며, 24fps에 720p, 1080p 또는 4k입니다. 저희 기본값은 16:9와 720p입니다. 정사각형이나 4:5 옵션은 없으니 필요하시면 후반에서 크롭하십시오.
네. 모든 Veo 출력에는 Google의 감지되지 않는 출처 표식인 SynthID가 watermark로 실리며, 그들의 플랫폼을 통해 검증할 수 있습니다. 이를 끄는 파라미터를 제공하는 프로바이더는 없습니다.
저희는 job당 4분 안팎을 잡습니다. Google은 최소 11초, 피크 시 최대 6분을 게시하므로, 대량 작업에는 빡빡한 polling 루프보다 webhook을 쓰십시오.