Kembali ke Model

Veo 3.1 Fast

Tingkat Veo 3.1 yang lebih cepat dan murah, mencakup teks ke video, gambar ke video, referensi ke video, dan transisi frame awal-akhir.

Hargamulai $0.01/permintaan
Latensi~240 detik rata-rata
Resolusi720P/1080P/4K
Terbaik untukvideo, google, high-fidelity

Parameter

Estimasi Biaya

Anda menghemat 90% pada model ini
Biaya dasar per second$0.10
Diskon-90%
Total Anda$0.01
Anda menghemat $0.09 per permintaan

Masuk untuk menjalankan model

Output Preview

Ready

No output yet

Run the model to see generated results.

Contoh API— Parameter Saat Ini

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/veo-3.1-fast/image-to-video',
  'input': {}
}
)

Dapatkan Tugas— Tunggu hasil

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

Rincian Harga

Estimasi biaya per pembuatan berdasarkan durasi dan resolusi. Anda hanya membayar untuk yang Anda jalankan.

Durasi
720P
1080P
4K
4
$0.40
$0.40
$0.60
6
$0.60
$0.60
$0.90
8
$0.80
$0.80
$1.20
Jelajahi Alternatif

Model Terkait

Jelajahi model AI lainnya untuk Gambar ke Video

Lihat semua model

API Image-to-Video Veo 3.1 Fast di E2X

Serahkan satu gambar diam ke endpoint ini dan ia menjadi frame pertama sebuah shot yang bergerak dan bermusik. Kami menjalankan Veo 3.1 Fast milik Google sebagai google/veo-3.1-fast/image-to-video, dan kami menagih per detik output: $0.01 per detik, ×1.5 dengan trek audio aktif. Jadi klip 720p berdurasi 8 detik dengan suara adalah $0.12 — satu gambar plus satu prompt, tanpa repot mengurus referensi.

Tidak punya gambar awal untuk diolah? Kalau begitu Veo 3.1 Fast text-to-video adalah endpoint Anda — model yang sama, harga yang sama, hanya prompt, dan ia mengizinkan Anda turun ke 4 atau 6 detik. Kalau justru Anda punya beberapa gambar dan intinya menjaga satu karakter tetap konsisten lintas shot, pergilah ke Veo 3.1 Fast reference-to-video.

Penagihan per detik, dan apa artinya saat membayar

Tidak ada yang menjual model ini per video. Google, fal.ai, Replicate, dan kami semua mengukur output detik demi detik, jadi perbandingan yang adil harus mengunci konfigurasinya. Ini dia 8 detik, 720p, audio aktif, saat kami terakhir memeriksanya pada 26 Agustus 2026:

Provider APIPenagihanTarif (720p, audio aktif)Klip 8 detikvs. kami
E2X (saat ini)per detik$0.01/d ×1.5 audio$0.12—
Google Gemini APIper detik$0.10/d$0.806,7× harga kami
fal.aiper detik$0.15/d$1.2010× harga kami
Replicateper detik$0.15/d$1.2010× harga kami
Harga daftar E2X (sebelum diskon)per detik$0.10/d ×1.5$1.20tarif kami tanpa diskon

Renungkan baris paling bawah itu. Harga daftar kami tanpa diskon adalah $1.20 untuk klip 8 detik — angka yang identik dengan yang ditagihkan fal.ai dan Replicate. $0.12 yang Anda bayar sekarang adalah sepersepuluhnya, dan masih 6,7× di bawah API Google sendiri.

Resolusi memukul tagihan secara berbeda tergantung di mana Anda membeli. Naik dari 720p ke 1080p tidak menelan biaya tambahan di fal.ai atau Replicate; Google menagih tarif per detik yang lebih tinggi. Kami juga memperlakukan resolusi sebagai pengali, jadi bacalah angka terkini dari llms.txt model ini sebelum merencanakan proses 1080p.

Harga dan ketentuan produk dapat berubah sewaktu-waktu. Periksa harga terkini masing-masing provider sebelum mengambil keputusan pembelian. Harga Google Batch atau Flex tidak setara langsung dengan request API on-demand standar karena kondisi penjadwalan, ketersediaan, dan pemrosesannya berbeda; karena itu harga tersebut tidak disertakan dalam perbandingan ini. Ini adalah perbandingan dengan cakupan terbatas, bukan klaim bahwa E2X adalah opsi termurah di dunia dalam setiap konfigurasi.

Apa yang dilakukan model dengan frame Anda

Gambar Anda menjangkarkan frame satu. Semua setelahnya dihasilkan — pegang model mental itu, karena ia menjelaskan sekaligus kekuatannya dan cara gagalnya.

Kekuatannya: komposisi, palet, busana, dan set sudah selesai ditetapkan. Anda tidak sedang berjudi lewat prosa untuk mereproduksi foto produk yang sudah disetujui klien. Masukkan gambar diamnya, deskripsikan geraknya, dapatkan klip yang bermula persis di tempat gambar diam itu bermula.

Cara gagalnya: makin jauh klip itu berjalan dari frame tersebut, makin banyak ia berimprovisasi. Minta orbit 180° dalam delapan detik dan sisi jauh subjeknya adalah karangan. Minta push-in lambat plus satu putaran kepala, dan ia bertahan.

Audionya ikut menumpang. Google menghasilkannya secara native dan API mereka tidak punya sakelar untuk menonaktifkannya — dialog tersinkron, langkah kaki di tempat kaki menjejak, room tone di bawahnya. Sebuah foto diam masuk; sesuatu bersoundtrack keluar.

Persyaratan input yang kami terapkan

Batasan Google atas gambar sumber, terus terang:

  • Di bawah 8 MB. File yang lebih besar ditolak sebelum generasi dimulai.
  • 720p atau lebih tinggi. Naikkan skala aset kecil sebelum mengirimnya, bukan sesudahnya.
  • 16:9 atau 9:16. Persegi dan 4:5 tidak bisa — crop ulang lebih dulu.
  • Dapat dijangkau lewat HTTPS. Kami mengambil image_url saat job berjalan, bukan saat Anda mengirimkannya.

Yang terakhir itu menyebabkan lebih banyak kegagalan daripada sisanya digabungkan: tautan bertanda tangan yang berumur pendek kedaluwarsa di tengah antrean.

Request API: satu gambar, satu prompt

Dua field wajib di sini: prompt dan image_url.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/veo-3.1-fast/image-to-video",
    "input": {
      "prompt": "Barista menggeser cangkirnya ke depan dan uap mengepul naik. Push-in lambat ke arah crema. Desis mesin espresso, obrolan kafe lirih di belakang.",
      "image_url": "https://example.com/counter-shot.jpg",
      "aspect_ratio": "16:9",
      "resolution": "720p",
      "duration": "8",
      "has_sound": "true"
    }
  }'

Anda menerima job ID sebagai balasan. Lakukan polling, atau serahkan webhook kepada kami:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/veo-3.1-fast/image-to-video",
    input: {
      prompt:
        "Ia menurunkan kacamata hitamnya dan melirik ke luar bingkai sebelah kiri. Ujung roknya terangkat tertiup angin. Kamera terkunci, camar dan debur ombak di bawahnya.",
      image_url: "https://example.com/lookbook-03.jpg",
      aspect_ratio: "9:16",
      resolution: "720p",
      duration: "8",
      has_sound: "true",
      seed: 88117,
    },
  }),
}).then((r) => r.json());

const jobId = submitted.data.jobId;

while (true) {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") {
    console.log(job.data.outputs[0].url);
    break;
  }
  if (job.data.status === "failed") {
    throw new Error(job.data.error?.message || "Animation failed");
  }
  await new Promise((r) => setTimeout(r, 5000));
}

Job bergerak pending → processing → completed, atau berhenti di failed / cancelled. Kirim webhookUrl kalau Anda lebih suka tidak melakukan polling. Kami merencanakan kira-kira empat menit; rentang yang dipublikasikan Google adalah 11 detik pada kondisi terbaik, 6 menit pada jam sibuk.

Perhatikan tipenya: duration, resolution, dan has_sound adalah string. "true", bukan true.

Memilih endpoint Veo 3.1 Fast yang tepat

Tiga pintu menuju bobot yang identik, dengan harga per detik yang identik. Input Anda yang menentukan yang mana:

EndpointKlip 8d, 720p + audioPilih saat
Veo 3.1 Fast image-to-video$0.12Satu gambar diam yang sudah disetujui harus menjadi frame satu
Veo 3.1 Fast text-to-video$0.12Belum ada apa pun — dan Anda mau opsi 4d atau 6d
Veo 3.1 Fast reference-to-video$0.12Hingga tiga gambar harus mendefinisikan wajah, produk, atau tempat yang berulang

Pembagian jujurnya: pakai endpoint ini ketika gambar diam itu adalah frame pembukanya. Pakai reference-to-video ketika gambar Anda berperan sebagai panduan — aktor yang sama di lima adegan — dan terimalah bahwa ia mengunci Anda ke 8 detik. Sekadar menjajaki? Jangan unggah apa pun: text-to-video pada 4 detik berbiaya $0.06 dan melahap storyboard dengan cepat. Telusuri sisanya di kategori image-to-video atau di seluruh katalog model.

Deskripsikan geraknya, bukan gambarnya

Kesalahan umumnya adalah mendeskripsikan ulang gambar yang baru saja Anda unggah. Model bisa melihatnya. Setiap kata yang dihabiskan untuk "seorang perempuan bermantel merah di dermaga" adalah kata yang tidak dihabiskan untuk apa yang terjadi berikutnya — dan itu mengundang penafsiran ulang atas frame yang sudah Anda kunci.

Tulislah perubahannya. Tiga kebiasaan memikul sebagian besar kualitasnya:

Berikan satu gerak utama. Satu putaran kepala, satu dorongan kamera, satu pintu terbuka. Tumpuk empat aksi ke dalam delapan detik dan tidak satu pun terbaca.

Sebutkan di mana kamera berada dan apakah ia bergerak. "Terkunci", "dolly in lambat", "handheld melayang ke kanan". Diam soal ini menghasilkan layangan tanpa arah.

Beri musiknya dengan lantang. Sebutkan ambiensnya dan setiap baris dialog dalam tanda kutip. Audionya dihasilkan entah Anda merencanakannya atau tidak, jadi rencanakanlah.

Prompt dalam bahasa Inggris didukung sepenuhnya. Google belum mengevaluasi bahasa lain untuk model ini, jadi pertahankan instruksinya dalam bahasa Inggris bahkan ketika baris ucapannya dalam bahasa lain.

Sebelum Anda merilis

Dua hari. Itu jendela unduhan Anda. Google menyimpan video yang dihasilkan selama dua hari — kalimat mereka: Anda harus mengunduh video Anda dalam 2 hari sejak dibuat. Tarik outputs[0].url ke penyimpanan Anda sendiri di jalur kode yang sama yang membacanya. Tautan yang dikembalikan bersifat sementara.

SynthID ada di setiap frame. Google memberi watermark pada semua output Veo dengan penanda provenance tak kasatmatanya, yang bisa diverifikasi lewat platform mereka. Tidak ada provider yang bisa menonaktifkannya, termasuk kami.

Manusia di wilayah yang diatur. Di seluruh UE, Inggris, Swiss, dan MENA, personGeneration dibatasi pada allow_adult.

Samakan aspect ratio dengan sumber Anda. Gambar diam 16:9 dengan permintaan 9:16 memaksa model mengarang bagian tepinya.

Pertanyaan yang kami terima

Berapa biaya Veo 3.1 Fast image-to-video di E2X?

Kami mengenakan biaya $0.01 per detik video yang dihasilkan, dikalikan 1,5 ketika audio aktif. Itu membuat klip 720p 8 detik dengan suara menjadi $0.12. Resolusi lebih tinggi menerapkan pengalinya sendiri, jadi periksa halaman model versi live sebelum menganggarkan batch 1080p atau 4k.

Apa saja persyaratan untuk gambar input?

Di bawah 8 MB, minimal 720p, dan salah satu dari 16:9 atau 9:16. Kami mengambilnya dari image_url yang Anda berikan, jadi tautannya harus masih bisa diakses saat job berjalan — URL bertanda tangan yang kedaluwarsa adalah kegagalan paling umum di sini.

Bisakah saya menganimasikan lebih dari satu gambar dalam satu call?

Tidak di endpoint ini — ia menerima tepat satu image_url. Kalau beberapa gambar perlu memandu sebuah generasi, pakai reference-to-video, yang menerima array berisi hingga tiga.

Apakah video yang dihasilkan menyertakan suara?

Ya, dan itu alasan utama meraih model ini. Google memproduksi dialog, efek, dan ambiens yang tersinkron secara native, tanpa sakelar mati di API mereka sendiri. Schema kami memaparkan has_sound, dengan default true, yang membawa pengali ×1.5.

Berapa panjang klip yang dihasilkan?

Hingga 8 detik. Endpoint ini menerima 4, 6, atau 8, tetapi output 1080p dan 4k mensyaratkan 8 detik penuh. Tidak ada satu pun di keluarga Veo 3.1 Fast yang melampaui 8 detik dalam satu call.

Apakah ada watermark pada outputnya?

Setiap video Veo membawa SynthID, watermark provenance AI tak kasatmata milik Google, dan ia bisa diperiksa di platform verifikasi mereka. Tidak ada yang menawarkan cara mematikannya.

Seberapa cepat satu proses generasi?

Rencanakan sekitar empat menit per job. Angka resmi Google menempatkan lantainya di 11 detik dan langit-langit jam sibuknya di 6 menit, jadi webhook mengalahkan loop polling begitu Anda menjalankan volume yang sungguhan.