Kembali ke Model

Veo 3.1 Fast

Tingkat Veo 3.1 yang lebih cepat dan murah, mencakup teks ke video, gambar ke video, referensi ke video, dan transisi frame awal-akhir.

Hargamulai $0.01/permintaan
Latensi~240 detik rata-rata
Resolusi720P/1080P/4K
Terbaik untukvideo, google, high-fidelity

Parameter

Estimasi Biaya

Anda menghemat 90% pada model ini
Biaya dasar per second$0.10
Diskon-90%
Total Anda$0.01
Anda menghemat $0.09 per permintaan

Masuk untuk menjalankan model

Output Preview

Ready

No output yet

Run the model to see generated results.

Contoh API— Parameter Saat Ini

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/veo-3.1-fast/reference-to-video',
  'input': {}
}
)

Dapatkan Tugas— Tunggu hasil

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

Rincian Harga

Estimasi biaya per pembuatan berdasarkan durasi dan resolusi. Anda hanya membayar untuk yang Anda jalankan.

Durasi
720P
1080P
4K
4
$0.40
$0.40
$0.60
6
$0.60
$0.60
$0.90
8
$0.80
$0.80
$1.20
Jelajahi Alternatif

Model Terkait

Jelajahi model AI lainnya untuk Referensi ke Video

Lihat semua model

API Reference-to-Video Veo 3.1 Fast di E2X

Inilah endpoint yang Anda pakai ketika wajah yang sama, jaket yang sama, atau muka toko yang sama harus bertahan di sekumpulan klip. Kami menjalankan Veo 3.1 Fast milik Google sebagai google/veo-3.1-fast/reference-to-video, ia menerima array image_urls berisi hingga tiga gambar referensi, dan kami menagih per detik: $0.01 per detik, ×1.5 dengan audio aktif. Setiap klip di sini berdurasi 8 detik, jadi harganya $0.12 per klip pada 720p dengan suara.

Satu gambar sudah cukup, dan klip yang lebih pendek akan membantu? Pakai Veo 3.1 Fast image-to-video — ia menganimasikan satu frame awal dan akan memberi Anda 4 atau 6 detik. Sama sekali tidak ada yang perlu diunggah? Veo 3.1 Fast text-to-video berjalan hanya dengan sebuah prompt.

Berapa biaya konsistensi per klip

Pengukuran per detik bersifat universal untuk model ini — Google, fal.ai, dan Replicate semuanya melakukannya, dan begitu pula kami. Karena reference-to-video terkunci di 8 detik, tabel di bawah adalah satu-satunya konfigurasi yang penting. Angka diperiksa pada 26 Agustus 2026, pada 720p dengan audio:

Provider APIPenagihanTarif (720p, audio aktif)Klip 8 detikvs. kami
E2X (saat ini)per detik$0.01/d ×1.5 audio$0.12—
Google Gemini APIper detik$0.10/d$0.806,7× harga kami
fal.aiper detik$0.15/d$1.2010× harga kami
Replicateper detik$0.15/d$1.2010× harga kami
Harga daftar E2X (sebelum diskon)per detik$0.10/d ×1.5$1.20tarif kami tanpa diskon

Baca baris terakhir itu berhadapan dengan dua marketplace tersebut. Harga daftar kami adalah $1.20 untuk klip 8 detik — persis yang ditagihkan fal.ai dan Replicate. Anda membayar sepersepuluhnya hari ini, dan itu masih mendarat 6,7× di bawah API Google sendiri. Jarak itu adalah diskon yang sedang berjalan atas model yang identik, bukan tier yang dipreteli.

Hitung harga 1080p dengan sengaja: fal.ai dan Replicate menyertakan lompatan 720p → 1080p tanpa biaya tambahan, sementara Google menagih tarif per detik yang lebih tinggi. Resolusi juga merupakan pengali di sisi kami — angka terkininya ada di llms.txt model ini.

Harga dan ketentuan produk dapat berubah sewaktu-waktu. Periksa harga terkini masing-masing provider sebelum mengambil keputusan pembelian. Harga Google Batch atau Flex tidak setara langsung dengan request API on-demand standar karena kondisi penjadwalan, ketersediaan, dan pemrosesannya berbeda; karena itu harga tersebut tidak disertakan dalam perbandingan ini. Ini adalah perbandingan dengan cakupan terbatas, bukan klaim bahwa E2X adalah opsi termurah di dunia dalam setiap konfigurasi.

Tiga gambar, dan bukan yang keempat

Batas Google eksplisit: "Gunakan hingga tiga gambar referensi untuk memandu kontennya", yang dijelaskan dalam schema mereka sebagai "Hingga tiga gambar untuk dipakai sebagai referensi gaya dan konten." Tiga. Yang keempat berada di luar apa yang diterima model.

Anggaran itu memaksa sebuah keputusan, dan itulah bagian menarik dari endpoint ini. Anda membelanjakan tiga slot untuk apa pun yang tidak boleh melenceng. Sebuah pemotretan kampanye biasanya berjalan begini: satu potret bersih sang presenter, satu foto seluruh badan yang memperlihatkan busananya, satu foto lokasinya. Setiap klip dalam set itu lalu kembali dengan orang yang sama, pakaian yang sama, tempat yang sama — Anda hanya mengubah prompt-nya.

Pekerjaan produk terbagi berbeda: dua sudut objeknya, satu frame perlakuan warna mereknya. Prinsip yang sama. Referensi membawa identitas, prompt membawa aksi.

Ini bukan tugas image-to-video. Di sana, gambar Anda adalah frame satu. Di sini referensinya adalah panduan dan frame pembukanya dihasilkan darinya. Butuh klip yang bermula pada gambar diam persis yang sudah disetujui? Itu endpoint yang satunya.

Delapan detik, tanpa tawar-menawar

Aturan Google berbunyi: durasi "Harus '8' saat memakai extension, gambar referensi, atau dengan resolusi 1080p dan 4k." Gambar referensi ada di daftar itu, jadi opsi 4 dan 6 detik yang ditawarkan dua endpoint lainnya tidak ada di sini. Schema kami tetap menampilkan enum duration; untuk capability ini satu-satunya nilai yang sah adalah "8".

Susun anggaran sesuai itu. Rangkaian enam klip berarti 48 detik output — $0.72 di kami, $7.20 di fal.ai atau Replicate.

Request API: sebuah array referensi

Field wajib: prompt dan image_urls.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/veo-3.1-fast/reference-to-video",
    "input": {
      "prompt": "Perempuan dari gambar 1, mengenakan mantel dari gambar 2, melangkah masuk ke lobi dari gambar 3 dan mengibaskan air hujan. Ia mendongak dan berkata: \"Kamu menunggu.\" Cahaya tungsten hangat, gema marmer.",
      "image_urls": [
        "https://example.com/talent-portrait.jpg",
        "https://example.com/wardrobe-coat.jpg",
        "https://example.com/lobby-set.jpg"
      ],
      "aspect_ratio": "16:9",
      "resolution": "720p",
      "duration": "8",
      "has_sound": "true"
    }
  }'

Submit mengembalikan sebuah job ID; lakukan polling atau daftarkan sebuah webhook:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/veo-3.1-fast/reference-to-video",
    input: {
      prompt:
        "Maskot dari gambar 1 melompat ke meja dari gambar 2, menjatuhkan sebuah cangkir, lalu terpaku. Langkah kaki berdecit, denting keramik, kemudian sunyi.",
      image_urls: [
        "https://example.com/mascot-turnaround.png",
        "https://example.com/kitchen-set.jpg",
      ],
      aspect_ratio: "9:16",
      resolution: "720p",
      duration: "8",
      has_sound: "true",
      seed: 60411,
    },
  }),
}).then((r) => r.json());

const jobId = submitted.data.jobId;

while (true) {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") {
    console.log(job.data.outputs[0].url);
    break;
  }
  if (job.data.status === "failed") {
    throw new Error(job.data.error?.message || "Generation failed");
  }
  await new Promise((r) => setTimeout(r, 5000));
}

Status berjalan pending → processing → completed, atau berakhir di failed / cancelled. Rencanakan sekitar empat menit per job — jendela resmi Google adalah lantai 11 detik dan 6 menit pada jam sibuk. Pakai ulang satu seed di seluruh set kalau Anda ingin hasil generasinya saling berima.

Pintu Veo 3.1 Fast yang mana yang dipakai

Bobot identik, harga per detik identik. Bentuk input Anda yang memilih endpoint-nya:

EndpointOpsi durasiKlip 8d, 720p + audioPilih saat
Veo 3.1 Fast reference-to-videohanya 8d$0.12Hingga 3 gambar harus mengunci wajah, busana, atau tempat lintas klip
Veo 3.1 Fast image-to-video4 / 6 / 8d$0.12Satu gambar diam harus menjadi frame pertama secara harfiah
Veo 3.1 Fast text-to-video4 / 6 / 8d$0.12Hanya prompt, tidak ada yang perlu diunggah
Omni Flash reference-to-video—$0.80 (konfigurasi default)Keluarga yang berbeda, ketika tampilan Veo bukan yang Anda mau

Kami lebih ingin Anda membelanjakan lebih sedikit. Kalau satu gambar sudah menyelesaikan pekerjaannya, image-to-video berharga sama sekaligus membuka klip 4 dan 6 detik — versi 4 detik berbiaya $0.06, separuh dari 8 detik tetap yang Anda bayar di sini. Datanglah ke endpoint ini ketika konsistensi lintas beberapa klip memang kebutuhan sesungguhnya, karena itulah satu hal yang tidak bisa dilakukan yang lain. Sisa kategorinya ada di bawah reference-to-video; semua yang lain ada di katalog model.

Beri label pada referensi Anda

Model menerima sebuah array tanpa label. Tidak ada apa pun di payload yang mengatakan slot dua adalah busana dan bukan karakter kedua — jadi sebutkanlah di dalam prompt.

Pengindeksan berhasil: "perempuan dari gambar 1", "mantel dari gambar 2", "lobi dari gambar 3". Beberapa kata saja, dan sebagian besar ambiguitas yang menghasilkan output tercampur aduk pun lenyap.

Tiga kebiasaan lagi:

Beri setiap referensi satu tugas. Foto ramai yang memuat seseorang, sebuah produk, dan sebuah ruangan meminta model menebak apa yang Anda pedulikan. Crop rapat.

Ulangi identitasnya dalam kata-kata. "Rambut perak pendek yang sama, kacamata bulat yang sama" memperkuat apa yang ditunjukkan referensinya. Asuransi murah.

Tuliskan dialognya. Google menghasilkan audio secara native tanpa sakelar mati di API mereka, jadi suara tetap terjadi apa pun yang terjadi — ucapan, efek, ambiens. Kutip barisnya dan ia mendarat di frame yang tepat.

Google mendukung bahasa Inggris sepenuhnya dan belum mengevaluasi bahasa lain untuk model ini, jadi pertahankan teks instruksinya dalam bahasa Inggris — dialog yang dikutip boleh dalam bahasa apa pun yang dibutuhkan adegannya.

Daftar periksa rilis

Dua hari untuk mengunduh. Retensi Google atas video yang dihasilkan adalah dua hari — "Anda harus mengunduh video Anda dalam 2 hari sejak dibuat." Untuk kampanye berisi dua puluh klip yang dibangun selama seminggu, itu keputusan arsitektur, bukan catatan kaki. Salin outputs[0].url ke penyimpanan Anda sendiri begitu sebuah job selesai.

SynthID pada setiap output. Watermark tak kasatmata milik Google diterapkan pada semua video Veo dan bisa diverifikasi lewat platform mereka. Tidak ada provider yang bisa menonaktifkannya.

Generasi manusia dibatasi wilayah. Di UE, Inggris, Swiss, dan MENA, personGeneration dibatasi ke allow_adult.

Beri versi pada set referensi Anda. Konsistensi bergantung pada pengiriman referensi yang identik byte demi byte setiap kali. Potret hasil ekspor ulang yang diselipkan di tengah sebuah batch akan terlihat.

Pertanyaan umum

Berapa biaya Veo 3.1 Fast reference-to-video di E2X?

Kami menagih $0.01 per detik output, ×1.5 dengan audio aktif. Endpoint ini terkunci di 8 detik, jadi klip 720p dengan suara adalah $0.12. Resolusi lebih tinggi membawa pengalinya sendiri — periksa halaman model versi live sebelum merencanakan batch 1080p.

Berapa banyak gambar referensi yang bisa saya kirim?

Paling banyak tiga. Dokumentasi Google menyebut Anda boleh memakai hingga tiga gambar referensi untuk memandu kontennya, dan schema mereka menggambarkannya sebagai referensi gaya dan konten. Lebih sedikit tidak masalah; dua adalah hal yang lumrah.

Kenapa saya tidak bisa menghasilkan klip 4 detik di sini?

Google mensyaratkan 8 detik kapan pun gambar referensi terlibat — aturan yang sama yang mencakup 1080p dan 4k. Butuh 4 atau 6 detik? Pakai endpoint image-to-video atau text-to-video: model yang sama, harga per detik yang sama.

Apa beda antara ini dan image-to-video?

Image-to-video menjadikan satu gambar sebagai frame pembuka secara harfiah. Reference-to-video menerima hingga tiga gambar sebagai panduan identitas, busana, gaya, atau lokasi, lalu menghasilkan frame pembuka yang konsisten dengannya. Pakai referensi ketika konsistensi lintas beberapa klip lebih penting daripada frame pertama yang spesifik.

Apakah outputnya menyertakan audio yang tersinkron?

Ya. Google menghasilkan dialog, efek suara, dan ambiens secara native, tanpa cara untuk menonaktifkannya di API mereka sendiri. Kami memaparkan has_sound dengan default true, dan setelan itu menerapkan pengali harga ×1.5.

Apakah video yang dihasilkan ber-watermark?

Semua output Veo membawa SynthID, penanda tak kasatmata milik Google untuk konten yang dihasilkan AI, yang bisa diverifikasi di platform mereka. Tidak ada provider — termasuk kami — yang bisa mematikannya.

Berapa lama satu job selesai?

Kami menganggarkan kira-kira empat menit. Google mempublikasikan minimum 11 detik dan maksimum 6 menit pada jam sibuk, jadi untuk satu set klip lengkap pakailah webhookUrl alih-alih menahan loop polling tetap terbuka.