Torna ai Modelli

Omni Flash

Famiglia di generazione video di Google che crea clip da prompt testuali o immagini di riferimento, ottimizzata per tempi rapidi.

Riferimento al Videoda$0.075Testo in videoda$0.075
Prezzia partire da $0.075/richiesta
Latenza~240 secondi in media
Risoluzione4K/720P/1080P
Ideale pervideo, google, high-fidelity

Parametri

0/7 elementi

Costo Stimato

Risparmi il 50% su questo modello
Costo base per second$0.15
Sconto-50%
Il tuo totale$0.075
Risparmi $0.075 per richiesta

Accedi per eseguire i modelli

Output Preview

Ready

No output yet

Run the model to see generated results.

Output di esempio

Esempio API— Parametri Attuali

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/omni-flash/reference-to-video',
  'input': {}
}
)

Ottieni Job— Controlla il risultato

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

Dettaglio Prezzi

Costo stimato per generazione in base a durata e risoluzione. Paghi solo per ciò che esegui.

Durata
4K
720P
1080P
4
$1.20
$0.60
$0.90
6
$1.80
$0.90
$1.35
8
$2.40
$1.20
$1.80
10
$3.00
$1.50
$2.25
Esplora alternative

Modelli correlati

Scopri altri modelli di IA per Riferimento al Video

Visualizza tutti i modelli

API Gemini Omni Flash Reference-to-Video su E2X

Omni Flash è il gemini-omni-flash-preview di Google — un modello video della famiglia Gemini, non un Veo — e la presentazione che ne fa DeepMind sta in una frase: "Immaginate Gemini Omni come Nano Banana, ma per il video." Facciamo girare la sua capability reference-to-video come google/omni-flash/reference-to-video, e fatturiamo $0.10 per ogni secondo di video 720p finito. La clip di default da 8 secondi costa quindi $0.80, audio incluso.

Noti l'unità. Qui nessuno vende una clip a forfait, quindi qualsiasi cifra che confronta va moltiplicata per la lunghezza che intende rendere.

Ha una sceneggiatura ma nessuna immagine da portare dentro l'inquadratura? Allora l'endpoint che Le serve è Veo 3.1 Fast text-to-video — parte dal solo prompt e, sulla nostra piattaforma, costa drasticamente meno. Ci torniamo sotto, onestamente.

La nostra posizione rispetto agli altri posti da cui può chiamare questo modello, verificata il 26 agosto 2026:

Provider APIAl secondo (720p)Clip da 8 secondivs. E2X
E2X$0.10$0.80—
fal.ai$0.13$1.04siamo il 23% più bassi
Atlas Cloud$0.135$1.08siamo il 26% più bassi
Runware$0.10$0.80alla pari
Google Gemini API$0.10$0.80alla pari

I prezzi e le condizioni dei prodotti possono cambiare nel tempo. Verifichi i prezzi aggiornati di ciascun provider prima di prendere una decisione d'acquisto. Il prezzo Google Batch o Flex non è direttamente equivalente a una request API on-demand standard, perché le condizioni di pianificazione, disponibilità ed elaborazione sono diverse; è quindi escluso da questo confronto. Si tratta di un confronto circoscritto a uno scenario d'uso specifico, non dell'affermazione che E2X sia l'opzione più economica al mondo in ogni configurazione.

Non lo abbelliamo: su questo modello pareggiamo la tariffa di Google invece di andarci sotto, e il risparmio è reale solo rispetto a fal.ai e Atlas. Le reference image incidono a malapena — Google conta un'immagine a 2.040 token, quindi tre di esse costano circa un centesimo. È duration il campo che muove il Suo conto.

Cosa comprano davvero le reference image

Il senso di questo endpoint è la continuità. Consegni al modello un soggetto — una persona, un prodotto, un set, un look —, descriva una scena in cui non è mai stato fotografato, e il soggetto sopravvive al viaggio.

Può allegare diverse reference, non una sola. Gli esempi pubblicati da Google arrivano a sei; nessun massimo ufficiale è stato documentato, e i numeri di terze parti si contraddicono a vicenda, quindi non ne stamperemo uno. Progetti per una manciata e testi il Suo tetto.

L'audio viene generato insieme all'immagine, non attaccato dopo. Si sincronizza con l'azione e lo guida dallo stesso prompt — chieda pioggia su un tetto di lamiera e un room tone basso, ed è quello che torna indietro. Non c'è una traccia audio separata da montare dopo.

Dieci secondi è il tetto. Il nostro enum duration espone 4, 6, 8 e 10; il modello di Google gira da 3 a 10 secondi, e 10 è un limite duro. Nessun endpoint di estensione, nessuna interpolazione. Qualsiasi cosa più lunga è un lavoro di cucitura nel Suo editor — e la continuità fra gli stacchi diventa un Suo problema.

720p, 24 fps, e la lista finisce qui. Il nostro campo resolution porta i valori 1080p e 4k e Google indica le risoluzioni più alte come in arrivo, ma oggi il modello restituisce 720p. Lo lasci sul default. Una pagina di provider che qui pubblicizza il 1080p sta avanti alla documentazione di Google stessa.

Si aspetti circa 45 secondi di elaborazione per una clip standard — un p50 misurato da eachlabs, non un dato ufficiale, quindi lo usi per pianificare e non per promettere.

Request API: reference dentro, clip fuori

Due campi sono obbligatori: image_urls e prompt. Generi una API key dalla Sua dashboard, la tenga su un server che controlla, poi invii il job.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/omni-flash/reference-to-video",
    "input": {
      "prompt": "La sneaker della prima immagine è posata su asfalto bagnato mentre dietro un autobus riparte. Lenta carrellata in avanti. Traffico di sottofondo e pioggia leggera, nessuna musica.",
      "image_urls": [
        "https://example.com/sneaker-front.jpg",
        "https://example.com/sneaker-side.jpg"
      ],
      "duration": "8",
      "aspect_ratio": "16:9",
      "resolution": "720p"
    }
  }'

La response porta un job ID. Il video richiede minuti, quindi faccia polling lentamente — oppure salti il polling e passi un webhookUrl nel body di submit:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/omni-flash/reference-to-video",
    input: {
      prompt:
        "La donna della reference attraversa un mercato notturno, le insegne al neon si riflettono sulla sua giacca. Camera a mano. Brusio della folla e frittura in lontananza.",
      image_urls: ["https://example.com/talent.jpg"],
      duration: "10",
      aspect_ratio: "9:16",
    },
  }),
}).then((r) => r.json());

const poll = async (id, attempt = 0) => {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") return job.data.outputs[0].url;
  if (job.data.status === "failed") throw new Error(job.data.error?.message);
  if (attempt > 90) throw new Error("Timed out waiting for the render");

  await new Promise((r) => setTimeout(r, 5000));
  return poll(id, attempt + 1);
};

const videoUrl = await poll(data.jobId);

Gli status passano da pending → processing → completed, oppure finiscono su failed o cancelled. Lo schema e il prezzo aggiornati stanno nella specifica leggibile dalle macchine, se preferisce leggerli in modo programmatico.

Come scegliere fra i nostri modelli video

Il confronto che conta, e non lusinga questa pagina:

ModelloIl nostro prezzo (8s, 720p, audio)Da scegliere quando
Omni Flash reference-to-video$0.80Più reference devono restare coerenti, o Le serve una clip da 10 secondi
Veo 3.1 Fast reference-to-video$0.12Fino a tre reference, 8 secondi, e vuole il conto più basso
Veo 3.1 Fast image-to-video$0.12Un solo fermo immagine che vuole animare
Veo 3.1 Fast text-to-video$0.12Nessun materiale sorgente

Sulla nostra piattaforma Veo 3.1 Fast costa una frazione di Omni Flash, e arriva a 1080p e 4K, cosa che oggi Omni Flash non può fare. Al prezzo di listino di Google stessa i due stanno agli stessi $0.10 al secondo per il 720p — è il nostro sconto ad aprire il divario. Quindi parta da Veo Fast. Torni qui quando è il suo tetto di tre reference a bloccarLa, quando Le servono quei due secondi in più, o quando vuole il comportamento di editing video dietro alla formula "Nano Banana per il video". Altre opzioni stanno nella categoria reference-to-video, e l'intero catalogo modelli sta in una sola pagina.

I vincoli che Google pubblica

Public Preview significa che gli spigoli sono documentati invece che nascosti. Legga questi punti prima di costruire:

  • Le reference video fino a tre secondi vengono accettate dallo schema dell'API ma, nelle parole di Google stessa, "non vengono elaborate correttamente dal modello." Consideri il referencing video come non funzionante e invii fermi immagine — e noti che il referencing o il ragionamento su più video non è affatto supportato.
  • La modifica di un video caricato è non disponibile nel SEE, in Svizzera e nel Regno Unito. Se i Suoi utenti o la Sua infrastruttura stanno lì, quella metà dell'attrattiva del modello è fuori discussione.
  • Solo l'inglese è pienamente supportato. Le altre lingue di prompt non sono state valutate.
  • Una narrazione lunga e a più scene in una singola generazione fallisce. Questo modello rende una sola inquadratura continua; ne chieda tre in sequenza e otterrà un pasticcio.

Scrivere prompt per immagine e suono insieme

Scriva l'inquadratura, non la storia. Un soggetto, un movimento di macchina, una condizione di luce — poi dica come suona, perché l'audio esce dallo stesso prompt e il silenzio è una scelta che si fa ad alta voce.

Etichetti i Suoi allegati quando ne entra più di uno: "l'immagine 1 è la bottiglia, l'immagine 2 è il primo piano dell'etichetta." Nient'altro comunica al modello quale reference è la protagonista. Tenga semplice il linguaggio di macchina — "lenta carrellata in avanti", "camera fissa", "inseguimento a mano" battono un paragrafo di cinematografia.

Prima di andare in produzione

Ogni clip porta un watermark SynthID — invisibile agli spettatori, rilevabile in modo programmatico — e le content credential C2PA sono allegate di default. Nessun provider che faccia girare questo modello può disattivarle, noi compresi. Se un contratto con un cliente vieta asset IA etichettati, risolva la questione prima di integrare.

Ri-ospiti i Suoi output sul Suo storage dentro l'handler di completamento. Gli URL dei risultati non sono indirizzi permanenti, e un video che non riesce a recuperare è un video che paga due volte.

Domande frequenti

Che cos'è Gemini Omni Flash?

È il gemini-omni-flash-preview di Google, un modello di generazione e editing video della famiglia Gemini invece che della famiglia Veo. DeepMind lo descrive come "Nano Banana, ma per il video" — l'accento cade sul portare le reference in modo coerente e sul modificare filmati esistenti, mentre Veo punta alla generazione cinematografica da zero. È in Public Preview.

Quanto costa un video Omni Flash da 8 secondi su E2X?

$0.80. Applichiamo una tariffa di $0.10 per secondo di output in 720p, quindi è la lunghezza a guidare il conto — una clip da 4 secondi è $0.40, il massimo da 10 secondi $1.00. Era la nostra tariffa alla verifica del 26 agosto 2026.

Quante reference image accetta Omni Flash?

Più di una, e gli esempi documentati da Google arrivano a sei — ma non è pubblicato alcun massimo ufficiale. Fonti esterne a Google citano tetti diversi e si contraddicono a vicenda, quindi non ripeteremo un numero che non possiamo verificare. Testi i Suoi payload prima di progettare attorno a un conteggio specifico.

Omni Flash può produrre video in 1080p o 4K?

Oggi no. Restituisce 720p a 24 fps, e Google indica le risoluzioni più alte come in arrivo. Se Le serve subito il 1080p o il 4K, Veo 3.1 Fast arriva a entrambi.

Meglio usare Omni Flash o Veo 3.1 Fast?

Veo 3.1 Fast, per la maggior parte dei lavori. Sulla nostra piattaforma costa $0.12 per una clip da 8 secondi con audio contro gli $0.80 di qui, e arriva al 4K. Scelga Omni Flash quando Le servono più di tre reference image, una durata da 10 secondi o il suo comportamento di editing video.

Il video generato ha il sonoro?

Sì, in modo nativo e in sincrono con l'azione sullo schermo. Lo dirige dallo stesso prompt — nomini l'ambiente sonoro, gli effetti, oppure chieda della musica. L'audio non può essere modificato in seguito attraverso l'API, quindi un cambiamento significa un nuovo render.

I video Omni Flash hanno un watermark?

Sì. Ogni output porta un watermark SynthID che gli spettatori non possono vedere ma che gli strumenti di rilevamento leggono, più le content credential C2PA attive di default. Nessun provider espone un parametro per disattivare né l'uno né le altre.

Posso modificare un video caricato con questo modello?

Solo fuori dal SEE, dalla Svizzera e dal Regno Unito — Google limita l'editing di video caricati in quelle regioni. La generazione reference-to-video in sé non è interessata. Noti inoltre che le reference video vengono accettate dallo schema ma non elaborate correttamente, quindi invii immagini.