Las palabras de cámara que Gemini Omni 1.1 Flash obedece, y las que ignora
Lea el material de prompting de vídeo de Google el tiempo suficiente y se topará con dos frases separadas por unos párrafos. Una publica una lista de movimientos de cámara —dolly, truck, pedestal, crane, whip pan, arc— como si estuviera pidiendo de una carta. La otra advierte de que «algunos ángulos de cámara avanzados no están soportados oficialmente. Los resultados y la fiabilidad pueden variar en función del prompt en su conjunto y de su caso de uso concreto.»
Las dos son ciertas, y en el hueco entre ellas nacen la mayoría de los clips decepcionantes. Un movimiento con nombre es una petición que el modelo probablemente atenderá, no un parámetro que deba ejecutar. En gemini-omni-1.1-flash no hay ningún campo de pose de cámara: ni cabezal, ni óptica, solo palabras compitiendo con sus otras palabras. Este post trata de cuáles de esas palabras se ganan su sitio, trabajado a partir de lo que Google documenta, de lo que informa Runway y de lo que expone el esquema.

Las palabras que se caen solas
Empiece por restar, que no cuesta nada y compra espacio de prompt. La referencia de prompting de cámara de Runway es tajante sobre las dos palabras más comunes en los prompts de vídeo con IA: «"Cinematic" y "4k" se quitan porque no hacen ningún trabajo. Ninguna de las dos cambia lo que hace la cámara, y el espacio de prompt que ocupan se aprovecha mejor en el movimiento.»
Es una afirmación sobre sus herramientas, no sobre las de Google, pero el razonamiento se traslada. «Cinematic» describe una impresión, no un punto de vista: no dice dónde colocarse, a qué distancia, qué mantener nítido ni hacia dónde desplazarse. Lo mismo con el lastre que arrastra detrás —masterpiece, award-winning, 8k, ultra detailed—, heredado de la cultura de prompts de los modelos de imagen, donde esos tokens funcionaban como conjuros de calidad contra una distribución de entrenamiento muy distinta.
La forma positiva es igual de llana: nombre un movimiento concreto en lugar de pedir «dynamic cinematic camera», porque estos modelos tratan «las instrucciones de cámara como dirección espacial, no como decoración». Nada de eso dice que «cinematic» haga daño. Dice que la palabra desplaza a algo mejor, y en un prompt de unas pocas decenas de palabras el desplazamiento lo es todo.
La lista de Google, y hasta dónde fiarse de ella
El vocabulario documentado le gana a cualquier cosa que circule por los hilos de prompts:
| Categoría | Lo que Google nombra |
|---|---|
| Movimiento | static · pan · tilt · dolly (in, out) · truck (left, right) · pedestal (up, down) · zoom · crane · aerial o drone · handheld · whip pan · arc |
| Ángulo y escala | eye-level · low · high · bird's-eye · Dutch · point-of-view · over-the-shoulder · extreme close-up · close-up · medium · full · wide o establishing |
| Óptica | wide-angle · telephoto · deep y shallow depth of field · lens flare · rack focus · fisheye · dolly zoom |
Dos detalles merecen atención. Google separa el zoom del dolly a propósito, porque los modelos los confunden: un zoom es un cambio de distancia focal y «esto es distinto de un dolly, porque la cámara en sí no se mueve». ¿Quiere que el fondo crezca respecto a su sujeto? Pida un dolly. ¿Quiere que el encuadre se cierre sin que cambie la geometría? Pida un zoom. Escriba «zoom in slowly as the camera pushes forward» y habrá pedido los dos: un dolly zoom, y casi nunca lo que quería decir.
Segundo, hay términos que se atribuyen ampliamente a Google y que no están en sus páginas. Oner, push in y natural smartphone zoom aparecen en guías que citan documentación de Google; nosotros no hemos podido encontrarlos allí. Que algo no esté documentado no significa que esté prohibido, pero no tienen más autoridad que una expresión que se invente usted. La sintaxis documentada completa está en nuestra guía de prompting.
Un movimiento por clip
El hallazgo más afilado de la referencia de Runway no es qué verbos funcionan, sino cuántos.
«Verbos apilados (poco fiable): "Orbit the subject and crane up and push in." Descripción por fases (fiable): "The camera arcs around the seated figure, then rises above the table to reveal the empty chairs surrounding her."»
El consejo que viene después es describir qué llena el encuadre en cada etapa en lugar de apilar verbos y, si el movimiento compuesto sigue fallando, «reducirlo a un solo movimiento y generar el segundo tiempo como su propio clip».
En Omni esto tiene además un filo mecánico, y viene de la documentación del propio Google: el modelo produce varios planos por defecto salvo que se le indique otra cosa. Pida tres movimientos simultáneos y le habrá dado una salida: cortar. Órbita dos segundos, corte, grúa dos, corte, y el resto empujando hacia dentro. Todas las instrucciones atendidas, nada de lo que usted quería. El arreglo de una sola cláusula, «In a single continuous shot» o «No scene cuts», impide que el modelo resuelva su ambigüedad con un montaje.
Una misma escena, generada dos veces, cambiando solo la cláusula de cámara:
Cuatro segundos por lado a 720p, treinta y seis centavos cada uno. El sujeto, la habitación, la luz y la línea de sonido son idénticos; solo cambia la frase de apertura, un encuadre fijo frente a un dolly in lento. La cláusula de cámara es la frase con más palanca de todo el prompt, y la que casi todo el mundo escribe la última.
La distancia focal es dirección, no óptica
No hay objetivo. Conviene decirlo sin rodeos, porque el modelo mental importa. Escriba «85mm» y el modelo no está calculando un ángulo de visión: va a buscar todo lo que en sus datos de entrenamiento lleva esa etiqueta, y las fotografías llevan esa etiqueta por millones. Lo que vuelve es el aspecto asociado a la cifra: fondo comprimido, sujeto recortado sobre un campo suave, distancias aplanadas. Con una focal corta, perspectiva estirada, más habitación dentro del encuadre, bordes que se curvan.
Lo que convierte la distancia focal en una de las palabras más eficientes disponibles: mueve encuadre y sensación a la vez en cuatro caracteres. Los consejos que circulan son consistentes —en torno a 24mm para contexto amplio, 35mm para un aire documental, 50mm para narración neutra, 85mm para trabajo íntimo y comprimido—, leídos como dirección visual y no como promesa de óptica literal.

De ahí salen dos hábitos. Déle un trabajo a la cifra en lugar de dejarla como adjetivo: «35mm» a secas es un token, mientras que «35mm, the workshop visible behind her throughout» dice para qué está el gran angular, y esa cláusula sobrevive aunque la cifra se ignore. Los términos ópticos documentados por Google —shallow depth of field, deep focus, rack focus, telephoto— hacen el mismo trabajo con palabras llanas. Y nunca empareje una distancia focal con una instrucción que la contradiga: «85mm wide establishing shot of the valley» pide compresión y amplitud a la vez.
El encuadre es lo más fiable que puede especificar
Ordene el lenguaje de cámara por lo fiablemente que aterriza y aparece un patrón: las propiedades estáticas le ganan a las temporales.
La escala de plano —del extreme close-up al wide establishing— es una propiedad de un único fotograma. También lo es el ángulo, y también la geometría de un two-shot o de un over-the-shoulder. El modelo puede satisfacer cualquiera de ellas en el primer fotograma que renderiza y después mantenerla.
Un dolly in es una afirmación sobre el fotograma uno frente al noventa y seis, y tiene que sobrevivir a todos los fotogramas intermedios, en un proceso que no tiene ninguna representación explícita de dónde está la cámara. Ese es el hueco que la literatura de investigación existe para cerrar: CameraCtrl, el trabajo de referencia sobre control de cámara en difusión de vídeo, abre señalando que los modelos existentes «carecen de control de la pose de cámara, que sirve como lenguaje cinematográfico para expresar matices narrativos más profundos», y después añade un módulo de condicionamiento de pose porque el texto por sí solo no bastaba. Ninguna API de vídeo en producción que conozcamos expone ese canal.
De ahí una jerarquía que merece la pena memorizar. Encuadre y ángulo: especifique sin miedo, espere obediencia. Un movimiento con nombre: espérelo la mayoría de las veces. Dos movimientos, o un movimiento con velocidad y punto de parada declarados: espere varias tomas, o parta el tiempo en dos.

Antes y después
Un prompt escrito como se escriben la mayoría de los prompts de cámara. Todas y cada una de sus palabras las hemos usado nosotros.
Cinematic 4k video of a silversmith working at her bench in a workshop.
Dynamic camera movement, the camera orbits her and pushes in and cranes
up over the bench. Epic atmospheric lighting, ultra detailed, shallow
depth of field, professional colour grade, film look, masterpiece,
award winning cinematography, highly detailed hands and face,
beautiful composition, 8k resolution, moody and dramatic.
Cuente lo que es accionable. Tres verbos apilados que no pueden sostenerse todos en una misma toma. Ninguna escala de plano, ninguna distancia focal, ninguna instrucción sobre el número de planos, así que el multiplano documentado por defecto tiene vía libre y, con tres movimientos compitiendo sobre la mesa, cortar es el camino de menor resistencia.
El mismo plano, reescrito para decir solo aquello sobre lo que el modelo puede actuar:
In a single continuous shot, no scene cuts. Slow dolly in on a silversmith
at her bench, starting on a medium shot and ending tight on her hands. She
turns a thin silver bracelet against a small torch flame, then taps the
seam twice with a jeweller's hammer. 50mm lens, shallow depth of field, the
far wall of the workshop falling out of focus as the camera closes in.
Eye-level, camera slightly to her right. Sound design: the hiss of the
torch, two light metallic taps, a radio playing faintly in another room.
No dialogue. No music.
Cuatro cambios, por orden de peso. La cláusula de número de planos va primero, para que la ambigüedad no pueda responderse con un montaje. Tres movimientos se reducen a uno, con el encuadre de salida y el de llegada nombrados: la descripción por fases que recomienda Runway, escrita como un único desplazamiento. La distancia focal llega unida a una consecuencia. Y el sonido tiene sus propias frases, siguiendo la recomendación de Google de describir el audio por separado, con los negativos como cláusulas breves al final. La reescritura es más llana y más aburrida de leer, que suele ser la señal de que un prompt ha dejado de describir un estado de ánimo y ha empezado a describir un plano.
Dónde va la cámara dentro del prompt
El orden era la pregunta para la que esperábamos no tener respuesta. La tiene, y viene de la guía de Veo de Google y no de la página de Omni: la fórmula que aparece allí es cinematografía, sujeto, acción, contexto, estilo y ambiente —la cámara primero, antes de nombrar quién está en el plano—, porque ese elemento «es la herramienta más potente para transmitir tono y emoción». La propia documentación de Omni lista los elementos de otra forma, con la cámara a mitad de lista, así que Google publica dos ordenaciones y nosotros no hemos hecho ninguna comparación controlada.
Empezar por la cámara sí sobrevive al contacto con el otro comportamiento documentado de Omni, ya que la instrucción de número de planos tiene que aterrizar antes de que el modelo empiece a construir una narrativa. Además hace auditable el prompt: si la primera frase no describe un punto de vista, no ha dirigido usted ningún plano.
Lo que el esquema no le va a dar
Dos límites estructurales, y ninguno se arregla escribiendo mejor.
El primero es la repetibilidad. La documentación de la API de Google indica que «las instrucciones de sistema, temperature, top_p, las secuencias de parada y los prompts negativos no están soportados», y le dice que escriba los negativos dentro del prompt normal. No hay ningún muestreador que apretar. Lo que queda es seed, un entero opcional en nuestro esquema para este modelo, y esa es toda la superficie de control.
Esto importa más en el trabajo de cámara que en ninguna otra parte de un prompt. Una iluminación que vuelve algo distinta es otro etalonaje del mismo plano; un dolly que vuelve convertido en un pan es otro plano. Mantener un movimiento estable entre tomas significa, por tanto, fijar el seed y no cambiar nada más; y editar una sola palabra significa volver a muestrear desde cero. Trate un seed que funciona como un activo y anótelo junto al prompt.
El segundo límite es que la velocidad de cámara no tiene vocabulario. «Slow dolly in» es toda la superficie de control: sin unidad, sin duración, sin forma de decir que el empuje debe terminar en el quinto segundo y quedarse ahí. La sintaxis de timecode ayuda un poco —Omni acepta rangos entre corchetes—, así que un prompt puede pedirle a la cámara que se asiente a los cuatro segundos. Que lo haga es otra cuestión.
El ángulo de obturación y el motion blur están en la misma columna: ninguno aparece en el vocabulario documentado de Google. La tasa de fotogramas se queda cerca: los 24 fps aparecen en la página de Omni únicamente dentro de un ejemplo de temporización resuelto, «12 frames at 24fps», y no como palanca de prompt. Útil para razonar sobre timecodes; no algo que se escriba esperando dirigir con ello.
Lo que cuestan los experimentos de cámara, en el nivel que importa
El trabajo de cámara es la parte del prompting que no se acierta en una sola pasada: está pidiendo un comportamiento a lo largo del tiempo sin ningún parámetro que lo restrinja, así que genera, mira, ajusta y vuelve a generar. La cifra que importa es el precio de una toma.
En 4K, una toma de ocho segundos son $1.44 aquí frente a $2.43 llamando a Google directamente. Seis tomas para clavar un movimiento —algo modesto para cualquier cosa con un desplazamiento concreto— son $8.64 frente a $14.60. Esa diferencia es del 41 %, con mucho la mayor de las cuatro resoluciones y la razón por la que la fila de 4K es la única sobre la que merece la pena discutir. En el resto, un segundo de 4K cuesta $0.30 en fal, $0.32 en Runware y $0.39 en WaveSpeed, frente a $0.18 aquí; Replicate lista el modelo sin ninguna tarifa por segundo.
La forma de gastar menos, sin embargo, no es un segundo de 4K más barato sino dejar de probar movimientos de cámara en 4K. Diez borradores de ocho segundos en el nivel de 360p cuestan $2.38, y 360p basta para ver si la cámara hizo lo que le pidió: un movimiento es legible a cualquier resolución, y eso es lo que lo hace barato de probar. Diez borradores más un 4K de los buenos son $3.82, frente a $14.40 por diez tomas en 4K.
Los dos peldaños de arriba son escalados y no renders nativos —la referencia de modelo de Google los etiqueta como «1080p output (upscaled)» y «4K output (upscaled)»—, así que una toma en 4K compra dimensiones de entrega, no detalle extra en el plano que está auditando. Nuestro post sobre las escenas de cuarenta segundos cubre dónde merece la pena pagarlo de todos modos.
Los precios y las condiciones de producto pueden cambiar. Compruebe el precio vigente de cada proveedor antes de tomar una decisión de compra.
La versión corta
Diga primero el número de planos, después un movimiento, después el encuadre en el que empieza y en el que termina. Déle a la distancia focal una razón para estar ahí. Ponga el audio en frases propias. Borre todas las palabras que describen cómo debería hacer sentir el vídeo a quien lo vea y gaste ese espacio en dónde está la cámara.
Qué salió en la 1.1 está en el post de lanzamiento, y la auditoría de precios por proveedor explica por qué unos pesos idénticos cuestan cantidades distintas según la página. Los parámetros y las tarifas vigentes están en la página del modelo text-to-video. Para un movimiento suelto del que no depende nada, mire antes el precio de Veo 3.1 Fast, a un centavo por segundo: el vocabulario de cámara sale de la guía que Google publica para los dos, así que la práctica se transfiere.
Preguntas frecuentes
¿Qué términos de movimiento de cámara entiende Gemini Omni 1.1 Flash?
Google nombra un vocabulario de movimiento —static, pan y tilt, las parejas dolly, truck y pedestal, zoom, crane, drone o aerial, handheld, whip pan, arc— más términos de ángulo, escala de plano y óptica. También advierte de que algunos ángulos de cámara avanzados no están soportados oficialmente y de que la fiabilidad varía con el prompt, así que lea un movimiento con nombre como una petición y no como un parámetro.
¿Sirve de algo escribir «cinematic» en un prompt de vídeo?
Poco por sí solo. La referencia de prompting de cámara de Runway quita tanto «cinematic» como «4k», con el argumento de que ninguna de las dos cambia lo que hace la cámara y de que el espacio se aprovecha mejor nombrando un movimiento. La palabra describe una impresión y no un punto de vista, así que no le da al modelo nada sobre lo que actuar; lo mismo con «masterpiece», «8k» y el resto del lastre heredado del prompting de imagen.
¿Cambian el resultado las distancias focales como 35mm o 85mm?
Desplazan el aspecto, porque las fotografías de los datos de entrenamiento llevan la distancia focal en sus metadatos y la cifra se lee como una pista de estilo. Una focal larga tiende a comprimir el fondo y a separar al sujeto; una corta estira la perspectiva y admite más habitación. Trátela como dirección visual y no como óptica literal, y únala a una consecuencia.
¿Dónde debería ir la dirección de cámara en un prompt de Omni?
La guía de prompting de Veo de Google pone la cinematografía primero, por delante del sujeto, la acción, el contexto y el estilo, y la llama el elemento más potente para transmitir tono. La propia documentación de Omni coloca los términos de cámara a mitad de lista. Las dos son de Google. Empezar por la cámara tiene una ventaja práctica: la instrucción de número de planos es una decisión de cámara y necesita registrarse antes de que el modelo empiece a construir una narrativa.
¿Se puede conseguir dos veces el mismo movimiento de cámara en Gemini Omni 1.1 Flash?
Solo reutilizando un seed. La documentación de Google dice que temperature, top_p, las instrucciones de sistema, las secuencias de parada y los prompts negativos no están soportados, lo que deja seed —un entero opcional en nuestro esquema— como todo el control de reproducibilidad. Cambie una palabra del prompt y estará muestreando de nuevo, así que anote el seed que produjo un movimiento que le gustó en el mismo momento en que funcionó.
¿Por qué corta la cámara a mitad de plano si pedí un solo movimiento?
Porque los planos múltiples son lo que hay por defecto. Google documenta que Omni intentará varios planos y construirá una narrativa salvo que se le indique otra cosa, así que un prompt que apila dos o tres movimientos le da una excusa para satisfacer cada uno en un corte distinto. El arreglo documentado es una cláusula que pida una escena ininterrumpida, y reducirse a un solo movimiento con nombre elimina el incentivo.
¿Se puede especificar la velocidad de obturación o la tasa de fotogramas en un prompt de Gemini Omni?
Nada en el vocabulario de cámara documentado por Google cubre el ángulo de obturación ni el motion blur, y no vamos a afirmar que esos términos se atiendan. La tasa de fotogramas tampoco es una palanca de prompt: los 24 fps aparecen en la página de Omni de Google dentro de un ejemplo de temporización —«12 frames at 24fps»— y no como una especificación que se pueda fijar. Resuelva la tasa de fotogramas en posproducción.
¿Cuánto cuesta probar prompts de cámara en 4K?
Una toma de ocho segundos en 4K son $1.44 en E2X frente a $2.43 llamando a Google directamente, así que seis tomas salen por $8.64 en lugar de $14.60: una diferencia del 41 %, la más ancha de las cuatro resoluciones. Probar en 4K suele ser tirar el dinero, eso sí: un movimiento es legible a 360p, donde diez borradores de ocho segundos suman $2.38, y un 4K de los buenos deja la tanda en $3.82.