Loading...
Loading...
Crea vídeos a partir de indicaciones de texto.
Texto a vídeo convierte un prompt escrito en un clip corto en movimiento. No entra nada más que la descripción, así que el modelo tiene que inventar el sujeto, el comportamiento de la cámara y el movimiento a lo largo del tiempo. Eso la convierte en la capacidad más abierta del catálogo y en aquella en la que la redacción exacta de un prompt cambia más el resultado.
Los prompts útiles describen el plano como lo haría un director: sujeto, acción, movimiento de cámara, escenario e iluminación. Los clips son cortos por diseño, así que planifica un solo momento por generación y monta varios juntos en lugar de esperar que un prompt sostenga una escena entera. Los trabajos de vídeo además tardan bastante más que los de imagen y cuestan más por solicitud, lo que es una buena razón para fijar antes el aspecto con un modelo de imagen barato y trasladar después la descripción ganadora.
E2X sirve hoy esta categoría con dos modelos de Google, Veo 3.1 Fast y Omni Flash. Ambos se llaman como cualquier otro modelo de aquí: envía un slug de modelo y un objeto de entrada al endpoint de trabajos, toma el id del trabajo que llega de vuelta y consúltalo hasta que el clip esté listo. La facturación es por solicitud desde un saldo prepago, con el precio indicado en la ficha de catálogo de cada modelo antes de que lo llames.
Poco. Estos modelos producen clips de un solo plano en lugar de escenas completas, así que las secuencias más largas se construyen generando varios clips y montándolos juntos.
La generación de vídeo renderiza muchos fotogramas que deben mantenerse coherentes entre sí, así que el trabajo simplemente dura más. Envíalo y luego consulta el id del trabajo en vez de mantener una solicitud abierta.
Sí, pero en otra categoría. Imagen a vídeo anima un solo fotograma, y fotograma inicial y final a vídeo interpola entre dos de ellos.
Una solicitud por clip, con cargo a tu saldo prepago al precio por solicitud indicado en el modelo que elijas.