Prueba la API de Google Gemini Omni 1.1 Flash para guiar la generación con imágenes y vídeos de referencia breves, manteniendo sujetos, escenas y movimiento coherentes.
La API Google Gemini Omni 1.1 Flash Reference-to-Video permite a los desarrolladores usar materiales visuales como guía creativa para el video generado. Proporciona imágenes de referencia, clips de video o ambos y, a continuación, describe el resultado que deseas crear. La API de video Gemini ayuda a convertir esas entradas en una nueva escena en movimiento, lo que ofrece a los equipos creativos una forma flexible de definir la composición, las indicaciones del sujeto, la atmósfera y la dirección en Best Image AI.
Guía de referencia multimodal: Usa imágenes, clips de video o una combinación de ambos como materiales visuales para una nueva secuencia generada.
Dirección creativa controlada mediante prompts: Combina las referencias con indicaciones en lenguaje natural sobre la acción del sujeto, el entorno, el comportamiento de la cámara, la iluminación y el ambiente.
Contexto visual detallado: Reúne indicaciones visuales de varios materiales proporcionados cuando un solo prompt no sea suficiente para comunicar la dirección deseada.
Creación de escenas guiada por referencias: Usa los recursos seleccionados como punto de partida creativo para el movimiento, la composición y el desarrollo de la atmósfera en el resultado.
Presentación de video flexible: Elige un formato horizontal o vertical, la calidad de salida y una duración breve del clip para el contexto de visualización previsto.
Flujo de trabajo de API escalable: Incorpora la generación de video guiada por referencias en bibliotecas de recursos, herramientas creativas, sistemas de campañas y procesos de producción.
Entrada: Imágenes de referencia opcionales, clips de video de referencia opcionales y un prompt en lenguaje natural que describa la escena que se desea generar.
Salida: Un nuevo clip de video creado mediante el flujo de trabajo de la API Gemini Omni 1.1 Flash Reference-to-Video.
Dirección de las referencias: Selecciona materiales visuales que comuniquen los sujetos, el entorno, la composición o el tono creativo deseados y, después, añade instrucciones claras de movimiento.
Control del formato: Elige la orientación de salida, el nivel de calidad y la duración concisa que se adapten al caso de uso final.
Funciones: Generación de video guiada por referencias, entrada creativa multimodal, movimiento dirigido por prompts, composición del contexto visual y creación de escenas cinematográficas.
Desarrollo de conceptos para campañas: Combina recursos visuales principales aprobados, imágenes de ambiente y referencias de movimiento para explorar nuevas direcciones de video para campañas.
Sistemas creativos de marca: Usa una biblioteca visual seleccionada como guía para generar conceptos de video que partan de un lenguaje creativo definido.
Visualización de guiones gráficos y presentaciones: Convierte paneles de referencia y materiales de clips seleccionados en escenas en movimiento concisas de prueba de concepto.
Adaptación de contenido: Crea nuevas direcciones de video a partir de recursos visuales existentes cuando un prompt de texto por sí solo no transmita suficiente contexto creativo.
Operaciones creativas a gran escala: Integra la generación basada en referencias en herramientas de gestión de recursos, procesos de contenido y plataformas internas de creación.
Nota Las referencias proporcionan orientación creativa, pero no sustituyen a un prompt preciso. Para obtener los mejores resultados, explica la acción deseada, el movimiento de la cámara y el resultado de la escena, además de proporcionar materiales visuales.
Gemini Omni 1.1 Flash frente a los flujos de video de referencia de Google Veo: Google Veo ofrece diversas funciones de video generado. Gemini Omni 1.1 Flash proporciona un proceso de creación guiado por referencias junto con la generación de texto, la animación de imágenes y la edición de video dentro de la misma familia de modelos.
Gemini Omni 1.1 Flash frente a Runway: Runway ofrece a los creadores muchas formas de trabajar con materiales de origen y herramientas generativas. Gemini Omni 1.1 Flash es adecuado para desarrolladores que crean un flujo de video guiado por referencias mediante una API.
Gemini Omni 1.1 Flash frente a Kling AI: Kling permite la creación de video con IA orientada por recursos visuales. Gemini Omni 1.1 Flash ofrece entradas flexibles de imágenes y videos de referencia con dirección mediante prompts para equipos que necesitan un flujo de generación integrado.
Gemini Omni 1.1 Flash frente a Pika: Pika es popular por su experimentación visual accesible. Gemini Omni 1.1 Flash es una opción práctica cuando las referencias creativas deben formar parte de un flujo de video estructurado y programático.
Gemini Omni 1.1 Flash frente a Luma Dream Machine: Luma Dream Machine permite explorar rápidamente conceptos a partir de prompts. Gemini Omni 1.1 Flash añade una guía de referencia multimodal para los equipos que desean incorporar más contexto visual a cada clip generado.
const response = await fetch('https://api.flaq.ai/api/v1/video/task', {
method: 'POST',
headers: {
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
body: JSON.stringify({
model_name: 'gemini-omni-1.1-flash-reference-to-video',
prompt: 'Use the references to create a cinematic shot of a small boat approaching from the distance',
aspect_ratio: '16:9',
resolution: '1080p',
duration: 8,
images: ['https://example.com/boat-reference.jpg'],
videos: ['https://example.com/motion-reference.mp4']
})
});
const { data } = await response.json();
const taskId = data.task_id;
// Step 2: Poll for results
const taskId = data.task_id;
const pollResult = async (taskId) => {
const res = await fetch(`https://api.flaq.ai/api/v1/video/${taskId}`, {
headers: { 'Authorization': 'Bearer YOUR_API_KEY' }
});
return res.json();
};
while (true) {
const pollResultData = await pollResult(taskId);
const status = pollResultData.data.task_status;
if (status === 'succeed') {
console.log(pollResultData.data.task_result.videos[].);
;
}
(status === ) {
.(pollResultData..);
;
}
( (resolve, ));
}
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/video/task',
headers={
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
json={
'model_name': 'gemini-omni-1.1-flash-reference-to-video',
'prompt': 'Use the references to create a cinematic shot of a small boat approaching from the distance',
'aspect_ratio': '16:9',
'resolution': '1080p',
'duration': 8,
'images': ['https://example.com/boat-reference.jpg'],
'videos': ['https://example.com/motion-reference.mp4']
}
)
result = response.json()
task_id = result['data']['task_id']
curl -X POST https://api.flaq.ai/api/v1/video/task \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model_name": "gemini-omni-1.1-flash-reference-to-video",
"prompt": "Use the references to create a cinematic shot of a small boat approaching from the distance",
"aspect_ratio": "16:9",
"resolution": "1080p",
"duration": 8,
"images": ["https://example.com/boat-reference.jpg"],
"videos": ["https://example.com/motion-reference.mp4"]
}'
# Step 2: Poll for results
# Replace {task_id} with the task_id returned from the submit response
curl -X GET "https://api.flaq.ai/api/v1/video/{task_id}" \
-H "Authorization: Bearer YOUR_API_KEY"
# Step 2: Poll for results
task_id = response.json()['data']['task_id']
poll_url = f"https://api.flaq.ai/api/v1/video/{task_id}"
while True:
poll_result = requests.get(poll_url, headers={'Authorization': 'Bearer YOUR_API_KEY'}).json()
status = poll_result['data']['task_status']
if status == 'succeed':
print(poll_result['data']['task_result']['videos'][0]['url'])
break
if status == 'failed':
print(poll_result['data']['task_status_msg'])
break
time.sleep(10)