Prueba la API de Google Gemini Omni 1.1 Flash para animar un fotograma inicial obligatorio hacia un fotograma final opcional con movimiento controlado y continuidad visual.
La API Google Gemini Omni 1.1 Flash Image-to-Video ayuda a los desarrolladores a transformar una imagen proporcionada en un vídeo con IA dirigido. Utiliza una imagen fija como punto de partida visual, añade indicaciones de movimiento en lenguaje natural y genera una escena que evoluciona con un movimiento y un trabajo de cámara intencionados. Una imagen final opcional puede guiar el destino de la secuencia, lo que hace que la API de vídeo Gemini resulte útil para flujos de animación controlada en Best Image AI.
Animación de vídeo guiada por imágenes: Parte de una imagen subida y crea movimiento en torno al sujeto, la composición, la iluminación y la dirección visual general.
Guía opcional del fotograma final: Añade una imagen final cuando el clip necesite un destino visual más deliberado o una transición guiada entre dos estados.
Control del movimiento mediante lenguaje natural: Describe el movimiento de la cámara, el comportamiento del sujeto, los cambios del entorno y el ritmo junto con la imagen de entrada.
Desarrollo coherente de la escena: Utiliza la imagen de entrada como ancla visual mientras diriges una secuencia que se percibe conectada, en lugar de desvinculada del fotograma inicial.
Presentación flexible de vídeo: Genera salidas horizontales o verticales para recursos de campaña, vídeos sociales, historias de productos y experiencias centradas en dispositivos móviles.
Opciones de calidad y duración: Adapta la calidad de salida y la duración compacta del clip a las necesidades de prototipado, revisión, publicación o producción.
Entrada: Una imagen inicial junto con un prompt de movimiento en lenguaje natural que describe el movimiento deseado, el comportamiento de la cámara y la evolución de la escena.
Guía opcional: Puede proporcionarse una imagen final para dar a la animación un estado visual final controlado.
Salida: Un clip de vídeo generado y entregado mediante el flujo de trabajo de la API image-to-video Gemini Omni 1.1 Flash.
Control del formato: Selecciona una composición horizontal o vertical, la calidad de salida y una duración concisa que se adapten al canal de destino.
Capacidades: Animación de imágenes, guía visual de principio a fin, movimiento de cámara dirigido por prompts, evolución de escenas e iteración creativa.
Animación de imágenes de productos: Añade movimiento, energía de cámara y vida al entorno de fotografías de productos y elementos visuales principales de campañas.
Reutilización de contenido social: Convierte publicaciones estáticas, imágenes editoriales y arte de lanzamiento en conceptos breves de vídeo vertical o panorámico.
Desarrollo de guiones gráficos: Utiliza fotogramas conceptuales y arte clave para probar cómo puede moverse una idea visual antes de emprender una producción de mayor envergadura.
Variantes creativas de marca: Crea variantes basadas en movimiento a partir de una dirección visual aprobada, manteniendo una imagen inicial clara para el flujo de trabajo.
Vídeo para comercio electrónico y publicidad: Crea momentos concisos de productos, secuencias de estilo de vida y recursos promocionales a partir de materiales visuales existentes.
Nota Utiliza imágenes de origen nítidas y de alta calidad y describe con precisión el movimiento previsto. Los prompts que especifican el movimiento del sujeto, la dirección de la cámara y el comportamiento del entorno suelen ofrecer una guía de animación más útil.
Gemini Omni 1.1 Flash frente a Google Veo Image-to-Video: Google Veo ofrece flujos consolidados de image-to-video. Gemini Omni 1.1 Flash añade una vía conectada para animar imágenes, generar texto, crear vídeo guiado por referencias y editar vídeo dentro de una misma familia de modelos.
Gemini Omni 1.1 Flash frente a Runway Image-to-Video: Runway ofrece un amplio conjunto de herramientas para creadores centrado en el movimiento generado. Gemini Omni 1.1 Flash está diseñado para desarrolladores que buscan animación guiada por imágenes y dirección mediante prompts en un flujo basado en API.
Gemini Omni 1.1 Flash frente a Kling Image-to-Video: Kling es una opción popular para la animación expresiva de imágenes. Gemini Omni 1.1 Flash ofrece una vía práctica desde una imagen de origen y unas indicaciones de movimiento hasta el resultado, con una guía opcional del fotograma final.
Gemini Omni 1.1 Flash frente a Pika Image-to-Video: Pika se centra en facilitar la experimentación visual. Gemini Omni 1.1 Flash es idóneo para equipos de producto que necesitan animación controlada de imágenes dentro de una integración escalable.
Gemini Omni 1.1 Flash frente a Luma Dream Machine: Luma Dream Machine es reconocido por agilizar la ideación visual. Gemini Omni 1.1 Flash se diferencia por el control guiado por imágenes, la dirección opcional mediante una imagen final y los flujos de vídeo relacionados disponibles en la misma familia de API.
const response = await fetch('https://api.flaq.ai/api/v1/video/task', {
method: 'POST',
headers: {
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
body: JSON.stringify({
model_name: 'gemini-omni-1.1-flash-image-to-video',
prompt: 'The girl walks toward the camera while the city lights shimmer behind her',
image_url: 'https://example.com/start-frame.jpg',
image_end_url: 'https://example.com/end-frame.jpg',
aspect_ratio: '9:16',
resolution: '1080p',
duration: 8
})
});
const { data } = await response.json();
const taskId = data.task_id;
// Step 2: Poll for results
const taskId = data.task_id;
const pollResult = async (taskId) => {
const res = await fetch(`https://api.flaq.ai/api/v1/video/${taskId}`, {
headers: { 'Authorization': 'Bearer YOUR_API_KEY' }
});
return res.json();
};
while (true) {
const pollResultData = await pollResult(taskId);
const status = pollResultData.data.task_status;
if (status === 'succeed') {
console.log(pollResultData.data.task_result.videos[].);
;
}
(status === ) {
.(pollResultData..);
;
}
( (resolve, ));
}
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/video/task',
headers={
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
json={
'model_name': 'gemini-omni-1.1-flash-image-to-video',
'prompt': 'The girl walks toward the camera while the city lights shimmer behind her',
'image_url': 'https://example.com/start-frame.jpg',
'image_end_url': 'https://example.com/end-frame.jpg',
'aspect_ratio': '9:16',
'resolution': '1080p',
'duration': 8
}
)
result = response.json()
task_id = result['data']['task_id']
curl -X POST https://api.flaq.ai/api/v1/video/task \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model_name": "gemini-omni-1.1-flash-image-to-video",
"prompt": "The girl walks toward the camera while the city lights shimmer behind her",
"image_url": "https://example.com/start-frame.jpg",
"image_end_url": "https://example.com/end-frame.jpg",
"aspect_ratio": "9:16",
"resolution": "1080p",
"duration": 8
}'
# Step 2: Poll for results
# Replace {task_id} with the task_id returned from the submit response
curl -X GET "https://api.flaq.ai/api/v1/video/{task_id}" \
-H "Authorization: Bearer YOUR_API_KEY"
# Step 2: Poll for results
task_id = response.json()['data']['task_id']
poll_url = f"https://api.flaq.ai/api/v1/video/{task_id}"
while True:
poll_result = requests.get(poll_url, headers={'Authorization': 'Bearer YOUR_API_KEY'}).json()
status = poll_result['data']['task_status']
if status == 'succeed':
print(poll_result['data']['task_result']['videos'][0]['url'])
break
if status == 'failed':
print(poll_result['data']['task_status_msg'])
break
time.sleep(10)