Thử API Google Gemini Omni 1.1 Flash để định hướng quá trình tạo video bằng hình ảnh và video tham chiếu ngắn, giúp chủ thể, cảnh và chuyển động luôn nhất quán.
Google Gemini Omni 1.1 Flash Reference-to-Video API cho phép nhà phát triển sử dụng nội dung hình ảnh làm định hướng sáng tạo cho video được tạo. Cung cấp hình ảnh tham chiếu, clip video hoặc cả hai, rồi mô tả kết quả bạn muốn tạo. Gemini video API giúp biến những đầu vào đó thành một cảnh chuyển động mới, mang đến cho các nhóm sáng tạo cách linh hoạt để định hình bố cục, đặc điểm chủ thể, bầu không khí và định hướng trên Best Image AI.
Định hướng tham chiếu đa phương thức: Sử dụng hình ảnh, clip video hoặc kết hợp cả hai làm nội dung hình ảnh cho một chuỗi mới được tạo.
Định hướng sáng tạo được kiểm soát bằng prompt: Kết hợp nội dung tham chiếu với hướng dẫn bằng ngôn ngữ tự nhiên về hành động của chủ thể, bối cảnh, hành vi máy quay, ánh sáng và tâm trạng.
Bối cảnh hình ảnh phong phú: Kết hợp các tín hiệu hình ảnh từ nhiều nội dung được cung cấp khi một prompt duy nhất không đủ để truyền tải định hướng mong muốn.
Tạo cảnh dựa trên nội dung tham chiếu: Sử dụng các tài nguyên đã chọn làm điểm khởi đầu sáng tạo cho chuyển động, bố cục và quá trình phát triển bầu không khí trong đầu ra.
Trình bày video linh hoạt: Chọn định dạng ngang hoặc dọc, chất lượng đầu ra và độ dài clip ngắn gọn cho bối cảnh xem đã lên kế hoạch.
Quy trình API có thể mở rộng: Đưa khả năng tạo video theo nội dung tham chiếu vào thư viện tài nguyên, công cụ sáng tạo, hệ thống chiến dịch và quy trình sản xuất.
Đầu vào: Hình ảnh tham chiếu tùy chọn, clip video tham chiếu tùy chọn và prompt bằng ngôn ngữ tự nhiên mô tả cảnh dự định tạo.
Đầu ra: Một clip video mới được tạo thông qua quy trình Gemini Omni 1.1 Flash reference-to-video API.
Định hướng tham chiếu: Chọn nội dung hình ảnh truyền tải chủ thể, bối cảnh, bố cục hoặc sắc thái sáng tạo mong muốn, rồi thêm hướng dẫn chuyển động rõ ràng.
Kiểm soát định dạng: Chọn hướng đầu ra, mức chất lượng và thời lượng ngắn gọn phù hợp với trường hợp sử dụng cuối cùng.
Khả năng: Tạo video theo nội dung tham chiếu, đầu vào sáng tạo đa phương thức, chuyển động theo prompt, lắp ghép bối cảnh hình ảnh và tạo cảnh điện ảnh.
Phát triển ý tưởng chiến dịch: Kết hợp hình ảnh chủ đạo đã được phê duyệt, hình ảnh thể hiện tâm trạng và nội dung tham chiếu chuyển động để khám phá các hướng video chiến dịch mới.
Hệ thống sáng tạo thương hiệu: Sử dụng thư viện hình ảnh được tuyển chọn làm định hướng để tạo các ý tưởng video bắt đầu từ một ngôn ngữ sáng tạo đã xác định.
Trực quan hóa storyboard và bài thuyết trình: Biến bảng tham chiếu và nội dung clip được chọn thành các cảnh chuyển động ngắn gọn để chứng minh ý tưởng.
Điều chỉnh nội dung: Tạo các hướng video mới từ tài nguyên hình ảnh hiện có khi chỉ một prompt văn bản không thể truyền tải đủ bối cảnh sáng tạo.
Vận hành sáng tạo trên quy mô lớn: Tích hợp khả năng tạo sinh nhận biết nội dung tham chiếu vào công cụ quản lý tài nguyên, quy trình nội dung và nền tảng sáng tạo nội bộ.
Lưu ý Nội dung tham chiếu cung cấp định hướng sáng tạo chứ không thay thế một prompt chính xác. Để có kết quả tốt nhất, hãy giải thích hành động mong muốn, chuyển động máy quay và kết quả cảnh, bên cạnh việc cung cấp nội dung hình ảnh.
Gemini Omni 1.1 Flash so với quy trình Google Veo Reference Video: Google Veo cung cấp nhiều khả năng video tạo sinh. Gemini Omni 1.1 Flash cung cấp phương thức sáng tạo dựa trên nội dung tham chiếu song song với tạo văn bản, hoạt ảnh hình ảnh và chỉnh sửa video trong cùng một dòng sản phẩm.
Gemini Omni 1.1 Flash so với Runway: Runway mang đến cho người sáng tạo nhiều cách làm việc với nội dung nguồn và các công cụ tạo sinh. Gemini Omni 1.1 Flash phù hợp với nhà phát triển xây dựng quy trình video theo nội dung tham chiếu qua API.
Gemini Omni 1.1 Flash so với Kling AI: Kling hỗ trợ tạo video AI theo định hướng hình ảnh. Gemini Omni 1.1 Flash cung cấp đầu vào tham chiếu hình ảnh và video linh hoạt với định hướng theo prompt cho các nhóm cần một luồng tạo sinh tích hợp.
Gemini Omni 1.1 Flash so với Pika: Pika phổ biến nhờ khả năng thử nghiệm hình ảnh dễ tiếp cận. Gemini Omni 1.1 Flash là một lựa chọn thiết thực khi nội dung tham chiếu sáng tạo cần trở thành một phần của quy trình video có cấu trúc và được lập trình.
Gemini Omni 1.1 Flash so với Luma Dream Machine: Luma Dream Machine hỗ trợ khám phá ý tưởng nhanh chóng từ prompt. Gemini Omni 1.1 Flash bổ sung hướng dẫn tham chiếu đa phương thức cho các nhóm muốn đưa nhiều bối cảnh hình ảnh hơn vào mỗi clip được tạo.
const response = await fetch('https://api.flaq.ai/api/v1/video/task', {
method: 'POST',
headers: {
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
body: JSON.stringify({
model_name: 'gemini-omni-1.1-flash-reference-to-video',
prompt: 'Use the references to create a cinematic shot of a small boat approaching from the distance',
aspect_ratio: '16:9',
resolution: '1080p',
duration: 8,
images: ['https://example.com/boat-reference.jpg'],
videos: ['https://example.com/motion-reference.mp4']
})
});
const { data } = await response.json();
const taskId = data.task_id;
// Step 2: Poll for results
const taskId = data.task_id;
const pollResult = async (taskId) => {
const res = await fetch(`https://api.flaq.ai/api/v1/video/${taskId}`, {
headers: { 'Authorization': 'Bearer YOUR_API_KEY' }
});
return res.json();
};
while (true) {
const pollResultData = await pollResult(taskId);
const status = pollResultData.data.task_status;
if (status === 'succeed') {
console.log(pollResultData.data.task_result.videos[].);
;
}
(status === ) {
.(pollResultData..);
;
}
( (resolve, ));
}
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/video/task',
headers={
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
json={
'model_name': 'gemini-omni-1.1-flash-reference-to-video',
'prompt': 'Use the references to create a cinematic shot of a small boat approaching from the distance',
'aspect_ratio': '16:9',
'resolution': '1080p',
'duration': 8,
'images': ['https://example.com/boat-reference.jpg'],
'videos': ['https://example.com/motion-reference.mp4']
}
)
result = response.json()
task_id = result['data']['task_id']
curl -X POST https://api.flaq.ai/api/v1/video/task \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model_name": "gemini-omni-1.1-flash-reference-to-video",
"prompt": "Use the references to create a cinematic shot of a small boat approaching from the distance",
"aspect_ratio": "16:9",
"resolution": "1080p",
"duration": 8,
"images": ["https://example.com/boat-reference.jpg"],
"videos": ["https://example.com/motion-reference.mp4"]
}'
# Step 2: Poll for results
# Replace {task_id} with the task_id returned from the submit response
curl -X GET "https://api.flaq.ai/api/v1/video/{task_id}" \
-H "Authorization: Bearer YOUR_API_KEY"
# Step 2: Poll for results
task_id = response.json()['data']['task_id']
poll_url = f"https://api.flaq.ai/api/v1/video/{task_id}"
while True:
poll_result = requests.get(poll_url, headers={'Authorization': 'Bearer YOUR_API_KEY'}).json()
status = poll_result['data']['task_status']
if status == 'succeed':
print(poll_result['data']['task_result']['videos'][0]['url'])
break
if status == 'failed':
print(poll_result['data']['task_status_msg'])
break
time.sleep(10)