Dùng thử MiniMax H3 Reference-to-Video API với tối đa chín hình ảnh, ba video và ba nội dung âm thanh tham chiếu, cùng đầu ra 2K và thời lượng linh hoạt 5–15 giây.
// Step 1: Submit generation request with image, video, and audio references
const response = await fetch('https://api.flaq.ai/api/v1/video/task', {
method: 'POST',
headers: {
: ,
:
},
: .({
: ,
: ,
: ,
: ,
: ,
: [],
: [],
: []
})
});
{ data } = response.();
taskId = data.;
mediaReferenceResponse = (, {
: ,
: {
: ,
:
},
: .({
: ,
: ,
: ,
: ,
: ,
: [
,
],
: [],
: []
})
});
{ : mediaReferenceData } = mediaReferenceResponse.();
mediaReferenceTaskId = mediaReferenceData.;
API chuyển tham chiếu thành video MiniMax H3 tạo các chuỗi video từ câu lệnh và một bộ tham chiếu hình ảnh hoặc âm thanh. Ứng dụng có thể sử dụng đầu vào hình ảnh, video và âm thanh để định hướng đặc điểm nhận diện của chủ thể, phong cách, hướng cảnh và chuyển động, đồng thời duy trì quy trình phù hợp với hoạt động sản xuất sáng tạo có cấu trúc trên Best Image AI.
Đầu vào tham chiếu đa phương thức: Kết hợp tham chiếu hình ảnh, video và âm thanh để cung cấp bối cảnh sáng tạo phong phú hơn cho tác vụ tạo.
Kiểm soát vai trò tham chiếu: Giải thích cách mỗi tham chiếu tác động đến chủ thể, môi trường, phong cách, âm thanh hoặc chuyển động trong chuỗi được yêu cầu.
Tính nhất quán của chủ thể và phong cách: Sử dụng tài liệu tham chiếu để duy trì sự đồng nhất của chủ thể dễ nhận biết, ngôn ngữ hình ảnh và định hướng chiến dịch xuyên suốt các clip được tạo.
Phát triển cảnh theo câu lệnh: Thêm chỉ dẫn bằng ngôn ngữ tự nhiên về hành động, chuyển động máy quay, bố cục, nhịp độ và bầu không khí.
Quy trình tham chiếu linh hoạt: Xây dựng công cụ sáng tạo kết hợp nhiều tài nguyên tham chiếu trong khi vẫn giữ luồng tác vụ do ứng dụng kiểm soát.
Hỗ trợ xem xét sản xuất: Theo dõi tác vụ tạo và xem xét clip kết quả về tính nhất quán hình ảnh, lỗi không mong muốn và mức độ tuân thủ tham chiếu.
Đầu vào: Một hoặc nhiều tham chiếu hình ảnh, video hoặc âm thanh được hỗ trợ cùng với câu lệnh tạo bằng ngôn ngữ tự nhiên.
Ánh xạ tham chiếu: Mô tả vai trò của từng đầu vào và xác định đặc điểm chủ thể, phong cách, chuyển động hoặc âm thanh mà đầu vào đó cần định hướng.
Đầu ra: Một chuỗi video đã tạo được trả về qua quy trình tác vụ Best Image AI để xem xét và xử lý tiếp.
Xử lý tác vụ: Lưu mã định danh tác vụ, thăm dò cho đến khi hoàn tất và kiểm tra clip trước khi xuất bản hoặc chỉnh sửa thêm.
Kiểm soát sáng tạo: Sử dụng các thiết lập thời lượng, độ phân giải, tỷ lệ khung hình và tham chiếu hiện có cho quy trình mục tiêu.
Tính liên tục của nhân vật và chủ thể: Giữ cho nhân vật, sản phẩm hoặc chủ thể hình ảnh dễ nhận biết nhất quán trong các cảnh mới.
Sản xuất chiến dịch thương hiệu: Kết hợp tham chiếu phong cách, tài nguyên chiến dịch và định hướng âm thanh để khám phá các biến thể sáng tạo đồng bộ.
Phát triển bảng phân cảnh và cảnh quay: Sử dụng nhiều tham chiếu để định hướng bố cục cảnh, chuyển động máy quay và tính liên tục hình ảnh.
Công cụ sáng tạo đa phương thức: Xây dựng ứng dụng cho phép người dùng định hướng quá trình tạo bằng hình ảnh, video và âm thanh thay vì chỉ bằng văn bản.
Quy trình biến thể tài nguyên: Tạo các phương án thay thế có kiểm soát trong khi duy trì ngôn ngữ hình ảnh của nguồn sáng tạo hiện có.
Lưu ý Chất lượng tham chiếu, độ rõ ràng của câu lệnh và vai trò được gán cho từng đầu vào sẽ ảnh hưởng đến kết quả cuối cùng. Hãy kiểm tra tính nhất quán của hình ảnh và âm thanh trước khi dùng nội dung được tạo trong sản xuất.
MiniMax H3 so với Kling 3.0 chuyển tham chiếu thành video: Kling cung cấp khả năng tạo video theo tham chiếu mạnh mẽ. MiniMax H3 tạo khác biệt bằng quy trình đa phương thức có thể kết hợp tham chiếu hình ảnh, video và âm thanh trong một định hướng sáng tạo.
MiniMax H3 so với Seedance 2.0 chuyển tham chiếu thành video: Seedance 2.0 hỗ trợ nhiều chế độ tạo nội dung nghe nhìn. MiniMax H3 là lựa chọn tập trung cho ứng dụng cần xây dựng cảnh theo tham chiếu và kiểm soát tác vụ.
MiniMax H3 so với Vidu Q3 chuyển tham chiếu thành video: Vidu Q3 được thiết kế để tạo video nhất quán dựa trên tham chiếu. MiniMax H3 nhấn mạnh khả năng ánh xạ câu lệnh linh hoạt trên nhiều loại phương tiện tham chiếu.
MiniMax H3 so với Wan 2.7 chuyển tham chiếu thành video: Wan 2.7 hỗ trợ tham chiếu hình ảnh, video và âm thanh cho quy trình đa phương thức. MiniMax H3 mang đến một khái niệm dựa trên tham chiếu tương đương với hướng tích hợp MiniMax riêng biệt.
MiniMax H3 so với tính năng tham chiếu của Runway Gen-4: Runway cung cấp không gian làm việc hình ảnh rộng xoay quanh các tham chiếu. MiniMax H3 phù hợp với các nhóm muốn cung cấp khả năng tạo dựa trên tham chiếu thông qua sản phẩm API hoặc chuỗi nội dung riêng.
// Step 2: Poll for results
const taskId = data.task_id;
const pollResult = async (taskId) => {
const res = await fetch(`https://api.flaq.ai/api/v1/video/${taskId}`, {
headers: { 'Authorization': 'Bearer YOUR_API_KEY' }
});
return res.json();
};
while (true) {
const pollResultData = await pollResult(taskId);
const status = pollResultData.data.task_status;
if (status === 'succeed') {
console.log(pollResultData.data.task_result.videos[0].url);
break;
}
if (status === 'failed') {
console.error(pollResultData.data.task_status_msg);
break;
}
await new Promise(resolve => setTimeout(resolve, 10000));
}
# Step 1: Submit generation request with image, video, and audio references
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/video/task',
headers={
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
json={
'model_name': 'minimax-h3-reference-to-video',
'prompt': 'Use image one for the subject, video one for the movement, and audio one for the atmosphere',
'resolution': '2k',
'duration': 8,
'aspect_ratio': '16:9',
'images': ['https://example.com/subject-reference.jpg'],
'videos': ['https://example.com/motion-reference.mp4'],
'audios': ['https://example.com/atmosphere-reference.mp3']
}
)
result = response.json()
task_id = result['data']['task_id']
# Use the @ (AT) reference feature in prompt through <<<...>>> placeholders.
# Placeholder numbering is 1-based for each media array:
# <<<image_1>>> = images[0], <<<image_2>>> = images[1]
# <<<video_1>>> = videos[0], <<<audio_1>>> = audios[0]
media_reference_response = requests.post(
'https://api.flaq.ai/api/v1/video/task',
headers={
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
json={
'model_name': 'minimax-h3-reference-to-video',
'prompt': 'Place the explorer from <<<image_1>>> in the environment from <<<image_2>>>, following the camera movement in <<<video_1>>> and speaking with the reference voice from <<<audio_1>>>',
'resolution': '2k',
'duration': 10,
'aspect_ratio': '16:9',
'images': [
'https://example.com/explorer-reference.jpg',
'https://example.com/environment-reference.jpg'
],
'videos': ['https://example.com/camera-movement-reference.mp4'],
'audios': ['https://example.com/voice-reference.mp3']
}
)
media_reference_result = media_reference_response.json()
media_reference_task_id = media_reference_result['data']['task_id']
# Step 2: Poll for results
task_id = response.json()['data']['task_id']
poll_url = f"https://api.flaq.ai/api/v1/video/{task_id}"
while True:
poll_result = requests.get(poll_url, headers={'Authorization': 'Bearer YOUR_API_KEY'}).json()
status = poll_result['data']['task_status']
if status == 'succeed':
print(poll_result['data']['task_result']['videos'][0]['url'])
break
if status == 'failed':
print(poll_result['data']['task_status_msg'])
break
time.sleep(10)
# Step 1: Submit generation request with image, video, and audio references
curl -X POST https://api.flaq.ai/api/v1/video/task \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model_name": "minimax-h3-reference-to-video",
"prompt": "Use image one for the subject, video one for the movement, and audio one for the atmosphere",
"resolution": "2k",
"duration": 8,
"aspect_ratio": "16:9",
"images": ["https://example.com/subject-reference.jpg"],
"videos": ["https://example.com/motion-reference.mp4"],
"audios": ["https://example.com/atmosphere-reference.mp3"]
}'
# Use the @ (AT) reference feature in prompt through <<<...>>> placeholders.
# Placeholder numbering is 1-based for each media array:
# <<<image_1>>> = images[0], <<<image_2>>> = images[1]
# <<<video_1>>> = videos[0], <<<audio_1>>> = audios[0]
curl -X POST https://api.flaq.ai/api/v1/video/task \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model_name": "minimax-h3-reference-to-video",
"prompt": "Place the explorer from <<<image_1>>> in the environment from <<<image_2>>>, following the camera movement in <<<video_1>>> and speaking with the reference voice from <<<audio_1>>>",
"resolution": "2k",
"duration": 10,
"aspect_ratio": "16:9",
"images": [
"https://example.com/explorer-reference.jpg",
"https://example.com/environment-reference.jpg"
],
"videos": ["https://example.com/camera-movement-reference.mp4"],
"audios": ["https://example.com/voice-reference.mp3"]
}'
# Step 2: Poll for results
# Replace {task_id} with the task_id returned from the submit response
curl -X GET "https://api.flaq.ai/api/v1/video/{task_id}" \
-H "Authorization: Bearer YOUR_API_KEY"