Hue Hoang
Thành viên nổi tiếng
Tạo một đoạn video ngắn bằng AI thì dễ, nhưng ghép nhiều cảnh để chúng ăn nhập liền mạch lại là chuyện khác. Với bản cập nhật Gemini Omni 1.1 Flash, Google đang muốn xóa bỏ cảm giác chắp vá bằng khả năng ghi nhớ ngữ cảnh tốt hơn, kéo dài thời lượng và tối ưu chi phí dựng nháp. Hết cảnh "đầu một đằng, đuôi một nẻo" khi nối cảnh Vấn đề lớn nhất của các mô hình tạo video AI hiện nay nằm ở tính nhất quán. Nhân vật vừa ở khung hình trước sang khung hình sau đã biến thành người khác, hoặc bối cảnh xung quanh đột ngột thay đổi hướng đi. Gemini Omni 1.1 Flash giải quyết điểm nghẽn này bằng việc mở rộng bộ nhớ ngữ cảnh. Thay vì chỉ nhìn vào đúng 1 giây cuối cùng của cảnh quay trước để "đoán mò" những gì diễn ra tiếp theo, mô hình mới có thể xem lại tới 10 giây nội dung liền trước. Việc nắm trọn mạch chuyển động này giúp nhân vật giữ nguyên diện mạo, môi trường giữ đúng chi tiết và hướng phát triển của cảnh quay không bị bẻ lái bất thình...
Đọc bài gốc tại đây