Luna-TTS: Mô hình giọng nói Trung Quốc gây chú ý với khả năng tạo giọng tự nhiên và thời gian thực

Nguyễn Thị Phương Thúy

Thành viên nổi tiếng

Một mô hình chuyển văn bản thành giọng nói mới của Trung Quốc đang thu hút sự chú ý trong cuộc đua AI voice. Đó là Luna-TTS, do VUI Labs phát triển. Trên bảng xếp hạng Speech Arena của Artificial Analysis, Luna-TTS hiện nằm trong nhóm dẫn đầu thế giới, cạnh tranh trực tiếp với những cái tên như Google Gemini, Cartesia, Inworld, MiniMax và ElevenLabs. Bảng xếp hạng này dựa trên đánh giá mù của người dùng, trong đó người nghe so sánh các giọng nói mà không biết mô hình đứng phía sau. Điểm đáng chú ý của Luna-TTS không chỉ nằm ở việc giọng nói nghe tự nhiên, mà còn ở cách mô hình được xây dựng. Không chỉ đọc đúng, mà còn biết "nói" Các hệ thống TTS truyền thống thường tạo giọng nói theo từng bước tuần tự. Cách này có ưu điểm là dễ kiểm soát nhưng có thể tạo ra độ trễ và khiến lỗi tích lũy trong những đoạn nói dài. Luna-TTS đi theo hướng khác. Theo báo cáo kỹ thuật được công bố trên arXiv, mô hình sử dụng kiến trúc diffusion language model, cho phép tạo nhiều token âm thanh song song thay vì...

Đọc bài gốc tại đây
 


Đăng nhập một lần thảo luận tẹt ga
Back
Top