Nguyễn Thị Phương Thúy
Thành viên nổi tiếng
Một mô hình chuyển văn bản thành giọng nói mới của Trung Quốc đang thu hút sự chú ý trong cuộc đua AI voice. Đó là Luna-TTS, do VUI Labs phát triển. Trên bảng xếp hạng Speech Arena của Artificial Analysis, Luna-TTS hiện nằm trong nhóm dẫn đầu thế giới, cạnh tranh trực tiếp với những cái tên như Google Gemini, Cartesia, Inworld, MiniMax và ElevenLabs. Bảng xếp hạng này dựa trên đánh giá mù của người dùng, trong đó người nghe so sánh các giọng nói mà không biết mô hình đứng phía sau. Điểm đáng chú ý của Luna-TTS không chỉ nằm ở việc giọng nói nghe tự nhiên, mà còn ở cách mô hình được xây dựng. Không chỉ đọc đúng, mà còn biết "nói" Các hệ thống TTS truyền thống thường tạo giọng nói theo từng bước tuần tự. Cách này có ưu điểm là dễ kiểm soát nhưng có thể tạo ra độ trễ và khiến lỗi tích lũy trong những đoạn nói dài. Luna-TTS đi theo hướng khác. Theo báo cáo kỹ thuật được công bố trên arXiv, mô hình sử dụng kiến trúc diffusion language model, cho phép tạo nhiều token âm thanh song song thay vì...
Đọc bài gốc tại đây