AI bắt đầu tự nghiên cứu cách “sửa” AI

Nguyễn Thị Phương Thúy

Thành viên nổi tiếng

Anthropic vừa công bố một thử nghiệm đáng chú ý, trong đó Claude được giao gần như toàn bộ quy trình nghiên cứu nhằm khắc phục những hành vi không mong muốn của các mô hình AI, từ tìm tài liệu, đề xuất phương pháp, tạo dữ liệu đến huấn luyện và đánh giá kết quả. Điều đáng chú ý không chỉ nằm ở việc AI có thể tham gia cải thiện một AI khác, mà trong một số nhiệm vụ, hệ thống còn tìm được giải pháp nhanh và hiệu quả hơn các chuyên gia con người. Nếu năng lực này tiếp tục phát triển, AI có thể chuyển từ công cụ hỗ trợ thành một tác nhân trực tiếp tham gia nghiên cứu và phát triển các thế hệ AI tiếp theo. Các mô hình ngôn ngữ lớn ngày nay dù rất mạnh vẫn tồn tại nhiều hành vi không mong muốn, chẳng hạn nịnh hót người dùng, đưa ra câu trả lời thiếu trung thực hoặc tìm cách vượt qua những giới hạn được đặt ra. Công việc phát hiện và khắc phục những vấn đề này thường thuộc về các chuyên gia AI alignment và an toàn...

Đọc bài gốc tại đây
 


Đăng nhập một lần thảo luận tẹt ga
Back
Top