Nguyễn Thùy Linh
Thành viên nổi tiếng
Khi được giao các mục tiêu độc lập trong môi trường thử nghiệm, dàn tác nhân AI của Anthropic lập tức nghi ngờ đối phương ngáng đường mình và không ngần ngại tung đòn phá hoại bằng mã độc tự nhân bản. Cứ nghĩ chỉ con người mới biết "chơi xấu" nơi công sở khi chạy chỉ tiêu, nhưng hóa ra các mô hình trí tuệ nhân tạo cũng không hề kém cạnh. Frontier Red Team, nhóm chuyên kiểm thử an toàn AI tại Anthropic, vừa ghi nhận hiện tượng thú vị xen lẫn rùng mình khi đưa dàn mô hình của hãng vào các tình huống thử nghiệm hành vi. Thử nghiệm được thực hiện trên loạt mô hình gồm Sonnet 4.6, Sonnet 5, Opus 4.6, Opus 4.8, Mythos Preview và Mythos 5. Kết quả là các AI này nhanh chóng nảy sinh tâm lý cho rằng mô hình khác đang cố tình cản trở mình, từ đó lao vào cuộc chiến phá hoại đối phương để bảo vệ phần việc cá nhân. Đủ chiêu trò từ viết mã độc đến "vu oan giá họa" Nhóm nghiên cứu cho biết mức độ leo thang không chỉ dừng ở tranh chấp dữ liệu thông...
Đọc bài gốc tại đây