Nguyễn Thùy Linh✔
Thành viên nổi tiếng
Trước khi so sánh, cần lưu ý Gemini 4 Argon vừa mới ra mắt và chưa được công khai cho người dùng phổ thông. Hiện mô hình chỉ được cung cấp cho một số đối tác an ninh mạng trong chương trình nội bộ Fairwind của Google, nên mọi đánh giá về năng lực lập trình của Argon ở thời điểm này đều dựa trên thông tin do Google công bố và trải nghiệm ban đầu từ nhóm người dùng hạn chế được tiếp cận trước, chưa phải là đánh giá rộng rãi từ cộng đồng lập trình viên thực tế. Với nhu cầu lập trình, dữ liệu benchmark công khai hiện nghiêng về phía Claude trong một số hạng mục cụ thể. Trên bài kiểm tra Terminal-Bench 4.0, chuyên đánh giá năng lực tác nhân lập trình xử lý các nhiệm vụ khó trong môi trường dòng lệnh, Claude Fable 5.1 của Anthropic vẫn giữ vị trí dẫn đầu. Gemini 4 Argon lại được đánh giá cao ở hướng khác, đó là xử lý ngữ cảnh siêu dài với giới hạn đầu ra lên tới 1 triệu token mỗi lượt. Khả năng này có lợi thế khi cần phân tích hoặc...
Đọc bài gốc tại đây
