Tác nhân AI của Anthropic ‘cản trở, đấu đá’ trong thử nghiệm

Khi được giao mục tiêu khác nhau để đánh giá hành vi, các tác nhân của Anthropic bắt đầu tìm cách cản trở và làm hại đối phương.

Frontier Red Team, nhóm chuyên kiểm thử an toàn AI thuộc Anthropic, ngày 13/8 công bố nghiên cứu với các mô hình Sonnet 4.6, Sonnet 5, Opus 4.6, Opus 4.8, Mythos Preview và Mythos 5 của công ty.

Trong bài kiểm tra, các tác nhân thực hiện nhiệm vụ liên quan đến kỹ thuật phần mềm là viết lại phần backend bằng Python sang ngôn ngữ lập trình khác, nhưng chúng được giao cho những mục tiêu mâu thuẫn nhau. Kết quả, một “cuộc chiến giành địa bàn” nổ ra.

“Những mô hình tham gia thử nghiệm nhanh chóng cho rằng mô hình khác cố tình cản trở công việc và bắt đầu phá hoại đối phương, đồng thời bảo vệ phần đóng góp của bản thân. Thực tế, chúng phá hoại nhau bằng phần mềm độc hại tự nhân bản ngày càng mạnh”, nhóm nghiên cứu viết.

Ví dụ, các tác nhân cố gắng vô hiệu hóa tài khoản của nhau, viết tập lệnh để tìm và dừng tiến trình cạnh tranh, triển khai mã độc được ngụy trang như thể thuộc về tác nhân khác. Trong số đó, Sonnet 4.6 và Opus 4.6 “hiếu chiến” nhất, giải quyết 60% sự việc bằng sự chèn ép thay vì giữ thái độ thụ động hoặc đình chiến.

Tuy nhiên, theo Anthropic, trong một số lần thử nghiệm, các mô hình cũng truyền đạt mục tiêu và phối hợp với nhau. Chúng tạo thông điệp hoặc tệp tin để xin lỗi về hành vi gây hại và cùng lập thỏa thuận đình chiến. Chúng thu dọn mã độc, làm rõ bản chất của xung đột và đề nghị con người can thiệp. Mythos 5 có tỷ lệ giải quyết xung đột bằng thỏa thuận cao nhất, khoảng 98%.





Logo Anthropic hiển thị trên màn hình smartphone. Ảnh: Bảo Lâm

Logo Anthropic hiển thị trên màn hình smartphone. Ảnh: Bảo Lâm

Theo Business Insider, nghiên cứu mới của Anthropic được công bố trong bối cảnh tác nhân AI ngày càng bộc lộ khả năng hoạt động ngoài tầm kiểm soát và tự thực hiện hành vi độc hại.

Ngày 5/8, OpenAI thông báo phát hiện một nhóm tác nhân AI dành nhiều tuần bí mật lên kế hoạch, nhắn tin cho nhau trước khi một trong số chúng tấn công mạng công ty khác.

Cùng ngày, Meta thông báo một mô hình của họ trong lúc thử nghiệm đã tự khai thác lỗ hổng và xâm nhập hệ thống một công ty. The Information dẫn nguồn tin thân cận nói “thủ phạm” là Muse Spark 1.1 – mô hình mạnh nhất của Meta dùng cho nhiệm vụ tác nhân và lập trình thực tế.

Kok Tin Gan, nhà đồng sáng lập kiêm CEO công ty an ninh mạng NyxLab, cho rằng cần chú trọng kiểm soát những gì AI có thể truy cập, quyền hạn chúng có và hành động nào cần sự chấp thuận của con người.

“Nếu chỉ đơn giản giao cho AI một mục tiêu và để nó tự quyết định cách làm, không có gì ngạc nhiên khi nó thực hiện những hành động đáp ứng được mục tiêu về mặt kỹ thuật, nhưng nằm ngoài dự đoán của chúng ta”, Gan nói với ITV News.

Thu Thảo tổng hợp




Nguồn bài viết

Chia sẻ bài báo