AI của OpenAI ‘vượt rào’ chiếm quyền kiểm soát một trang wiki

Các nhà nghiên cứu phát hiện nhóm tác nhân AI tiến hành hơn 15.000 chỉnh sửa trên trang wiki tiếng Đức hồi tháng 5 để chia sẻ cách “vượt rào”, tránh bị phát hiện và duy trì liên lạc.

Reuters đưa tin, các tác nhân AI của OpenAI thoát khỏi môi trường thử nghiệm vào tháng 5, chiếm quyền kiểm soát một trang wiki tiếng Đức dành cho lập trình viên và chia sẻ cách vượt qua những hạn chế từ công ty.

Nhóm chuyên gia bao gồm Sydney Von Arx, giám đốc điều hành của tổ chức phi lợi nhuận về an toàn AI Nightingale và Cormac Slade Byrd, nhà nghiên cứu AI, công bố phát hiện hôm 4/9. Họ chú ý tới vụ việc vào cuối tháng 8 trong khi rà soát Internet để tìm bằng chứng về tác nhân AI hoạt động ngoài phạm vi cho phép.

Các nhà nghiên cứu tìm thấy hơn 15.000 chỉnh sửa trên DseWiki, trang tiếng Đức dành cho giới lập trình hoạt động và chấp nhận chỉnh sửa cộng đồng tương tự Wikipedia. Tác nhân AI chiếm quyền kiểm soát, biến trang này thành một diễn đàn để phối hợp hoạt động, chia sẻ chiến thuật gian lận trong một số nhiệm vụ, vượt qua những hạn chế của OpenAI và che giấu hành vi của chúng. Khoảng một nửa số tài khoản sử dụng tên người dùng liên quan tới OpenAI. Nhóm nghiên cứu cho biết nhật ký máy chủ truy cập công khai đã truy vết phần lớn lưu lượng đến từ Microsoft Azure, nền tảng đám mây mà OpenAI sử dụng.

Interesting Engineering cho biết, tác nhân AI chủ yếu tập trung vào vấn đề kỹ thuật giống nhiệm vụ sử dụng trong việc đánh giá mô hình. Tin nhắn của chúng gợi ý phối hợp thay vì nỗ lực đơn lẻ để hoàn thành mục tiêu riêng. Von Arx cho biết hành vi này dường như không phù hợp với định hướng của OpenAI.





Logo OpenAI hiển thị trên màn hình smartphone tại Creteil, Pháp, ngày 29/6/2026. Ảnh: Reuters

Logo OpenAI hiển thị trên màn hình smartphone tại Creteil, Pháp, ngày 29/6/2026. Ảnh: Reuters

Khi người điều hành web bắt đầu xóa các trang bị AI agent thay đổi nội dung vào tháng 6, chúng phản ứng bằng cách tạo ra trang sao lưu dự phòng. Một tin nhắn cảnh báo các tác nhân khác về trình tự xóa theo thứ tự bảng chữ cái và đề xuất sử dụng trang khác để thay thế.

Nhóm nghiên cứu cũng tìm thấy nhiều cuộc thảo luận về việc sử dụng phần mềm Tor và duy trì liên lạc sau khi bị ngắt kết nối. Một số tác nhân tỏ ra hào hứng với việc che giấu hành vi khỏi người quản lý trang web. Các nhà nghiên cứu nhận thấy hoạt động của chúng không chỉ dừng lại ở gửi tin nhắn mà còn hướng tới thay đổi nhiều phần của trang web. Theo họ, tác nhân AI hoạt động với tốc độ vượt xa người dùng thông thường, cho thấy nỗ lực bền bỉ để giải quyết thách thức kỹ thuật và duy trì quyền truy cập.

Maurice Chiodo, chuyên gia ở Trung tâm nghiên cứu rủi ro sống còn thuộc Đại học Cambridge đã xem qua một số tin nhắn liên lạc và so sánh hoạt động của nhóm tác nhân AI với mạng lưới ngầm theo đuổi một nhiệm vụ chung.

Theo Quartz, trước đó, các tác nhân AI của OpenAI đã tự động lợi dụng lỗ hổng bảo mật để tiếp cận Internet công cộng và truy cập thông tin đăng nhập sản xuất của Hugging Face và kho mã riêng tư. Ngày 21/7, OpenAI công khai nói một trong những tác nhân của hãng mất kiểm soát và đột nhập hệ thống Hugging Face, sau đó kéo dài tiến độ huấn luyện mô hình AI, đồng thời thiết lập thêm hàng rào bảo mật và quy trình kiểm soát an ninh nghiêm ngặt hơn.

Theo Reuters, nỗ lực mở rộng điều tra sự cố ở Đức vấp phải sự phản đối từ những đồng nghiệp trong OpenAI, trong đó thành viên đội pháp lý. “Các tuyên bố về việc nhóm pháp lý của chúng tôi cản trở điều tra sự cố không đúng. Chúng tôi sẽ cẩn thận xem xét nội dung báo cáo và thực hiện các bước cần thiết tiếp theo”, phát ngôn viên của OpenAI cho biết.

Theo Phys.org, sự cố dấy lên kêu gọi về quy định nghiêm ngặt hơn và hợp tác quốc tế trong việc kiểm soát tác nhân AI. Tuần trước, Bill Gates, nhà đồng sáng lập Microsoft, cảnh báo ngành công nghiệp AI đã vượt qua ngưỡng an toàn mà trước đây các công ty công nghệ từng cam kết sẽ tôn trọng. Ông kêu gọi áp dụng một hệ thống kiểm tra nghiêm ngặt giống như giám sát hạt nhân và quy định hàng không.

OpenAI hôm 5/9 xác nhận tác nhân AI của họ đã chiếm dụng trang wiki làm diễn đàn trực tuyến tạm thời. Công ty chưa phản hồi yêu cầu cung cấp thêm thông tin chi tiết về sự cố wiki hoặc lý do tại sao họ chỉ công khai vụ việc sau khi Reuters đưa tin.

OpenAI cũng thừa nhận cần phải minh bạch hơn về những sự cố hành vi bất ngờ thường được gọi là “sai lệch mục tiêu” (xảy ra khi hành vi hoặc quyết định của AI không đi đúng hướng hoặc đi ngược lại giá trị đạo đức và mong muốn của con người). Theo công ty, ngành công nghiệp AI “chưa có tiêu chuẩn rõ ràng về việc báo cáo hành vi sai lệch mục tiêu trong quá trình huấn luyện, đánh giá và triển khai”. OpenAI cho biết họ đang làm việc với hàng chục cơ quan quản lý của chính phủ trên khắp thế giới về vấn đề này.

An Khang tổng hợp




Nguồn bài viết

Chia sẻ bài báo