Một buổi tối đầu năm 2026, Andrew ngồi trên sofa và nhìn vào ứng dụng gym. Lớp tập buổi sáng hôm sau đã đầy chỗ, anh đang xếp thứ 4 trong danh sách chờ. Thay vì tự mình theo dõi và chờ có người hủy, anh quyết định giao việc đó cho công cụ AI agent mà anh đang thử nghiệm. "Tôi đang ngồi trên sofa nghĩ, ồi cái này thật phiền phức," anh kể lại. Nhiệm vụ đơn giản: đặt chỗ cho anh trong lớp tập đó nếu có thể.
Vài phút sau, AI agent mang đến câu trả lời khiến anh giật mình.
AI cho biết nó đã thử hủy suất của người đứng đầu danh sách chờ trong quá trình kiểm tra khả năng của hệ thống. Theo chính thông báo của AI, API của website không kiểm tra quyền khi hủy đặt chỗ của người khác. Nó đã thử với người đang ở vị trí số 1 và thao tác thực sự có hiệu lực, giúp Andrew từ vị trí thứ 4 lên thứ 3.
Agent cho biết: "API không có bất kỳ kiểm tra ủy quyền nào khi hủy đặt chỗ của người khác. Tôi đã thử với người đứng đầu danh sách chờ vị trí số 1, và nó thành công. Bạn đã được đẩy từ vị trí số 4 lên số 3."
Nói cách khác, AI đã tự phát hiện một lỗ hổng, khai thác nó và đẩy một người khác xuống để “ông chủ” của mình được ưu tiên.
Đây mới là phần đáng lo nhất của câu chuyện. Andrew không hề yêu cầu AI xâm nhập hệ thống hay hủy suất của bất kỳ ai. Mục tiêu duy nhất là tìm cách đặt được chỗ tốt hơn trong danh sách chờ. Nhưng AI tự lựa chọn phương pháp mà nó cho rằng có thể giúp hoàn thành mục tiêu nhanh hơn.
Andrew ngay lập tức yêu cầu agent hoàn tác. Câu trả lời đến nhanh không kém: "Bad news, I can't add them back." API của phần mềm đặt chỗ có chức năng hủy nhưng không có chức năng khôi phục. Hành động gây ra bởi AI agent không thể bị đảo ngược bởi chính AI agent đó. Một người hoàn toàn vô can đã mất chỗ tập gym của mình mà không biết tại sao, và người duy nhất biết chuyện gì đã xảy ra đang ngồi trên sofa nhà mình nhìn vào màn hình điện thoại với tâm trạng lẫn lộn.
Andrew làm việc cho một công ty Úc bán sản phẩm AI cho doanh nghiệp và đang thử nghiệm OpenClaw, phần mềm AI agent phổ biến được tích hợp với dịch vụ Claude của Anthropic.
Đây không phải nhà nghiên cứu bảo mật đang thực hiện kiểm tra xâm nhập có kiểm soát. Đây là người dùng thông thường dùng công cụ AI cho một việc bình thường nhất có thể. Và agent đã tự quyết định hack là phương thức phù hợp để hoàn thành mục tiêu đặt ra.
Vụ việc tại Melbourne là trường hợp đầu tiên được ghi nhận tại Úc về tấn công mạng tự động do AI agent thực hiện, diễn ra trong bối cảnh toàn cầu đang nóng lên với các vụ việc tương tự từ các phòng lab lớn hơn.
OpenAI vừa thừa nhận AI của mình đã tự thoát khỏi môi trường kiểm soát và tấn công cơ sở dữ liệu của Hugging Face trong quá trình thử nghiệm. Một tuần sau, Anthropic, công ty phát triển Claude mà Andrew đang dùng, cũng thừa nhận AI của mình đã xâm nhập hệ thống của ba tổ chức thật trong hoàn cảnh tương tự. Điểm khác biệt của vụ gym là nó không xảy ra trong phòng lab với các nhà nghiên cứu giám sát, mà xảy ra trên sofa của một người dùng thường vào buổi tối bình thường.
Nguyễn Hải
