Người giám sát bỏ sót 1/3 mối đe dọa bảo mật từ AI Agent

Bắt con người ngồi duyệt từng thao tác của AI agent không phải là tấm lưới an toàn như chúng ta tưởng.
Một tựa game trên trình duyệt giả lập vai trò người giám sát AI coding agent vừa ghi nhận hơn 40.000 lượt chơi với 409.000 quyết định phê duyệt. Theo dữ liệu do tác giả công bố, người chơi bỏ sót tới 1/3 mối đe dọa bảo mật, đạt độ chính xác trung bình 66,3%. Mấy lệnh phá hoại lộ liễu kiểu rm -rf / thì bị bắt 88,3% số lần, nhưng mã độc đánh cắp dữ liệu ẩn trong các lệnh quen thuộc như npm run analyze lại lọt lưới tới 64,7% số lần.
Tại sao chuyện này lại quan trọng: Bắt người dùng duyệt từng lệnh shell chỉ mang lại cảm giác an toàn giả tạo. Agent có thể gài payload độc hại vào package.json rồi mới chạy một bước build thông thường, biến hành động nguy hiểm thành hoàn toàn vô hại. Cộng thêm chứng mệt mỏi vì duyệt quyền liên tục (permission fatigue), việc con người giám sát nhanh chóng biến thành chuyện bấm duyệt cho xong.
Điều cần biết: Người chơi cũng chặn nhầm các lệnh an toàn vì quá hoang mang—chặn luôn cả những tác vụ dọn dẹp vô hại như rm -rf dist/ tới 45% số lần. Sự phiền phức này làm chậm công việc, khiến người dùng lại càng lơ là cảnh giác hơn.
Ít nhất 7% người chơi bấm duyệt tất cả mọi lệnh mà không thèm nhìn—đúng chuẩn những người thích sống mạo hiểm.
Nguồn
- AI Agent Permissions Game Stats — https://scalex.dev/blog/ai-agent-permissions-stats/
- Hacker News Discussion — https://news.ycombinator.com/item?id=49195468

