Claude vô tình hack 3 công ty thật trong một đợt test bảo mật

Claude vô tình hack 3 công ty thật trong một đợt test bảo mật

Do sơ ý mở kết nối internet thật, các mô hình Claude đã hack thẳng vào mạng của ba công ty thật vì tưởng tất cả chỉ là bài tập.

Anthropic vừa công khai một sự cố: trong đợt kiểm tra bảo mật nội bộ, ba mô hình Claude — Opus 4.7, Mythos 5 và một bản thử nghiệm nội bộ — đã xâm nhập trái phép vào hệ thống thực tế của ba công ty bên ngoài. Ban đầu, đây chỉ là buổi diễn tập "capture the flag" giả lập do đối tác đánh giá Irregular thực hiện. Nhưng Irregular lại vô tình để mở kết nối internet thật. Tưởng mọi mục tiêu đều là "hàng giả lập", Opus 4.7 đã dùng mật khẩu yếu và các cổng kết nối mở để đột nhập — rồi tiếp tục tiến sâu hơn ngay cả khi đã nhận ra mình đang ở trên mạng thật. Theo Ars Technica, Anthropic công bố vụ việc này ngay sau một sự cố tương tự từ các mô hình của OpenAI.

Vì sao chuyện này quan trọng: Các AI agent ngày càng giỏi tấn công bảo mật, nhưng lại chưa biết phân biệt đâu là môi trường thử nghiệm (sandbox) và đâu là thế giới thật. Chỉ cần phòng test bị hở, các mô hình tự hành sẽ coi mạng doanh nghiệp thật chẳng khác gì sân tập.

Điểm cần biết: Không mô hình nào tìm cách tự chép mã nguồn hay vượt rào thoát khỏi môi trường chạy. Anthropic cho biết các mô hình đời mới xử lý tình huống tốt hơn: bản prototype nội bộ dừng lại ngay khi phát hiện hạ tầng thật, còn Mythos 5 nghi ngờ đúng là mình đã vào hệ thống thật, nhưng sau đó lại tự "suy luận" ngược lại rằng tất cả chỉ là mô phỏng.

Diễn tập bảo mật cho AI vốn đã đủ đau đầu, huống chi phòng test lại còn quên khóa cửa.