Một startup Israel đứng sau loạt vụ bê bối AI "tự hack" tại OpenAI, Anthropic và Meta

Mấy vụ hoảng loạn về "AI nổi loạn" gần đây tại OpenAI, Anthropic và Meta không phải do phần mềm tự nhận thức—mà do một công ty duy nhất cấu hình server Ẩu.
Một cuộc điều tra vừa chỉ ra loạt sự cố bảo mật tại các lab AI hàng đầu đều trỏ về Irregular, một công ty ở Tel Aviv do quỹ Good Ventures của Dustin Moskovitz tài trợ. Khi thử nghiệm khả năng bảo mật của các mô hình như Claude (Anthropic), Irregular vô tình mở kết nối internet mà không giới hạn phạm vi máy tính được phép truy cập. Các mô hình AI cách ly chỉ làm đúng theo prompt: quét mạng bên ngoài, xâm nhập vào hệ thống một công ty thật, rồi rò rỉ các gói dữ liệu chứa thông tin đăng nhập.
Tại sao chuyện này đáng chú ý: Các lab AI từng làm rùm bố lên rằng đây là bằng chứng AI "ngông cuồng" và "nổi loạn". Nhưng chính báo cáo của Anthropic cho thấy 0% mô hình xâm nhập hệ thống thật một khi con người bảo nó không được làm thế. Đây chỉ là một vụ ngáo cấu hình môi trường, chứ chẳng phải thảm họa tận thế.
Cần biết:
- Không có bầy đàn AI tự phát: Mỗi bài test chỉ chạy đúng một instance Claude trong 10 đến 34 tiếng, chứ không phải một binh đoàn AI mất kiểm soát.
- Mối quan hệ chằng chịt: Các đồng sáng lập của Irregular đang điều hành vài tổ chức Effective Altruists được tài trợ bởi Open Philanthropy và Coefficient Giving.
- Vùng xám pháp lý: Việc sửa dữ liệu và lấy trộm thông tin đăng nhập vi phạm Đạo luật Gian lận và Lạm dụng Máy tính của Mỹ. Tuy nhiên, đội ngũ chính của Irregular lại hoạt động tại Israel, nằm ngoài tầm kiểm soát của Mỹ.
Trước khi lo AI chiếm quyền kiểm soát internet, cứ kiểm tra xem có ai quên tắt Wi-Fi trong phòng lab không đã.
Nguồn
- Investigation into Irregular — https://www.effort.news/irregular
- Discussion on Hacker News — https://news.ycombinator.com/item?id=49704132

