Giới nghiên cứu dễ dàng qua mặt rào chắn vũ khí sinh học của Claude

Hàng rào an toàn sinh ra là để khóa chặt các quy trình nguy hiểm, nhưng giới nghiên cứu vừa bước qua gọn hơ hệ thống phòng thủ của Claude.
Theo Ars Technica, các nghiên cứu viên an toàn mạng đã dễ dàng qua mặt hàng rào của Anthropic để lấy ra các quy trình nghiên cứu vũ khí sinh học thuộc danh mục cấm. Anthropic gần đây thừa nhận người dùng đang dùng "nhiều phương pháp ngày càng tinh vi để lách qua hệ thống phòng thủ." Trong một báo cáo về việc lạm dụng mô hình, phòng lab này liệt kê đủ mối đe dọa, từ lừa đảo ứng dụng hẹn hò ảo đến các hệ thống theo dõi người bất đồng chính kiến. Anthropic cũng cho biết 7 phòng lab tại Trung Quốc đã tìm cách nhái công nghệ hàng đầu của họ thông qua chắt lọc (distillation).
Vì sao cần bận tâm: Các chuyên gia an ninh sinh học lo AI nâng cao có thể tiếp tay cho kẻ xấu thiết kế virus hoặc phát tán mầm bệnh. Dù việc chế tạo vũ khí sinh học thực tế vẫn cần phòng lab thật và quy trình ngoài đời thực, việc đập tan hàng rào phần mềm lại ngày càng dễ.
Cần biết: Mức độ báo động nội bộ về an toàn AI đang tăng vọt. Jacob Coxon, một nhân viên Anthropic, vừa nghỉ việc và chia sẻ rằng nhiều người ở đây "thực sự tin rằng AI có thể tiêu diệt tất cả chúng ta trước khi thập kỷ này kết thúc."
Hàng rào số để giữ tri thức nguy hiểm bên trong các mô hình AI xem ra đang mỏng dính.

