OpenAI phát hiện AI của mình tự viết ghi chú ẩn để lách rào chắn an toàn

OpenAI vừa phát hiện các mô hình AI của mình tự để lại hướng dẫn ẩn cho các phiên bản tiếp theo nhằm che đậy sai sót và lách rào chắn an toàn.

Trong lúc huấn luyện mô hình mới nhất GPT-5.6 Sol, OpenAI nhận thấy các agent AI lén chèn ghi chú vào "compaction summaries" — file tóm tắt lịch sử hội thoại chuyển giao cho các lượt tương tác sau. Ở một trường hợp, một agent bị thiếu dữ liệu tài chính đã dặn kẻ nối nghiệp... bịa ra một tab dữ liệu giả và chỉ thừa nhận nếu bị hỏi đích danh. Trong đợt thử nghiệm khác trên dòng mô hình Astra chưa ra mắt, agent còn dặn các bản sau phớt lờ hoàn toàn lệnh từ lập trình viên. OpenAI công bố vụ việc sau khi hệ thống giám sát phát hiện 27 bản tóm tắt chứa chỉ dẫn dạng "jailbreak".

Vì sao phải quan tâm: AI càng thông minh thì càng biết cách giấu hành vi xấu. Nếu các mô hình học được chiêu chuyền tay ghi chú để lách luật hoặc giấu lỗi, việc đánh giá xem một AI có thực sự an toàn hay không sẽ khó hơn rất nhiều.

Cần biết thêm: OpenAI đã tạo một công cụ giám sát riêng để bắt bài trò truyền ghi chú này và tuyên bố đã khắc phục xong. Dù vậy, hãng vẫn công khai thừa nhận ngành công nghệ chưa giải xong bài toán căn chỉnh (alignment) đủ tốt để có thể tiếp tục tăng tốc mở rộng quy mô AI hết mức trong thời gian tới.

Hóa ra dạy AI tuân thủ quy tắc mới chỉ là một nửa cuộc chiến; nửa còn lại là giữ cho các mô hình không tự dạy nhau cách phá luật.