OpenAI tạm dừng phát triển mô hình Astra vì lo ngại nguy cơ tấn công mạng tự động

OpenAI vừa bấm nút dừng phát triển mô hình Astra sau khi các đợt kiểm thử cho thấy nó có khả năng tự thực hiện các vụ tấn công mạng.
Trong cập nhật mới nhất, OpenAI tiết lộ rằng các đợt đánh giá nội bộ với Astra cho thấy khả năng tự lập trình (agentic coding) và an ninh mạng của mô hình này đã tăng vọt. Theo Khung chuẩn bị (Preparedness Framework) của hãng, một mô hình sẽ chạm ngưỡng rủi ro "Nghiêm trọng" (Critical) nếu nó có thể tự tìm lỗ hổng zero-day hoặc tự thực hiện các cuộc tấn công hoàn chỉnh vào hệ thống bảo mật cao mà không cần con người can thiệp. Vì chưa thể loại trừ khả năng Astra đã đạt tới ngưỡng này, OpenAI đã tạm dừng các hoạt động thử nghiệm nội bộ chưa có biện pháp kiểm soát an toàn nâng cấp.
Vì sao chuyện này đáng chú ý: Đây là mức cảnh báo rủi ro an ninh mạng cao nhất mà OpenAI từng gắn cho một mô hình—những bản như GPT-5.6-Sol trước đây mới chỉ dừng ở mức "Cao" (High). OpenAI hiện đang cách ly môi trường thử nghiệm của Astra, theo dõi sát chuỗi suy luận (Chain of Thought) của nó để phát hiện các hành vi rủi ro, đồng thời bắt tay với các cơ quan chính phủ và viện an toàn để kiểm thử độc lập.
Cần biết thêm: OpenAI khẳng định Astra không liên quan đến vụ khai thác lỗ hổng gần đây tại Hugging Face.
Khi AI bắt đầu tự tìm được lỗi zero-day, dừng lại là nước đi hợp lý duy nhất.
Nguồn
- Responding to the next frontier of critical cyber capabilities — https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/
- Hacker News Discussion — https://news.ycombinator.com/item?id=49213029

