Có thể trích xuất chuỗi suy luận ẩn từ API của các AI lớn bằng mô hình yếu hơn

Các nhà nghiên cứu vừa tìm ra cách trích xuất chuỗi suy luận ẩn từ các API AI lớn bằng cách gửi lại các khối dữ liệu mã hóa vào những mô hình yếu hơn.

Các bên cung cấp AI như Anthropic, OpenAI hay Google thường trả về các khối suy luận đã mã hóa cho ứng dụng người dùng. Mục đích là để giữ ngữ cảnh hội thoại mà không làm lộ cách mô hình "suy nghĩ" bên trong. Nhưng nghiên cứu từ MATS Research, Viện ELLIS Tübingen và các đối tác cho thấy các khối dữ liệu này có thể dùng chéo giữa các mô hình. Bằng cách lấy chuỗi mã hóa từ một mô hình cao cấp rồi đưa vào một mô hình giá rẻ (đã jailbreak) của cùng nhà cung cấp, họ buộc mô hình yếu hơn phải đọc ra toàn bộ suy luận thô của mô hình mạnh dưới dạng văn bản thường.

Vì sao việc này quan trọng: Kỹ thuật này vượt qua các lớp bảo vệ chống distillation (học lỏm mô hình) mà không cần tấn công trực tiếp vào mô hình chính. Ngoài nguy cơ rò rỉ trí tuệ nhân tạo, phân tích 6.708 luồng chạy công khai của các AI agent còn phát hiện 704 dữ liệu nhạy cảm—bao gồm API key, mật khẩu và email cá nhân—đang nằm ẩn bên trong các chuỗi suy luận.

Tóm lại thế này: nếu API trả về các token suy luận mã hóa về trình duyệt hay ứng dụng của bạn, gói dữ liệu đó có thể bị đem đi "phát lại" để mở khóa toàn bộ chuỗi tư duy bên trong.

Dự kiến các nhà cung cấp AI sẽ sớm cập nhật chữ ký mã hóa để gắn chặt gói suy luận với đúng ID mô hình và phiên làm việc của người dùng.

Nguồn