Chạy mô hình AI 2,78 nghìn tỷ tham số trực tiếp từ ổ SSD

Bạn hiện đã có thể chạy một mô hình AI 2,78 nghìn tỷ tham số ngay trên laptop có ổ SSD tốc độ cao.
WASTE, một engine C mã nguồn mở, vừa giúp phần cứng phổ thông chạy được Kimi K3 — mô hình khổng lồ 2,78 nghìn tỷ tham số vốn thường đòi hỏi bộ nhớ chuẩn máy chủ. Công cụ này do sqliteai phát triển, không phụ thuộc thư viện ngoài, hoạt động bằng cách đọc trực tiếp trọng số mô hình từ ổ NVMe nội bộ theo thời gian thực. Trên một chiếc MacBook Pro 64 GB RAM, nó cho ra kết quả chính xác tuyệt đối (chưa qua cắt giảm) với tốc độ khoảng 0,5 token mỗi giây.
Vì sao lại quan trọng: Các mô hình dạng Mixture-of-experts chỉ kích hoạt khoảng 4% tham số cho mỗi token, phần còn lại nằm chờ. WASTE giữ phần thân chính của mô hình cố định trong RAM và chỉ nạp đúng các chuyên gia cần thiết từ SSD khi xử lý. Cách này chấp nhận đánh đổi tốc độ để chạy được trên phần cứng sẵn có, chứng minh các mô hình hàng đầu vẫn có thể chạy local: không tốn một xu tiền cloud và bảo mật dữ liệu tuyệt đối.
Cần lưu ý: Bạn cần khoảng 1 TB dung lượng ổ NVMe nội bộ tốc độ cao cho file mô hình 982 GiB, cộng với tối thiểu 29 GB RAM trống để khởi chạy. Nếu tốc độ 0,5 token mỗi giây là quá chậm, chính engine này có thể chạy mô hình Kimi-Linear 48B nhỏ hơn với tốc độ 10,7 token mỗi giây từ một bộ chứa 19 GB.
Hóa ra bạn chẳng cần cụm máy chủ triệu đô — chỉ cần một ổ cứng laptop tốc độ cao và vài dòng code C thông minh.
Nguồn
- sqliteai/waste — https://github.com/sqliteai/waste

