Model 2,78 nghìn tỷ tham số vừa chạy được trên RAM 8 GB

Giờ bạn đã có thể chạy một model AI 2,78 nghìn tỷ tham số trên máy Linux chỉ với 8 GB RAM và không cần đến GPU.
Lập trình viên Fareed Khan vừa phát hành kimi-k3-in-c, một engine vỏn vẹn 176 KB viết bằng C99 thuần để chạy model Kimi K3 của Moonshot. Nó stream trực tiếp checkpoint 1,56 TB của model từ ổ cứng, chạy trên một CPU duy nhất mà không cần các framework bên ngoài hay thư viện BLAS.
Vì sao quan trọng: Nó biến yêu cầu phần cứng từ một bức tường rào chắn thành một nút vặn tùy chỉnh. Nhờ giữ một lõi nhỏ trong bộ nhớ và stream 1,45 TB trọng số chuyên gia (expert weights) từ ổ lưu trữ, công cụ này cho đầu ra giống hệt nhau tới từng byte, dù bạn cấp cho nó 8 GB hay 224 GB RAM.
Tốc độ sinh token mất khoảng 32 giây ở mức 8,24 GB RAM, và giảm xuống còn 10 giây ở mức 128 GB. Vì công cụ này dùng model nền (base model) nguyên bản của Kimi K3, các prompt sẽ tạo ra đoạn văn viết tiếp thay vì dạng phản hồi đoạn chat.
Nó sẽ không thể thay thế một cụm server về mặt tốc độ, nhưng nó chứng minh rằng các model cỡ trung tâm dữ liệu không nhất thiết phải phụ thuộc vào phần cứng cấp trung tâm dữ liệu.
Nguồn
- kimi-k3-in-c on GitHub — https://github.com/FareedKhan-dev/kimi-k3-in-c

