Unsloth tung Dynamic 3.0 GGUF giúp nén LLM chạy local thông minh hơn

Unsloth tung Dynamic 3.0 GGUF giúp nén LLM chạy local thông minh hơn

Mấy model AI chạy local vừa được nâng cấp độ chính xác miễn phí mà không tốn thêm tí dung lượng ổ cứng nào.

Unsloth vừa ra mắt Dynamic v3.0 GGUF, nổi bật nhất là bản nén mới của Qwen3.8-27B. Quantization (nén model) là cách giảm độ chính xác của các con số để model gọn hơn, chạy được trên máy tính thường. Unsloth cho biết phương pháp post-training của họ giúp tăng hơn 10% độ chính xác top-1% so với các bên khác ở cùng dung lượng file. Bạn có thể dùng ngay mấy file này trên các engine local quen thuộc như llama.cpp hay Unsloth Desktop.

Vì sao nên quan tâm: Ép một model bự vào file nhỏ thường làm nó ngáo đi hẳn — khó viết code chuẩn hoặc quên mất ngữ cảnh khi suy luận nhiều bước. Unsloth đã làm lại phần chọn layer và tập dữ liệu hiệu chỉnh (calibration) để giữ phong độ cho AI cả khi code, chat lẫn suy luận. Kết quả: trợ lý AI chạy local trên máy cá nhân của bạn sẽ khôn hơn rõ rệt.

Nếu cần tiết kiệm bộ nhớ tối đa, Unsloth còn lọc bớt các module thừa ở các bản file nhỏ để giảm thêm 500MB. Bản nén 1-bit nhỏ nhất của họ giảm tới 89% kích thước model nhưng vẫn giữ được khoảng 72% độ chính xác top-1%.

Tin quá vui cho ai thích tự chạy LLM trên laptop thay vì tốn tiền thuê server đám mây.

Nguồn