Kev mang các model ra quyết định nhỏ, chạy local lên Qwen 3.5

Bạn không cần một LLM đám mây khổng lồ chỉ để phân loại ticket hỗ trợ hay chấm điểm phản hồi của người dùng.
Lập trình viên Jared Palmer vừa ra mắt Kev, một họ model ra quyết định nhỏ nguồn mở được xây dựng trên Qwen3.5. Với các kích thước 0.8B, 4B và 9B, Kev xử lý câu hỏi đúng/sai, trắc nghiệm và đánh giá xếp hạng chỉ trong một request. Thay vì trả về text thô, nó cho bạn tỷ lệ xác suất chi tiết cho từng lựa chọn.
Vì sao lại quan trọng: Các LLM lớn thường đòi hỏi prompt engineering phức tạp mới cho ra dữ liệu có cấu trúc chuẩn xác. Kev chạy local trên CUDA, ROCm hoặc Apple Silicon—bản 4B và 9B nằm gọn trên một chiếc Mac 32GB—và tách biệt từng câu hỏi để câu trả lời trước không làm lệch câu sau.
Bạn có thể thử ngay model 0.8B và 4B trên Hugging Face Spaces mà không cần cài đặt gì. Nếu muốn chạy local, server đi kèm kết nối trực tiếp với Python SDK của TypeSafe bằng các lệnh uv tiêu chuẩn.
Ra quyết định có cấu trúc ngay trên phần cứng của bạn, khỏi lo hóa đơn cloud.
Nguồn
- Kev GitHub Repository — https://github.com/jaredpalmer/kev/tree/main
- Kev on Hacker News — https://news.ycombinator.com/item?id=49783999

