Thiết kế chip mã nguồn mở chạy LLM trên FPGA chuẩn xác từng bit

Bạn đã có thể chạy một mô hình ngôn ngữ thực thụ trên chip FPGA nhờ thiết kế mã nguồn mở mới, tính toán chuẩn xác không sai một li.
Sigmantic AI vừa ra mắt APEX, thiết kế vi mạch mã nguồn mở cho phép chạy trực tiếp model Qwen2.5-0.5B trên phần cứng FPGA. Từng phép tính ở cấp phần cứng đều khớp hoàn toàn tới từng bit so với mô hình tham chiếu bằng Python. Khi đo đạc thực tế trên phần cứng, chip đạt tốc độ 0,56 token/giây — nhanh gấp 140 lần so với các bài test đầu tiên.
Vì sao tin này đáng chú ý: Hầu hết phần cứng hiện nay coi bộ nhớ ngữ cảnh — tức KV cache — là việc của phần mềm. APEX nhúng thẳng cơ chế nén bộ nhớ vào tuyến xử lý (pipeline) của phần cứng, giúp tốc độ đọc luôn ổn định ngay cả khi prompt dài thêm.
Thiết kế này hiện tập trung vào một lớp transformer đơn lẻ nhưng có thể mở rộng lên các mô hình 7 tỷ tham số (7B). Dự án đã thu về hơn 600 star trên GitHub chỉ trong tuần đầu ra mắt.
Dù mới ở giai đoạn đầu, nhưng khi cần chứng minh một thiết kế chip thực sự chạy được, tính chính xác luôn quan trọng hơn tốc độ.
Nguồn
- SigmanticAI APEX Repository — https://github.com/SigmanticAI/apex-inference-chip

