Chạy model AI 125 tỷ tham số ngay trên card màn hình phổ thông nhờ Strata

Chạy model AI 125 tỷ tham số ngay trên card màn hình phổ thông nhờ Strata

Giờ bạn đã có thể chạy một model AI 125 tỷ tham số trên PC chơi game bình thường với tốc độ lên tới 100 token/giây.

Lập trình viên Niko1221 vừa ra mắt Strata, một engine mã nguồn mở miễn phí dùng để chạy Qwen3.8-Flash-Next ngay trên máy cá nhân. Công cụ này chia dữ liệu model ra giữa RAM máy tính và VRAM của card màn hình, giúp các card Nvidia hoặc AMD phổ thông chỉ cần 12 GB VRAM là gánh được. Trên card 24 GB như RTX 3090, tốc độ phản hồi đạt từ 100 đến 140 token/giây.

Tại sao lại đáng chú ý: Mấy model thông minh tầm cỡ này thường đòi hỏi cả cụm server hoặc phải trả phí hàng tháng. Strata mang trọn vẹn khả năng chạy local — chỉnh sửa code, đọc ảnh, dùng tool — lên phần cứng máy tính bàn mà không gửi bất kỳ byte dữ liệu nào lên cloud.

Tóm lại là: bạn cần tối thiểu 12 GB VRAM, 32 GB RAM và khoảng 80 GB dung lượng SSD. Trên Windows, bạn chỉ cần chạy START-HERE.bat, còn Linux thì gõ ./setup.sh. Bạn cũng có thể quăng file tài liệu cài đặt cho trợ lý AI viết code để nó tự cấu hình giúp.

Card màn hình nhà bạn vừa có thêm một năng lực cực xịn đấy.

Nguồn