Fireworks AI trình làng Ember-1, mô hình suy luận giúp giảm một nửa lượng token

Fireworks AI trình làng Ember-1, mô hình suy luận giúp giảm một nửa lượng token

Các mô hình AI suy luận tốn tới 90% token đầu ra chỉ để "tự nói chuyện" với chính mình, và phần lớn đống suy nghĩ đó hoàn toàn thừa thãi.

Fireworks Research vừa ra mắt Ember-1, một mô hình chuyên biệt dựa trên Kimi K3 giúp cắt giảm 35–50% token suy luận mà không làm giảm độ chính xác. Đội ngũ phát triển đã chạy hơn 50 thử nghiệm trên Fireworks Serverless Training để dạy mô hình loại bỏ những màn "độc thoại nội tâm" rườm rà, trong khi vẫn giữ lại các bước tự kiểm tra giúp tránh lỗi.

Vì sao điều này quan trọng: Với các agent lập trình chạy nhiều lượt (multi-turn), các bước suy luận cũ bị đọc lại và tính tiền ở từng lần gọi API, khiến việc tự động hóa ở quy mô lớn trở nên đắt đỏ. Ember-1 xử lý dứt điểm tình trạng phình ngữ cảnh này mà vẫn đạt chất lượng tương đương hoặc nhỉnh hơn K3 gốc — đạt 82,0% trên Terminal Bench 2.1 so với 80,9% của K3.

Tóm gọn lại: nếu chỉ đơn thuần giảm mức độ suy luận (reasoning effort) trên bản K3 mặc định, độ chính xác sẽ sụt giảm ngay. Thay vào đó, Fireworks đã huấn luyện lại Ember-1 qua các bài toán toán học, kỹ thuật phần mềm và sử dụng công cụ, dạy mô hình cách tư duy gọn gàng ngay từ gốc.

Hóa ra mô hình AI, cũng giống như kỹ sư phần mềm, làm việc tốt hơn hẳn khi bớt "nghĩ nhiều".