AI tự benchmark để ép tốc độ nanoGPT lên tối đa

AI agent giờ đã có thể tự tối ưu code huấn luyện mạng thần kinh từ A đến Z.
Các nhà nghiên cứu vừa thử nghiệm 18 mô hình hàng đầu qua 153 lượt chạy tự động trên benchmark nanoGPT speedrun. Được trang bị các công cụ hỗ trợ viết code như claude-code và codex, các mô hình tự chỉnh sửa code huấn luyện để đạt hiệu năng cao nhất. Fable 5 đạt kết quả nhanh nhất (đã xác thực) với điểm số 2.726, theo sát là Opus 5 và Kimi K3.
Vì sao lại quan trọng: Muốn vắt kiệt hiệu năng của code, kỹ sư thường phải tự tay dò tìm từng điểm nghẽn. Tự động hóa được vòng lặp này đồng nghĩa với việc các mô hình có thể tự tinh chỉnh script huấn luyện trên dàn máy chi phí thấp trước khi đem đi scale lớn.
Điểm đáng chú ý: Bộ dữ liệu benchmark gồm 41 trace công khai ghi lại chi tiết từng lời gọi công cụ, hành động của subagent và ghi chú nháp. Những lượt chạy "máu chiến" nhất đã ngốn tới 4,6 triệu token chỉ để thử nghiệm các biến thể code.
Nếu AI tiếp tục tự tìm ra cách rút gọn code huấn luyện của chính mình, các phần cứng phổ thông sẽ còn làm được nhiều việc hơn nữa.
Nguồn
- NanoGPT Speedrun Benchmark — https://www.primeintellect.ai/research/nanogpt-speedrun
- Discussion on Hacker News — https://news.ycombinator.com/item?id=49404380

