Cắm iPhone vào Mac để phụ chạy mô hình 27B

Chiếc iPhone cắm cáp của bạn giờ có thể đóng vai trò đồng xử lý để tăng tốc các mô hình AI chạy local trên Mac.
Dự án mã nguồn mở Backburner giúp chuyển bớt phần đọc prompt và bộ nhớ context sang iPhone qua cáp USB-C 10 Gb/s. Thử nghiệm chạy Qwen3.8-27B trên MacBook M4 Pro 24 GB cho thấy: kết nối thêm iPhone giúp giảm tới 31% thời gian chờ đọc prompt và tăng tốc độ prefill từ 29% đến 44% ở độ sâu context 16k–48k.
Vì sao lại quan trọng: Chạy một mô hình 27 tỷ tham số trên Mac 24 GB thường buộc bạn phải chọn: hoặc chấp nhận đọc prompt chậm, hoặc phải thu nhỏ context window. Nhờ đẩy các layer trên cùng và các attention key cũ sang GPU của điện thoại, bạn có độ chính xác cao hơn cùng context rộng hơn mà không cần tốn tiền nâng cấp phần cứng Mac.
Tóm gọn lại: Mac đảm nhận từ layer 1 đến 40, truyền dữ liệu qua USB-C, còn iPhone dùng GPU xử lý nốt các layer từ 41 đến 64. Câu trả lời đầu ra giống hệt từng token so với khi chạy một mình trên Mac. Ứng dụng này dựa trên một bản fork mã nguồn mở của llama.cpp và chạy được cả trên iPad chip M.
Hóa ra chiếc điện thoại nằm yên trên bàn làm việc lại là một chiếc card tăng tốc khá ổn đấy chứ.
Nguồn
- Backburner — https://github.com/StayLameBro/backburner

