Alibaba ra mắt voice runtime thời gian thực giúp AI agent vừa làm việc vừa nói chuyện

Alibaba ra mắt voice runtime thời gian thực giúp AI agent vừa làm việc vừa nói chuyện

Trợ lý giọng nói thường im bặt và "đứng hình" khi chạy tác vụ phức tạp—runtime mới của Alibaba xử lý gọn vấn đề này.

Team Qwen của Alibaba vừa open-source qwen-audio-agent, một voice runtime thời gian thực cho AI agent. Được xây dựng trên Node.js, công cụ này xử lý luồng âm thanh liên tục dạng full-duplex (truyền nhận hai chiều cùng lúc), giúp bạn nói chuyện với trợ lý tự nhiên như người thật. Trong khi cuộc trò chuyện vẫn tiếp diễn, framework sẽ giao mấy việc nặng—như chạy code hay gọi tool—cho các agent chạy ngầm thông qua Agent Communication Protocol (ACP).

Vì sao nên quan tâm: Hầu hết giao diện giọng nói hiện nay sẽ "ngắt nhịp" cuộc trò chuyện ngay khi AI kích hoạt một tool ở backend. Runtime này giữ đường truyền âm thanh luôn mở trong lúc tác vụ đang chạy bên dưới. Bạn có thể hỏi tiến độ, ngắt lời agent, hoặc đổi yêu cầu giữa chừng mà không cần làm lại từ đầu.

Thử ngay: Cài đặt toàn cục bằng lệnh npm install -g qwen-audio-agent (yêu cầu Node.js 22.22.2+). Nó hỗ trợ giao diện terminal TUI, giao diện web và ứng dụng macOS với quả cầu hiển thị dạng floating. Bạn có thể kết nối với DashScope API của Alibaba hoặc chạy hoàn toàn local qua speech-to-speech của Hugging Face.

Cuối cùng cũng có một AI trợ lý giọng nói không bắt bạn ngồi chờ "giữ máy" trong lúc nó làm việc.

Nguồn