AI có thể tìm quy luật trong ngôn ngữ cổ, nhưng chưa thể đọc hiểu được

AI có thể nén nhiều năm nghiên cứu ngôn ngữ cổ xuống còn vài phút, nhưng nó vẫn chưa thể cho bạn biết những từ ngữ đã mất đó thực sự có nghĩa gì.
Theo một báo cáo đăng trên Ars Technica, các nhà nghiên cứu đang dùng các mô hình machine learning để hỗ trợ giải mã những ngôn ngữ cổ chưa từng được dịch. Hệ thống học rất nhanh xem ký tự nào hay đi sau ký tự nào và từ nào hay nằm cùng nhau. Nhưng như nhà nghiên cứu Jane Adkins chỉ ra: thuộc quy luật văn bản không đồng nghĩa với việc hiểu ý nghĩa.
Vì sao chuyện này quan trọng: Xác minh bản dịch của AI với một ngôn ngữ đã biến mất là điều gần như không thể nếu thiếu người bản xứ hoặc văn bản đối chiếu song ngữ. Toàn bộ kho chữ Linear A còn sót lại chỉ khoảng 7.500 ký tự — vừa khít một màn hình. Nghĩa là với tập dữ liệu bé tẹo như vậy, gần như đoán mò kiểu gì cũng ra được vài trùng hợp thống kê ngẫu nhiên.
Cốt lõi nằm ở đây: "AI tìm ra quy luật" không đồng nghĩa với "AI tìm ra đúng nghĩa". Machine learning giúp giới nghiên cứu tăng tốc vượt trội, nhưng để giải mã thực sự thì vẫn cần một điểm tựa đối chiếu chuẩn xác cùng sự kiểm duyệt gắt gao từ các chuyên gia.
Cho đến khi tìm ra một điểm tựa thực sự cho những ngôn ngữ như Linear A hay Etruscan, AI vẫn chỉ là một trợ lý siêu nhanh cho một câu đố rất cổ của con người.

