Aaron Swartz từng đối mặt 35 năm tù vì 70GB. Meta cào 80TB làm AI thì gần như vô sự.

Hệ thống pháp lý từng đe dọa phạt Aaron Swartz 35 năm tù vì tải 70 gigabyte tài liệu khoa học, trong khi Meta kéo torrent hẳn 80 terabyte sách để huấn luyện AI mà gần như chẳng hề hấn gì.
Một bài viết đang đứng top trên Hacker News đã chỉ ra tiêu chuẩn kép rõ rệt của giới công nghệ xung quanh việc cào dữ liệu (web scraping). Aaron Swartz, đồng sáng tạo RSS, từng bị truy tố gắt gao chỉ vì tải tài liệu khoa học từ JSTOR để công khai tri thức cho cộng đồng. Các công tố viên đòi tịch thu tài sản, phạt 1 triệu USD và tống anh vào tù hàng chục năm trước khi anh tự kết liễu đời mình. Trong khi đó, Meta kéo torrent 80 terabyte sách để huấn luyện các mô hình AI độc quyền—một chiến dịch quy mô tập đoàn mà khả năng cao chỉ kết thúc bằng một khoản tiền phạt như gãi ngứa, còn các mô hình AI của họ thì tiếp tục hái ra tiền.
Vì sao lại đáng chú ý: Sự tương phản này cho thấy các luật về cào dữ liệu thực chất đang bảo vệ ai. Bạn cào dữ liệu với tư cách cá nhân để mọi người dễ tiếp cận tri thức, chính phủ đối xử với bạn như tội phạm. Nhưng nếu bạn cào dữ liệu gấp 1.000 lần số đó để làm sản phẩm thương mại độc quyền, đó chỉ là một dòng chi phí rủi ro trên bảng cân đối kế toán.
Cần biết điều này: Swartz thu thập 70 gigabyte tài liệu để lưu trữ và chia sẻ nghiên cứu. Meta thu gom 80 terabyte sách có bản quyền để huấn luyện các hệ thống đóng nhằm làm giàu cho tập đoàn.
Hóa ra rủi ro pháp lý của việc tải dữ liệu từ web phụ thuộc hoàn toàn vào việc bạn có đủ tiền để coi các vụ kiện là chi phí kinh doanh hay không.

