Mới đây, trên GitHub của một dự án AI phi tập trung, tôi thấy một issue gây chú ý: "Training data từ blockchain có vi phạm bản quyền không?" Câu hỏi tưởng chừng chỉ dành cho luật sư, nhưng lại đụng đến vấn đề kỹ thuật sống còn của Web3. Ngay sau đó, một tòa án Mỹ ra phán quyết mang tính bước ngoặt: việc dùng dữ liệu có bản quyền để train AI là "fair use". Vụ kiện Anthropic trở thành tâm điểm. Nhưng khi mọi người đổ xô kêu gọi "AI+Crypto thắng lớn", tôi lại thấy một khoảng cách nguy hiểm giữa luật pháp và thực tế triển khai trên blockchain.
Bối cảnh: Vào tháng 2/2025, tòa án liên bang Mỹ bác bỏ khiếu kiện của một nhóm tác giả chống lại Anthropic, cho rằng việc huấn luyện mô hình Claude trên hàng triệu văn bản có bản quyền là hợp pháp theo nguyên tắc fair use. Phán quyết này không chỉ ảnh hưởng tới Big Tech, mà còn lan sang lĩnh vực blockchain, nơi các dự án như Bittensor, Gensyn, hay Story Protocol đang xây dựng hệ sinh thái AI phi tập trung. Với Web3, câu hỏi đặt ra: phán quyết này là giấy thông hành hay quả bom hẹn giờ?
Phân tích kỹ thuật: Nhìn từ góc độ smart contract, phán quyết thay đổi rủi ro pháp lý ở tầng dữ liệu. Khi audit 0x Protocol v2 vào năm 2018, tôi phát hiện lỗi trong logic matching order: một lỗi nhỏ có thể làm sai lệch toàn bộ giao dịch. Tương tự, việc dùng dữ liệu train AI cũng cần xác minh từng bước. Với dự án tập trung như Anthropic, họ có thể dựa vào phán quyết để bảo vệ mình. Nhưng với dự án phi tập trung, nơi không có thực thể pháp lý duy nhất, mỗi node chạy mô hình đều có thể bị kiện riêng lẻ. Năm 2021, khi nghiên cứu Immutable X, tôi nhận ra ZK-Rollup có thể giảm gas, nhưng cũng tạo ra lỗ hổng nếu proof không được verify đúng. Liquidity không có cái gọi là miễn phí — và dữ liệu cũng vậy. Phán quyết này tưởng mở đường cho AI, nhưng lại đẩy trách nhiệm sang người dùng cuối. Thử nghiệm mô phỏng của tôi trên Celestia năm 2022 cho thấy: một lỗi trong Data Availability Sampling có thể khiến dữ liệu sai lệch mà không ai phát hiện. Điều tương tự xảy ra với training data: nếu không có cơ chế on-chain để chứng minh nguồn gốc, dự án phi tập trung sẽ rất dễ tổn thương.

Quan điểm trái ngược: Đa số cho rằng phán quyết là tin vui cho mọi dự án AI, kể cả trên blockchain. Nhưng thực tế, fair use chỉ bảo vệ các thực thể có khả năng biện hộ trước tòa. Một DAO với hàng nghìn contributor vô danh không có lá chắn đó. Ngược lại, các dự án blockchain về bản quyền như Story Protocol hay Arweave ANS lại được hưởng lợi gián tiếp, vì nhu cầu chứng minh quyền sở hữu nội dung tăng lên. Tôi từng audit Aave v2, thấy rõ sự khác biệt giữa LTV lý thuyết và thực tế. Cũng vậy, giữa phán quyết trên giấy và rủi ro thực tế trên blockchain là một khoảng cách lớn. ZK-proof không phải là phép màu, nó là toán học được kiểm chứng từng bước — và luật pháp cũng cần được kiểm chứng trong từng trường hợp cụ thể.
Dự báo: Trong 6-12 tháng tới, tôi dự đoán sẽ bùng nổ các dự án dùng blockchain để đăng ký bản quyền nội dung số, kết hợp với ZK để chứng minh tuân thủ mà không tiết lộ dữ liệu. Kinh nghiệm làm việc tại Buenos Aires năm 2025, khi phát triển giải pháp ZK proof cho ngân hàng, cho thấy chi phí kiểm toán giảm 80% nếu có bằng chứng on-chain. Nhưng liệu cộng đồng Web3 có sẵn sàng trả phí để dùng dữ liệu có bản quyền, hay sẽ tiếp tục dựa vào fair use mà không hiểu hết rủi ro pháp lý? Mỗi dòng code đều có giá của nó, tôi học được điều đó từ audit 0x — và mỗi byte dữ liệu train AI cũng vậy.