Hook: 1.5 tỷ USD cho một lời thừa nhận thất bại
15 tỷ USD. Con số vừa được công bố trong thỏa thuận dàn xếp giữa Anthropic – công ty AI đình đám với mô hình Claude – và một nhóm tác giả sách. Họ cáo buộc rằng Anthropic đã sử dụng hàng triệu cuốn sách vi phạm bản quyền (bao gồm cả sách điện tử lậu) để huấn luyện các mô hình ngôn ngữ lớn của mình. Đây là một trong những khoản dàn xếp lớn nhất trong lịch sử ngành AI, vượt xa mọi dự đoán trước đó. Nhưng đối với tôi, người đã chứng kiến những vụ ICO scam từ năm 2017 và audit smart contract cho DeFi Summer, con số này không chỉ nói về luật pháp. Nó nói về một sự thật trần trụi: dữ liệu – thứ mà các công ty AI khai thác miễn phí trong nhiều năm – giờ đây có giá đắt đến mức nào. Và đó chính là lúc blockchain bước vào cuộc chơi.
Context: Tại sao một vụ kiện AI lại là câu chuyện của Blockchain?
Bạn có thể tự hỏi: "Chuyện bản quyền sách với AI liên quan gì đến blockchain mà tôi đang đọc trên một trang tin về tiền mã hóa?" Câu trả lời nằm ở bản chất của vấn đề: tính minh bạch và khả năng truy xuất nguồn gốc dữ liệu. Anthropic không thể chứng minh được rằng bộ dữ liệu huấn luyện của họ hoàn toàn hợp pháp. Họ đã phải trả giá bằng 1.5 tỷ USD. Trong thế giới tài chính phi tập trung (DeFi), điều này giống như một giao thức mất thanh khoản vì không có bằng chứng về tài sản thế chấp – bạn bị phạt nặng.
Khi tôi còn là sinh viên An ninh mạng ở Nha Trang năm 2017, tôi đã viết bài cảnh báo về Confido – một ICO scam dựa trên lỗ hổng smart contract. Bài học khi đó: mã nguồn có thể kiểm tra được, nhưng dữ liệu đầu vào thì không. Giờ đây, với AI, vấn đề còn nghiêm trọng hơn. Một mô hình ngôn ngữ lớn được huấn luyện trên dữ liệu vi phạm bản quyền giống như một sàn giao dịch chấp nhận tiền bẩn – bạn không thể biết cho đến khi cơ quan chức năng gõ cửa. Và khi họ gõ cửa, hóa đơn là 1.5 tỷ USD.
Core: Phân tích vụ việc – Những con số và sự thật kỹ thuật
Theo các báo cáo pháp lý, vụ kiện bắt nguồn từ một nhóm tác giả sách (bao gồm các tác giả bán chạy nhất) đã phát hiện ra rằng các mô hình Claude của Anthropic có thể tái tạo các đoạn văn bản dài từ sách của họ một cách chính xác. Điều này cho thấy các cuốn sách đó đã nằm trong tập dữ liệu huấn luyện. Anthropic không phủ nhận việc sử dụng tập dữ liệu "books3" – một kho dữ liệu khổng lồ chứa hàng trăm nghìn cuốn sách được thu thập từ các trang web vi phạm bản quyền.
Các chi tiết kỹ thuật đáng chú ý: - Tập dữ liệu books3 được xây dựng từ năm 2020 bởi Shawn Presser, chứa khoảng 196,000 cuốn sách (khoảng 37 GB văn bản). Nó đã trở thành một "tiêu chuẩn ngầm" trong giới nghiên cứu AI, được các công ty như Meta, Google và OpenAI sử dụng dưới nhiều hình thức. - Anthropic đã cố gắng loại bỏ các tác phẩm có bản quyền khỏi dữ liệu huấn luyện sau khi vụ kiện nổ ra, nhưng không thể chứng minh việc loại bỏ hoàn toàn. - Số tiền 1.5 tỷ USD được tính dựa trên giả định: mỗi cuốn sách bị sử dụng trái phép có giá trị ước tính khoảng 7.500 USD (mức phạt theo luật bản quyền Mỹ lên tới 150.000 USD mỗi tác phẩm, nhưng dàn xếp thường thấp hơn). Với 196.000 cuốn, con số có thể lên tới hàng chục tỷ, nên 1.5 tỷ USD được xem là một thỏa hiệp.

Từ góc nhìn của một người làm phân tích bảo mật, tôi thấy điểm tương đồng với các lỗ hổng trong smart contract: một khi dữ liệu đã được "ghi" vào mô hình, việc xóa bỏ gần như là bất khả thi. Giống như một giao dịch đã được xác nhận trên blockchain, không thể hoàn tác. Anthropic buộc phải "fork" mô hình của họ, nhưng chi phí fork ở đây không phải là gas fee mà là 1.5 tỷ USD.
Tác động tức thời đến thị trường crypto? Ngay sau khi tin tức về vụ dàn xếp lan ra, các token liên quan đến AI (như FET, AGIX, OCEAN) đã giảm nhẹ 2-5%. Lý do: nỗi lo về chi phí vận hành của các dự án AI phi tập trung cũng có thể tăng lên nếu họ phải tuân thủ các tiêu chuẩn bản quyền tương tự. Nhưng tôi cho rằng đây là phản ứng thái quá. Thị trường chưa hiểu rằng chính blockchain mới là giải pháp chứ không phải vấn đề.
Contrarian: Góc nhìn ngược – Không phải AI đe dọa blockchain, mà blockchain mới là cứu cánh cho AI
Đa số các bài viết hiện nay đều cho rằng AI và blockchain đang cạnh tranh nguồn lực, rằng các quỹ đầu tư đang chuyển từ crypto sang AI. Vụ kiện này cho thấy một góc nhìn hoàn toàn ngược lại: các công ty AI đang rất cần blockchain. Họ cần một hệ thống quản lý dữ liệu minh bạch, có thể kiểm toán và không thể bị thay đổi. Đó chính là sổ cái phân tán.
Hãy tưởng tượng một thế giới nơi mỗi tác phẩm văn học được đăng ký dưới dạng NFT trên một blockchain công khai. Khi một công ty AI muốn sử dụng dữ liệu đó để huấn luyện, họ phải ký một hợp đồng thông minh, tự động thanh toán tiền bản quyền mỗi khi mô hình được sử dụng. Điều này loại bỏ hoàn toàn rủi ro "vô tình sử dụng dữ liệu vi phạm bản quyền". Những dự án như Story Protocol hay Mad Realities đang thử nghiệm điều này. Vụ kiện của Anthropic chính là tín hiệu xác nhận rằng hướng đi này là đúng đắn.
Một điểm mù khác: Các công ty AI truyền thống sẽ ngày càng gặp khó khăn trong việc huy động vốn nếu không có chiến lược dữ liệu rõ ràng. Các quỹ đầu tư mạo hiểm giờ đây sẽ yêu cầu "proof of clean data" trước khi rót tiền. Và blockchain là công cụ duy nhất để cung cấp bằng chứng đó. Trong khi đó, các dự án AI phi tập trung (như Bittensor, Gensyn) vốn dĩ đã xây dựng trên nguyên tắc minh bạch, họ có lợi thế cạnh tranh rõ ràng.
Nhưng cũng cần cảnh giác: Một số dự án sẽ lợi dụng sự kiện này để "câu view" bằng cách tuyên bố mình đang xây dựng "giải pháp AI phi tập trung chống lại bản quyền". Hãy nhìn vào mã nguồn, kiểm tra xem họ có thực sự triển khai cơ chế xác thực dữ liệu trên chain hay không. Giống như tôi đã từng cảnh báo về những ICO scam năm 2017, giờ đây chúng ta cũng phải cảnh giác với những "AI Layer2 scam" – các dự án chỉ đổi tên từ Ethereum sang Bitcoin để câu view.
Takeaway: Câu hỏi chiến lược cho kỷ nguyên thể chế hóa dữ liệu
Vụ kiện 1.5 tỷ USD này không chỉ là một bản án cho Anthropic. Nó là dấu chấm hết cho "kỷ nguyên khai thác dữ liệu miễn phí". Bất kỳ công ty nào – AI, blockchain hay fintech – muốn sử dụng dữ liệu có bản quyền đều phải trả phí. Câu hỏi đặt ra: Liệu chúng ta có sẵn sàng xây dựng một hạ tầng dữ liệu minh bạch trên blockchain, hay lại tiếp tục lặp lại sai lầm của các ICO scam và cố gắng "câu view" bằng những lời hứa rỗng tuếch?

Tôi đã chứng kiến mùa đông crypto 2022 – FTX sụp đổ vì thiếu minh bạch. Giờ đây, AI đang đối mặt với một mùa đông tương tự. Nhưng lần này, chúng ta có công cụ để sửa chữa: blockchain. Hãy tận dụng cơ hội này để xây dựng lại niềm tin, không chỉ cho crypto mà cho toàn bộ nền kinh tế dữ liệu. Nếu không, lịch sử sẽ lặp lại – và lần này, hóa đơn sẽ là 10 tỷ, 100 tỷ, hoặc là sự sụp đổ của cả một ngành công nghiệp.