← Bài viết Dịch vụ AIWiki

Blog / AI / Deep Article

AI • Deep Article • Research

Anthropic tố "tẩy nguồn" mô hình: cái nhãn nghe lạ, nhưng vấn đề thì rất cũ

Cập nhật 09/2026 • Bài chuyên sâu • Dành cho người đọc quan tâm hệ thống AI triển khai thực tế
Tóm tắt cho người bận

Anthropic tố "tẩy nguồn" mô hình: cái nhãn nghe lạ, nhưng vấn đề thì rất cũ

VnExpress đưa tin ngày 12/9/2026 rằng Anthropic tố chiến thuật "tẩy nguồn" của loạt công ty AI Trung Quốc (https://vnexpress.net/anthropic-to-chien-thuat-tay-nguon-cua-loat-cong-ty-ai-trung-quoc-5119484.html). Chỉ một dòng, nhưng nếu đọc kỹ thì đây không phải tin về một vụ cãi nhau giữa các phòng lab. Đây là tin về việc toàn bộ mô hình kinh doanh của ngành AI đang bị đặt lên bàn mổ.

Từ "tẩy nguồn" nghe như thuật ngữ rửa tiền được đem đi trồng cấy. Thực tế là vậy. Diễn giải của tôi — không phải phát ngôn của Anthropic — là nó mô tả một quy trình: lấy đầu ra của một mô hình mạnh do người khác huấn luyện, dùng nó làm dữ liệu để dạy mô hình của mình, rồi xóa dấu vết để sản phẩm cuối trông như được nuôi từ đầu. Trong tài liệu học máy, phần "lấy đầu ra để dạy" có tên hợp pháp là distillation. Phần "xóa dấu vết" mới là phần bị gọi là tẩy nguồn (https://vnexpress.net/anthropic-to-chien-thuat-tay-nguon-cua-loat-cong-ty-ai-trung-quoc-5119484.html).

Câu hỏi thật sự không phải "distillation có xấu không". Distillation là kỹ thuật hợp lệ, được dạy trong giáo trình. Câu hỏi là distillation có được phép theo điều khoản sử dụng của bên bán API hay không. Và nếu không được phép, ai có nghĩa vụ phát hiện?

Tại sao Anthropic lại là bên lên tiếng

Nhìn vào cấu trúc chi phí là hiểu động cơ. OpenAI, Google, Meta, Anthropic đều đốt tiền vào compute và dữ liệu để nuôi các mô hình nền tảng. Nếu một đối thủ chỉ cần gọi API vài triệu lần, thu về một mớ output chất lượng cao, rồi huấn luyện lại trên đó, thì toàn bộ khoản đầu tư ban đầu bị san phẳng về gần bằng chi phí gọi API.

Đó là lý do Anthropic — chứ không phải một cơ quan quản lý nào — đứng ra tố (https://vnexpress.net/anthropic-to-chien-thuat-tay-nguon-cua-loat-cong-ty-ai-trung-quoc-5119484.html). Khi không có luật, bên bị thiệt tự viết cáo trạng. Giới quan sát ở Mỹ vẫn thường nhắc tới các tên Trung Quốc trong những cuộc tranh luận kiểu này, nhưng điểm đáng lưu ý là cáo buộc lần này nhắm vào "loạt công ty", không phải một cái tên đơn lẻ. Đánh vào một công ty là chuyện PR. Đánh vào cả một tập thể là chuyện chuẩn mực.

Vấn đề là chuẩn mực ấy do ai đặt. Nếu Anthropic tự định nghĩa thế nào là tẩy nguồn, thì mọi API provider khác — kể cả Microsoft với Azure OpenAI — cũng có quyền định nghĩa theo cách có lợi cho mình. Ai kiểm tra chéo?

Bằng chứng: phần khó nhất của mọi cáo buộc

Đây là chỗ tôi thấy tin này chưa đủ dữ kiện. Đầu ra của một mô hình ngôn ngữ là phân phối xác suất trên chuỗi token, không phải file nhạc có watermark. Muốn chứng minh "mô hình B được nuôi từ output của mô hình A", người ta phải dựa vào các dấu hiệu thống kê gián tiếp: phân bố từ vựng bất thường, các lỗi đặc trưng lặp lại, hành vi giống nhau ở những câu hỏi hiếm gặp. Tất cả đều là suy luận, không phải bằng chứng pháp lý cứng.

Nói cách khác, ngay cả khi cáo buộc đúng, việc chứng minh nó trước tòa hoặc trước cơ quan quản lý vẫn là bài toán mở. Với lập trình viên Việt Nam đang cân nhắc dùng API nào để xây sản phẩm, điều này quan trọng hơn cái tiêu đề: nếu các ông lớn siết điều khoản, chi phí tuân thủ sẽ chảy xuống người dùng cuối, không chảy lên đỉnh.

Người Việt đang ở đâu trong câu chuyện này

Phần lớn doanh nghiệp Việt không huấn luyện mô hình nền tảng. Họ tinh chỉnh trên mô hình mở, hoặc gọi API. FPT, VNG và hàng loạt startup AI trong nước đều đứng ở tầng ứng dụng. Nghĩa là họ vừa là nạn nhân tiềm năng, vừa là nghi phạm tiềm năng — tùy vào điều khoản của bên cấp model họ đang dùng.

Hãy hình dung một startup Việt tinh chỉnh một mô hình mở trên 200.000 mẫu hội thoại tiếng Việt do chính khách hàng tạo ra, trong đó có lẫn output sinh bởi một mô hình thương mại. Không ai cố ý tẩy nguồn cả. Nhưng nếu bên cấp model gốc quyết định rằng "mọi output sinh ra từ API của chúng tôi đều không được dùng để huấn luyện mô hình cạnh tranh", thì cái startup kia đã vi phạm mà không biết. Rủi ro nằm ở sự mù mờ của dữ liệu, không nằm ở ý đồ.

Câu hỏi đặt ra cho các nhà quản lý Việt Nam: khi AI trở thành hạ tầng, chúng ta có cần một bộ quy tắc minh bạch về nguồn gốc dữ liệu huấn luyện — kiểu như truy xuất nguồn gốc thực phẩm — hay cứ để thị trường tự xử?

Điều thực sự đang bị đem ra mặc cả

Anthropic tố chiến thuật tẩy nguồn (https://vnexpress.net/anthropic-to-chien-thuat-tay-nguon-cua-loat-cong-ty-ai-trung-quoc-5119484.html) trong lúc cuộc đua model giữa Mỹ và Trung Quốc không còn là câu chuyện kỹ thuật thuần túy. Nó là câu chuyện về việc lợi thế cạnh tranh được bảo vệ bằng điều khoản dịch vụ thay vì bằng năng lực.

Tôi không cho rằng Anthropic sai. Nếu ai đó tiêu hàng tỷ đô để nuôi một mô hình nền tảng rồi thấy nó bị chưng cất thành sản phẩm khác, họ có quyền bực. Nhưng biến "tẩy nguồn" thành một tội danh mơ hồ, dựa trên suy luận thống kê, lại là con dao hai lưỡi. Hôm nay nó chĩa về phía các phòng lab Trung Quốc. Ngày mai, nó có thể chĩa về phía bất kỳ ai tinh chỉnh mô hình mà không có đội pháp chế đủ mạnh — bao gồm các công ty Việt Nam.

Vậy câu hỏi thật sự là: nếu distillation là con đường học tập tự nhiên của mọi mô hình, thì làm sao phân biệt "học hỏi" với "ăn cắp" bằng một tiêu chuẩn ai cũng chấp nhận — chứ không phải bằng điều khoản do bên mạnh nhất viết ra?