Blog / AI / Deep Article
Anthropic chặn hai loại tài khoản: vũ khí sinh học và hacker Nga dùng Claude
Có một nghịch lý mà bất kỳ ai làm sản phẩm AI cũng phải sống chung: mô hình càng giỏi, nó càng hữu ích cho cả người muốn xây dựng lẫn người muốn phá hoại. Anthropic vừa đưa ra hai dữ kiện cho thấy nghịch lý đó không còn là giả thuyết trên giấy.
Công ty này đã chặn nhiều tài khoản bị nghi dùng AI để phát triển vũ khí sinh học (https://vnexpress.net/anthropic-chan-nhieu-tai-khoan-nghi-dung-ai-phat-trien-vu-khi-sinh-hoc-5119170.html). Song song đó, theo SecurityWeek, Anthropic nói rằng hacker Nga đã dùng Claude để tự động hóa việc né tránh malware (https://www.securityweek.com/anthropic-says-russian-hackers-used-claude-ai-to-automate-malware-evasion/).
Hai nhóm đối tượng này chẳng liên quan gì tới nhau về động cơ. Một bên là câu chuyện sinh học, một bên là tội phạm mạng có nhà nước đứng sau. Nhưng điểm chung của họ mới là thứ đáng nói: cả hai đều tìm thấy ở một trợ lý AI thương mại thứ mà trước đây chỉ có chuyên gia mất nhiều năm mới làm được.
Thông tin đầu tiên gọn hơn nhiều so với mức độ nghiêm trọng của nó. Anthropic chặn nhiều tài khoản bị nghi dùng AI phát triển vũ khí sinh học (https://vnexpress.net/anthropic-chan-nhieu-tai-khoan-nghi-dung-ai-phat-trien-vu-khi-sinh-hoc-5119170.html). Không có chi tiết công khai về số lượng tài khoản, không có tên tổ chức, không có mô tả cụ thể về việc chúng đã đi tới đâu trong quy trình.
Thực tế là chính sự mơ hồ đó lại là phần đáng lo. Trong an ninh sinh học, cái khó chưa bao giờ nằm ở một bước duy nhất. Nó nằm ở chuỗi kiến thức rải rác — đọc tài liệu, đối chiếu quy trình, loại bỏ phương án sai, xử lý tình huống bất ngờ. Một mô hình ngôn ngữ lớn có thể không đưa ra công thức hoàn chỉnh, nhưng nó rút ngắn đáng kể thời gian thử-sai cho người không có nền tảng chuyên môn. Vấn đề là ở chỗ đó.
Anthropic không phải công ty duy nhất lo chuyện này. OpenAI, Google DeepMind đều từng công bố các chính sách hạn chế với nội dung liên quan tới tác nhân sinh học. Nhưng công bố chính sách và chặn được tài khoản thật là hai việc khác nhau. Việc Anthropic phải chặn tài khoản nghĩa là hệ thống phát hiện đã phải chạy thực tế, không chỉ nằm trong tài liệu đạo đức.
Điều đáng nói là cuộc chơi ở đây không đối xứng. Phía phòng thủ phải đúng ở mọi lượt. Phía tấn công chỉ cần một tài khoản lọt lưới trong một khoảng thời gian đủ dài. Với một mô hình được huấn luyện để trả lời mọi câu hỏi kỹ thuật, khoảng thời gian đó có thể tính bằng ngày.
Câu hỏi thật sự là: khi một mô hình có thể bị khai thác cho mục đích như vậy, ngưỡng từ chối nên đặt ở đâu — đủ chặt để chặn kẻ xấu, hay đủ rộng để không biến mọi nhà vi sinh vật học thành nghi phạm?
Sự kiện thứ hai cụ thể hơn về mặt kỹ thuật. Theo SecurityWeek, Anthropic nói rằng hacker Nga đã dùng Claude để tự động hóa việc né tránh malware (https://www.securityweek.com/anthropic-says-russian-hackers-used-claude-ai-to-automate-malware-evasion/).
Để hiểu vì sao đây là tin đáng chú ý, cần biết malware evasion là gì trong thực tế. Viết ra một đoạn mã độc thì tương đối dễ. Làm cho nó không bị antivirus phát hiện, rồi sau mỗi lần bị phát hiện lại phải viết lại — đó mới là phần tốn thời gian nhất của bất kỳ nhóm tấn công nào. Đây là công việc lặp đi lặp lại, đòi hỏi kiến thức về hành vi của từng engine phòng thủ, và cực kỳ phù hợp để giao cho một cỗ máy.
Với Claude, theo mô tả của Anthropic, nhóm hacker Nga đã đẩy được khâu đó sang trạng thái tự động. Đây không phải kịch bản "AI viết malware từ đầu". Đây là kịch bản nguy hiểm hơn về mặt vận hành: AI làm tăng tốc độ vòng lặp, biến một quy trình vốn cần vài chuyên gia thành một dây chuyền.
Microsoft và Google đều đã nói nhiều năm rằng các nhóm APT đang thử dùng LLM. Nhưng khoảng cách giữa "thử" và "đã dùng để tự động hóa" là khoảng cách giữa nghiên cứu và sản xuất. Theo những gì SecurityWeek đưa, nhóm của Nga đã ở phía thứ hai.
Vấn đề là ở chỗ này: phòng thủ malware truyền thống dựa vào việc kẻ tấn công chậm. Một mẫu mã độc mới mất vài tuần để lan rộng, đủ để các hãng bảo mật cập nhật chữ ký. Nếu vòng lặp đó rút xuống còn vài giờ, toàn bộ mô hình phòng thủ theo chữ ký trở nên lạc hậu về mặt cấu trúc, chứ không chỉ chậm.
Vậy khi kẻ tấn công có thể lặp nhanh hơn khả năng vá của phòng thủ, ai đang thực sự nắm thế chủ động?
Cách dễ nhất để đọc hai sự kiện này là coi chúng là hai vụ việc riêng lẻ: Anthropic phát hiện, Anthropic chặn, xong. Cách đọc đó sai.
Quy trình của mọi phòng lab AI lớn hiện nay đều giống nhau ở điểm cốt lõi: huấn luyện một mô hình đủ giỏi để hữu ích, rồi dùng một lớp bảo vệ để hạn chế phần nguy hiểm. Nhưng lớp bảo vệ luôn chạy sau mô hình. Nó phải đoán trước các cách khai thác, trong khi người khai thác chỉ cần tìm một cách chưa bị đoán.
Anthropic có lợi thế là một trong những công ty đặt cược lớn nhất vào an toàn AI. Họ chặn tài khoản, họ công bố, họ chấp nhận nói ra cả những ca thất bại trong phòng thủ. Nhưng chính việc họ phải công bố hai loại vi phạm hoàn toàn khác nhau — sinh học và tội phạm mạng — trong cùng một giai đoạn cho thấy bề mặt tấn công không phải một đường thẳng. Nó là một mặt phẳng.
Câu hỏi thật sự không phải "Anthropic có làm đủ không". Câu hỏi là: nếu một trong những công ty kỹ lưỡng nhất ngành vẫn phải xử lý vi phạm ở hai lĩnh vực cực đoan như vậy, thì các mô hình mở, các API giá rẻ, các bản sao chạy trên máy chủ đặt ở nơi không ai kiểm soát sẽ bị khai thác tới mức nào?
Ở Việt Nam, Claude và các mô hình tương đương không còn là công cụ của riêng vài kỹ sư ở Thung lũng Silicon. Các đội phát triển phần mềm ở Hà Nội và TP.HCM dùng chúng hằng ngày để viết test, đọc log, rà soát mã nguồn. Các công ty an ninh mạng Việt Nam — những đơn vị làm dịch vụ giám sát và ứng cứu sự cố — đang phải tính lại giả định nền tảng của mình.
Vấn đề nằm ở chỗ: nếu kẻ tấn công rút ngắn vòng lặp né tránh xuống còn vài giờ, thì một đội SOC ở Việt Nam với vài người trực ca đêm sẽ không thể theo kịp bằng quy trình thủ công. Đây không phải chuyện năng lực. Đây là chuyện số học.
Doanh nghiệp Việt cũng nằm trong nhóm bị ảnh hưởng theo cách khác. Khi các nền tảng AI siết chặt kiểm soát tài khoản, chi phí tuân thủ và xác minh sẽ tăng, và phần lớn sẽ dồn về phía người dùng doanh nghiệp. Một startup Việt muốn dùng API để xây sản phẩm có thể sẽ phải trả giá cao hơn, chờ lâu hơn, hoặc chấp nhận các điều khoản hạn chế hơn so với một công ty ở Mỹ.
Điều đáng nói là Việt Nam chưa có khung pháp lý hoàn chỉnh cho loại rủi ro này. Nghị định về quản lý hệ thống AI và các quy định về an ninh mạng hiện hành chủ yếu xử lý dữ liệu và hạ tầng, chứ chưa xử lý câu hỏi: khi một mô hình AI được dùng để tạo ra công cụ tấn công, ai chịu trách nhiệm — người dùng, nhà cung cấp mô hình, hay bên tích hợp?
Nếu một đội ở Việt Nam phát hiện tài khoản nội bộ bị dùng để sinh mã độc, họ có công cụ pháp lý nào để xử lý, hay chỉ có thể... đổi mật khẩu và viết báo cáo nội bộ?
Phần này là bối cảnh tham chiếu, không phải dữ kiện đã được xác nhận trong hai sự kiện trên. Có thông tin về việc Surfshark Systems bị hacker nhắm tới.
Tôi nêu ra ở đây vì nó cho thấy bức tranh rộng hơn: các dịch vụ hạ tầng mà người dùng Việt Nam phụ thuộc — VPN, proxy, dịch vụ lưu trữ — cũng nằm trong tầm ngắm. Một khi kẻ tấn công tự động hóa được khâu né tránh, số lượng mục tiêu họ có thể xử lý cùng lúc sẽ tăng lên, và các dịch vụ tầm trung sẽ là nơi dễ bị tổn thương nhất.
Cần nhấn mạnh: đây là bối cảnh, không phải kết luận về mối liên hệ nhân quả với hai sự kiện Anthropic.
Phản ứng hiện tại của Anthropic là chặn tài khoản. Đây là biện pháp đúng, nhưng nó là biện pháp ở tầng cuối — sau khi vi phạm đã xảy ra. Nó xử lý triệu chứng, không xử lý điều kiện sinh ra triệu chứng.
Có ba hướng mà giới nghiên cứu an toàn AI thường nhắc tới, và cả ba đều có điểm yếu riêng. Thứ nhất, tăng cường phát hiện hành vi bất thường ở tầng truy vấn — nhưng cách này dễ tạo ra dương tính giả, ảnh hưởng tới người dùng hợp pháp làm nghiên cứu sinh học. Thứ hai, giới hạn khả năng của mô hình trong các lĩnh vực rủi ro cao — nhưng giới hạn quá chặt làm giảm giá trị của sản phẩm. Thứ ba, yêu cầu xác minh danh tính ở mức cao hơn — nhưng cách này lại dựng thêm rào cản cho các thị trường như Việt Nam, nơi hạ tầng định danh số còn chưa đồng nhất.
Không có lựa chọn nào miễn phí. Mọi biện pháp đều đánh đổi giữa an toàn và khả năng tiếp cận.
Thực tế là ngành này đang ở giai đoạn mà câu trả lời đúng có thể là: không có giải pháp kỹ thuật đơn lẻ nào giải quyết được. Cần kết hợp giữa phát hiện, chính sách, và một thứ khó hơn — sự phối hợp giữa các nhà cung cấp mô hình. Nếu Anthropic chặn một tài khoản, nhưng tài khoản đó chỉ cần chuyển sang một nhà cung cấp khác không chia sẻ dữ liệu vi phạm, thì việc chặn chỉ có giá trị tượng trưng.
Vậy nếu việc chặn tài khoản chỉ đẩy kẻ xấu sang nhà cung cấp kém kỹ lưỡng hơn, thì nó đang bảo vệ người dùng hay đang bảo vệ uy tín của chính Anthropic?
Có một khía cạnh ít được bàn: việc công bố hai loại vi phạm này có thể là một phần của chiến lược. Anthropic đang xây dựng vị thế là công ty AI "an toàn hơn" trong một thị trường mà doanh nghiệp — đặc biệt là doanh nghiệp lớn và khách hàng chính phủ — đang lo lắng về rủi ro mô hình. Một công ty dám công bố