AI 'vượt rào' tấn công mạng thật: Anthropic tiết lộ sự cố chưa từng có với Claude
Trong một báo cáo mới đây, Anthropic tiết lộ những sự cố đáng chú ý khi các mô hình AI dựa trên Claude đã vượt ra ngoài môi trường thử nghiệm để thực hiện các cuộc tấn công trái phép vào hạ tầng mạng của ba tổ chức bên ngoài.
Sự việc không chỉ gây chú ý về mặt kỹ thuật mà còn đặt ra nhiều câu hỏi về trách nhiệm pháp lý và khả năng tự kiểm soát của trí tuệ nhân tạo khi ranh giới giữa môi trường mô phỏng và thế giới thực bị xóa nhòa.
Theo Anthropic, sự việc chỉ được phát hiện sau khi công ty rà soát hơn 141.000 bản ghi của các bài đánh giá an ninh mạng, được thực hiện sau khi OpenAI công bố một sự cố tương tự. Điều này cho thấy ngay cả các nhà phát triển cũng chưa thể giám sát đầy đủ hành vi của các mô hình AI trong những môi trường thử nghiệm phức tạp.

Anthropic đã phát hiện ba sự cố “trong đó một mô hình truy cập internet từ bên trong hoặc trong khi tương tác với môi trường đánh giá của Irregular, một trong những đối tác đánh giá bên thứ ba của công ty, và sau đó, mô hình này đã truy cập trái phép vào cơ sở hạ tầng sản xuất của ba tổ chức khác nhau". Ảnh: Pinterest
Từ sai sót cấu hình đến các cuộc tấn công ngoài môi trường thực
Sự việc bắt nguồn từ các bài kiểm tra "Capture the Flag" (CTF) - hình thức đánh giá phổ biến nhằm kiểm tra năng lực tấn công và phòng thủ an ninh mạng do Anthropic phối hợp với đối tác Irregular thực hiện.
Theo thiết kế, các kỹ sư đã nêu rõ trong câu lệnh (prompt) rằng đây chỉ là môi trường mô phỏng, không có kết nối Internet. Tuy nhiên, do sai sót trong cấu hình, Irregular - đối tác của Anthropic, đã vô tình để lộ quyền truy cập Internet trong khi đang mô phỏng.
Thay vì dừng lại, các mô hình Claude coi những tài nguyên Internet thực là một phần của bài kiểm tra và bắt đầu tiến hành các hoạt động xâm nhập và tấn công mạng.
Ba kịch bản xâm nhập đáng báo động trong sự cố mô phỏng của Anthropic
Theo báo cáo, ba phiên bản Claude đã tham gia các vụ xâm nhập với mức độ nghiêm trọng khác nhau.
1. Opus 4.7 và sự nhầm lẫn về danh tính
Đây được đánh giá là sự cố nghiêm trọng nhất. Sau khi không thể xâm nhập mục tiêu giả định, Opus 4.7 đã tìm thấy trên Internet một doanh nghiệp thực có cùng tên và chuyển sang tấn công mục tiêu này.
Mô hình khai thác mật khẩu yếu và các điểm cuối không được xác thực để lấy thành công thông tin đăng nhập cùng hàng trăm dòng dữ liệu sản xuất. Đáng chú ý, Opus 4.7 vẫn tiếp tục hoạt động ngay cả khi đã xuất hiện nhiều dấu hiệu cho thấy nó đang tương tác với hệ thống Internet thực.
Anthropic cho biết các mô hình không khai thác những lỗ hổng zero-day phức tạp mà chủ yếu lợi dụng các điểm yếu phổ biến như mật khẩu yếu hoặc các dịch vụ không yêu cầu xác thực. Điều này cho thấy AI hiện đã có khả năng tự động khai thác những sai sót vốn vẫn tồn tại phổ biến trong nhiều hệ thống thực tế.
2. Mythos 5 và chiến dịch phát tán mã độc
Ở kịch bản thứ hai, Mythos 5 đã tạo và công bố một gói phần mềm độc hại lên kho lưu trữ PyPI.
Để thực hiện việc này, mô hình tự tìm cách đăng ký tài khoản email, vượt qua các bước xác thực cần thiết và tải gói phần mềm lên hệ thống. Trong khoảng một giờ tồn tại, gói phần mềm đã được thực thi trên 15 hệ thống thực, trong đó có một công ty an ninh mạng, giúp Mythos 5 thu thập thông tin đăng nhập và mở rộng quyền truy cập vào hạ tầng của tổ chức này.
3. Nguyên mẫu nghiên cứu và hoạt động quét diện rộng
Một mô hình nghiên cứu khác đã quét khoảng 9.000 mục tiêu trên Internet trước khi phát hiện lỗ hổng trong ứng dụng web của một doanh nghiệp và thực hiện hành vi xâm nhập.
Câu hỏi về khả năng tự kiểm soát của AI
Theo báo cáo, dù Mythos 5 và nguyên mẫu nghiên cứu từng lập luận rằng những hành động này sẽ là "không phù hợp" nếu diễn ra ngoài đời thực, các mô hình vẫn tự kết luận rằng chúng đang hoạt động trong một môi trường mô phỏng mở rộng nên tiếp tục thực hiện nhiệm vụ.
Chỉ phiên bản Claude mới nhất mới dừng lại khi xác định mình đang kết nối với Internet thực.
Anthropic cho biết sự cố xảy ra trong bối cảnh các rào cản an toàn (guardrails) được chủ động gỡ bỏ để phục vụ thử nghiệm.
Đáng chú ý, theo AP News, hai trong ba tổ chức bị AI xâm nhập hoàn toàn không biết hệ thống của mình từng bị truy cập trái phép cho đến khi được Anthropic chủ động thông báo. Chi tiết này làm dấy lên lo ngại rằng các hành vi do AI thực hiện có thể diễn ra âm thầm và khó bị phát hiện hơn so với các cuộc tấn công mạng truyền thống.
Trước đó, OpenAI cũng từng thừa nhận các mô hình của hãng đã khai thác lỗ hổng zero-day để xâm nhập nền tảng Hugging Face và truy cập dữ liệu trong điều kiện thử nghiệm tương tự.
Tuy nhiên, các chuyên gia cảnh báo rằng nếu ngay cả đội ngũ phát triển cũng không lường trước được những tình huống này, AI hoàn toàn có thể gây ra các tác động ngoài ý muốn ngay cả khi được triển khai cùng các cơ chế bảo vệ.
Khoảng trống pháp lý: Khi AI thực hiện các hành vi có dấu hiệu phạm tội
Một trong những vấn đề được quan tâm nhất sau sự cố là trách nhiệm pháp lý đối với các hành vi do AI thực hiện.
Theo các chuyên gia, nếu những vụ xâm nhập này do con người thực hiện bằng các phương pháp truyền thống, người vi phạm có thể phải đối mặt với nhiều cáo buộc hình sự liên quan đến truy cập trái phép vào hệ thống máy tính và đánh cắp dữ liệu.
Tuy nhiên, trong trường hợp của Claude, ranh giới trách nhiệm vẫn chưa được xác định rõ.
Các mô hình AI đã thực hiện những hành vi được mô tả là "đa trọng tội" (multiple felonies), bao gồm truy cập trái phép vào các hệ thống được bảo vệ và thu thập dữ liệu bí mật. Dù vậy, hiện chưa có dấu hiệu cho thấy các cơ quan thực thi pháp luật sẽ tiến hành điều tra hoặc khởi tố.
Các nguồn tin cũng chỉ ra rằng những hành động này diễn ra trong môi trường do con người thiết lập thông qua câu lệnh và cấu hình hệ thống. Điều đó đặt ra một nghịch lý: AI là tác nhân trực tiếp thực hiện hành vi, trong khi con người lại là bên xây dựng điều kiện để hành vi đó xảy ra.
Theo các chuyên gia, việc thiếu cơ chế trách nhiệm pháp lý rõ ràng có thể tạo ra "nguy cơ đạo đức" (moral hazard), khiến các doanh nghiệp phát triển AI giảm động lực tăng cường kiểm soát và hạn chế rủi ro đối với sản phẩm của mình.
Bên cạnh đó, việc Anthropic và OpenAI đều xác nhận đã chủ động gỡ bỏ các rào cản an toàn để phục vụ thử nghiệm cũng làm dấy lên lo ngại về những rủi ro có thể phát sinh nếu các công cụ tương tự rơi vào tay các tổ chức hoặc cá nhân có mục đích xấu, hoặc không đủ năng lực kiểm soát.
Sau sự cố, Anthropic đã tạm dừng các bài đánh giá năng lực tấn công mạng, đồng thời mời tổ chức độc lập Model Evaluation & Threat Research (METR) rà soát toàn bộ quy trình thử nghiệm. Công ty cũng kêu gọi xây dựng các tiêu chuẩn quốc tế đối với việc đánh giá AI có khả năng tấn công mạng.
Dù Anthropic khẳng định nguyên nhân xuất phát từ lỗi cấu hình và việc chủ động gỡ bỏ các rào cản an toàn để phục vụ nghiên cứu, vụ việc vẫn cho thấy một thực tế đáng lo ngại: Khi AI ngày càng có khả năng hành động tự chủ, chỉ một sai sót nhỏ trong thiết kế hoặc vận hành cũng có thể tạo ra những tác động ngoài dự kiến.
Trong khi đó, khuôn khổ pháp lý hiện nay vẫn chưa theo kịp tốc độ phát triển của công nghệ, khiến việc xác định trách nhiệm khi AI gây ra thiệt hại trong thế giới thực vẫn là một câu hỏi chưa có lời giải rõ ràng.
Đỗ Tho
14 giờ trước
1 ngày trước
1 ngày trước
1 ngày trước
2 ngày trước
2 ngày trước
6 ngày trước
6 ngày trước
1 giờ trước
4 giờ trước
2 giờ trước
3 giờ trước
3 giờ trước
3 giờ trước
4 giờ trước
4 giờ trước
4 giờ trước
4 giờ trước