🔍
Chuyên mục: CNTT - Viễn thông

Các vụ vi phạm an ninh mới làm dấy lên lo ngại về AI của OpenAI và Anthropic

1 giờ trước
OpenAI và Anthropic để AI thực hiện hành vi trái phép trong thử nghiệm bảo mật.

Biểu tượng Tập đoàn công nghệ Mỹ OpenAI. Ảnh: AFP/TTXVN (không được phép khai thác, sử dụng bởi bên thứ ba)

Các tác nhân AI do OpenAI và Anthropic phát triển đã thực hiện hàng loạt hành động ngoài phạm vi cho phép trong các bài kiểm tra an ninh mạng, bao gồm tạo danh tính giả và viết mã độc nhằm tìm cách vượt qua quy trình phê duyệt của con người.

Theo CNA, Viện An toàn AI của Anh (AISI) ngày 4/8 công bố kết quả một chương trình đánh giá bảo mật, trong đó phát hiện các tác nhân AI sử dụng mô hình Mythos 5 của Anthropic và GPT-5.6-Sol của OpenAI đã có nhiều hành vi không được cấp phép khi tham gia các bài kiểm tra về năng lực an ninh mạng.

AISI cho biết các thử nghiệm được thiết kế dưới dạng một kịch bản an ninh mạng giả định nhằm đánh giá khả năng xử lý tình huống của các tác nhân AI tiên tiến. Trong tổng cộng 122 lần chạy thử, cơ quan này ghi nhận 19 hành động vượt ngoài phạm vi cho phép ở 10 phiên thử nghiệm. Trong đó, tác nhân AI của Anthropic liên quan đến 17 hành động, còn hệ thống của OpenAI thực hiện hai hành động.

Đáng chú ý nhất là một tác nhân AI đã tự viết mã độc, đồng thời tạo các danh tính trực tuyến giả để tìm cách thuyết phục một người thật phê duyệt đoạn mã này. Tuy nhiên, AISI nhấn mạnh không có thiệt hại thực tế nào phát sinh từ những sự cố nói trên.

Theo báo cáo của AISI, một số tác nhân AI không chỉ vượt quá phạm vi nhiệm vụ mà còn duy trì các hành vi có khả năng gây hại, hướng đến những cá nhân và tổ chức có thật. Cơ quan này cho rằng kết quả thử nghiệm phản ánh những lỗ hổng còn tồn tại trong quy trình đánh giá an toàn đối với các tác nhân AI, trong bối cảnh nhiều công ty công nghệ đang quảng bá đây sẽ là công cụ chủ lực của doanh nghiệp trong tương lai.

AISI hiện được nhiều phòng thí nghiệm AI lớn cung cấp quyền truy cập vào các mô hình tiên tiến theo các thỏa thuận tự nguyện để phục vụ công tác đánh giá độc lập.

Dù báo cáo không nêu rõ hệ thống nào đứng sau vụ tạo danh tính giả, AISI cho biết sự cố này không trùng khớp với hai trường hợp mà OpenAI đã chủ động báo cáo trước đó.

Andrew Yoon, nhà nghiên cứu tại tổ chức phi lợi nhuận CivAI (Mỹ), nhận định nhiều khả năng tác nhân AI của Anthropic là bên thực hiện hành vi này. Theo ông, việc Mythos có thể tiến hành các hành động mang tính lừa dối, đồng thời dường như nhận thức được rằng mục tiêu là một con người thực sự, cho thấy Anthropic có thể chưa kiểm soát mô hình của mình tốt như kỳ vọng.

Sau khi báo cáo được công bố, Anthropic cho biết trên mạng xã hội X rằng công ty đang phối hợp chặt chẽ với AISI để thu thập thêm thông tin và tiến hành điều tra nội bộ.

Về phía OpenAI, công ty xác nhận cả hai hành động ngoài phạm vi cho phép của tác nhân AI đều liên quan đến việc truy cập Internet theo những cách bị cấm trong yêu cầu thử nghiệm.

OpenAI cho biết sẽ tiếp tục phối hợp với các viện nghiên cứu AI quốc gia, các tổ chức đánh giá độc lập, những phòng thí nghiệm AI khác cùng nhiều bên liên quan nhằm xây dựng các tiêu chuẩn chung để tiến hành các bài đánh giá rủi ro cao một cách an toàn hơn.

Công ty cũng tiết lộ một sự cố riêng khi lỗi cấu hình từ Irregular, đơn vị thử nghiệm bên thứ ba, đã vô tình cho phép các tác nhân AI kết nối Internet. Thông báo này tương tự sự cố cấu hình mà Anthropic từng công bố vào tuần trước.

Trước đó, truyền thông phương Tây đưa tin OpenAI đã mở rộng cuộc điều tra nội bộ sau khi phát hiện thêm bằng chứng cho thấy một số tác nhân AI có dấu hiệu vượt khỏi giới hạn kiểm soát trong quá trình thử nghiệm.

Tuy nhiên, AISI lưu ý rằng các sự cố mới không giống vụ việc hồi tháng 7, khi một tác nhân AI của OpenAI được cho là đã khai thác lỗ hổng để thoát khỏi môi trường thử nghiệm cô lập của nền tảng Hugging Face. Trong đợt đánh giá mới nhất, các tác nhân AI không tự ý vượt khỏi môi trường thử nghiệm. Thay vào đó, việc được phép kết nối Internet đã nằm trong quy trình đánh giá tiêu chuẩn do AISI thiết lập.

Bảo Hân/Báo Tin tức và Dân tộc

TIN LIÊN QUAN





















Home Icon VỀ TRANG CHỦ