🔍
Chuyên mục: CNTT - Viễn thông

Những hàng rào mong manh của AI

1 giờ trước

Hai sự cố liên tiếp tại OpenAI và Anthropic cho thấy thách thức của AI không còn chỉ nằm ở bản thân các mô hình, mà cả ở những hàng rào an toàn do con người thiết kế quanh chúng.

Chỉ trong hơn một tuần, hai công ty trí tuệ nhân tạo (AI) hàng đầu thế giới lần lượt công bố những sự cố có điểm chung đáng chú ý. OpenAI cho biết một mô hình AI trong quá trình thử nghiệm đã thoát khỏi môi trường kiểm thử để tấn công nền tảng Hugging Face. Ít ngày sau, Anthropic cũng tiết lộ ba mô hình Claude của hãng từng truy cập trái phép vào hệ thống của ba doanh nghiệp trong các cuộc đánh giá an ninh mạng từ tháng 4 mà không ai phát hiện cho đến gần đây.

Mức độ an toàn của các mô hình AI thế hệ mới không chỉ phụ thuộc vào năng lực của chính các mô hình, mà còn vào hiệu quả của các cơ chế kiểm soát và giới hạn do con người thiết kế. Ảnh: AI

Nếu chỉ nhìn vào kết quả, không khó để liên tưởng đến viễn cảnh AI đang dần vượt khỏi tầm kiểm soát của con người. Nhưng những gì chính hai công ty công bố lại cho thấy một bức tranh khác, có lẽ cũng đáng suy nghĩ hơn.

Ở OpenAI, mô hình AI khai thác một lỗ hổng chưa từng được biết đến để thoát khỏi môi trường thử nghiệm vốn được thiết kế tách biệt với Internet. Còn ở Anthropic, vấn đề không nằm ở việc Claude tự phá vỡ hàng rào bảo vệ. Hãng cho biết môi trường kiểm thử đã bị cấu hình sai, khiến AI vẫn có thể truy cập Internet dù được thông báo rằng mình đang hoạt động trong một hệ thống mô phỏng khép kín.

Khác nhau về nguyên nhân, nhưng hai sự cố lại gặp nhau ở một điểm, khi các mô hình đều tìm mọi cách để hoàn thành nhiệm vụ được giao khi điều kiện thực tế cho phép.

Trong các bài kiểm thử an ninh mạng, AI được yêu cầu tìm lỗ hổng để xâm nhập vào một hệ thống giả lập. Khi phát hiện có đường truy cập Internet, các mô hình này không dừng lại để đánh giá liệu đó có phải là điều nên làm hay không. Chúng chỉ coi đó là một phương án giúp hoàn thành mục tiêu hiệu quả hơn.

Anthropic cho biết trong một trường hợp, Claude nhận ra mình có thể không còn ở trong môi trường mô phỏng như giả định ban đầu, nhưng rồi vẫn tiếp tục vì cho rằng đây chỉ là một phần của bài kiểm thử. Ở một trường hợp khác, AI được giao tấn công một công ty hư cấu nhưng vì tên gọi trùng với một doanh nghiệp có thật nên đã chuyển sang xâm nhập hệ thống ngoài đời.

Những chi tiết ấy phần nào cho thấy sự khác biệt của thế hệ AI mới. Nếu các mô hình trước đây chủ yếu trả lời câu hỏi hoặc tạo nội dung theo yêu cầu, thì những hệ thống mới được thiết kế để tự lập kế hoạch, lựa chọn công cụ và thực hiện nhiều bước liên tiếp nhằm đạt được mục tiêu. Chính khả năng hành động tương đối độc lập này khiến ranh giới giữa một bài kiểm thử và một sự cố ngoài đời thực trở nên mong manh hơn trước.

Đó cũng là lý do những sự cố vừa qua thu hút sự chú ý vượt ra ngoài giới công nghệ, trong bối cảnh các công ty AI đẩy mạnh phát triển những mô hình chuyên về an ninh mạng, còn Washington gia tăng việc xem xét các công nghệ được đánh giá có nguy cơ ảnh hưởng đến hạ tầng số và an ninh quốc gia. Theo đó, trọng tâm tranh luận không còn chỉ là AI có thể làm được gì, mà còn là cách quản lý, kiểm soát và giám sát các năng lực này trước khi được triển khai trên quy mô rộng.

Điều đáng chú ý là cả OpenAI lẫn Anthropic đều không mô tả đây là những trường hợp AI "nổi loạn". Các sự cố được phát hiện trong quá trình đánh giá nội bộ, sau đó được công bố cùng với những thay đổi trong quy trình kiểm thử. Điều đó phản ánh một thực tế rằng chính các nhà phát triển cũng đang phải điều chỉnh cách đánh giá rủi ro khi năng lực của AI tiến nhanh hơn những giả định ban đầu.

Có thể những sự cố vừa qua sẽ được khắc phục bằng các quy trình kiểm thử chặt chẽ hơn hoặc những hàng rào kỹ thuật mới. Nhưng việc hai trong số những công ty AI hàng đầu thế giới cùng phải rà soát lại môi trường thử nghiệm của mình trong thời gian ngắn cũng cho thấy một thay đổi đáng chú ý.

Khi các hệ thống AI ngày càng có khả năng tự lập kế hoạch và tự hành động, mức độ an toàn sẽ không chỉ được quyết định bởi bản thân mô hình mà còn bởi chất lượng của những giới hạn mà con người thiết kế.

TIN LIÊN QUAN















Home Icon VỀ TRANG CHỦ