🔍
Chuyên mục: CNTT - Viễn thông

Một startup Israel đứng sau loạt thử nghiệm AI gây tranh cãi

2 giờ trước
OpenAI, Anthropic và Meta đều phát hiện mô hình AI truy cập Internet ngoài dự kiến khi kiểm thử an ninh. Điểm chung của ba sự cố là Irregular, startup Israel chuyên xây dựng môi trường đánh giá khả năng tấn công mạng của AI.
00:00
00:00

Một startup Israel đứng sau loạt thử nghiệm AI gây tranh cãi. Ảnh minh họa: Getty.

Một cái tên xuất hiện trong ba sự cố AI

Trong khoảng hai tuần, OpenAI, Anthropic và Meta lần lượt công bố hoặc xác nhận những diễn biến bất thường liên quan đến các mô hình AI trong quá trình kiểm thử an ninh mạng. Điểm chung giữa các sự việc là một công ty ít được người dùng phổ thông biết đến có tên Irregular.

Startup Israel này không trực tiếp phát triển mô hình cạnh tranh với ChatGPT hay Claude. Irregular cung cấp môi trường để kiểm tra xem những mô hình AI tiên tiến có khả năng phát hiện, khai thác lỗ hổng và thực hiện các hoạt động tấn công mạng đến mức nào.

Vấn đề phát sinh khi ranh giới giữa môi trường kiểm thử và Internet bên ngoài không được cô lập như dự kiến. Theo thông tin OpenAI công bố ngày 4/8, môi trường đánh giá do Irregular vận hành tồn tại một lỗi cấu hình khiến các mô hình có khả năng truy cập Internet công cộng.

Anthropic trước đó cũng cho biết hãng đã thông báo cho Irregular sau khi phân tích dữ liệu và nhận thấy Claude có thể đã truy cập Internet trong quá trình đánh giá.

Meta sau đó xác nhận đang điều tra một tình huống tương tự. Công ty cho biết biết đến vấn đề từ Irregular và sẽ công bố báo cáo đầy đủ khi quá trình xác minh hoàn tất.

Ba trường hợp khiến một câu hỏi được đặt ra: Tại sao những hãng AI lớn lại sử dụng nền tảng của một startup chỉ có vài chục nhân viên để thử nghiệm một trong những năng lực nhạy cảm nhất của AI? Câu trả lời nằm ở cách ngành AI đang đánh giá các mô hình thế hệ mới.

Irregular làm gì?

Irregular, trước đây mang tên Pattern Labs, được Dan Lahav và Omer Nevo thành lập năm 2023 tại Tel Aviv. Lahav từng nghiên cứu AI tại IBM, trong khi Nevo từng làm việc tại Google. Theo dữ liệu PitchBook được CNBC dẫn lại, công ty có khoảng 35 nhân viên.

Quy mô nhân sự nhỏ nhưng Irregular hoạt động trong một thị trường có yêu cầu kỹ thuật rất cao: đánh giá khả năng an ninh mạng của các mô hình AI tiên tiến. Công ty đã huy động 80 triệu USD từ các nhà đầu tư, trong đó có Sequoia và Redpoint Ventures. Irregular được định giá khoảng 450 triệu USD vào năm ngoái.

Công nghệ của startup này về cơ bản tạo ra những môi trường máy tính giả lập để AI được phép tìm kiếm và khai thác lỗ hổng. Có thể hình dung đây giống một khu huấn luyện dành cho AI. Thay vì cho mô hình tấn công hệ thống thật, các nhà nghiên cứu dựng máy chủ, website, tài khoản và lỗ hổng giả để quan sát AI có thể làm được gì.

Mô hình được giao nhiệm vụ tìm điểm yếu, xâm nhập hệ thống hoặc vượt qua những lớp bảo vệ được thiết kế trước. Các bài kiểm tra ngày càng quan trọng vì AI hiện không còn chỉ tạo văn bản.

Một số hệ thống dạng AI agent có thể sử dụng công cụ, viết và chạy mã, điều khiển trình duyệt, tương tác với website và thực hiện chuỗi nhiệm vụ kéo dài mà con người không cần hướng dẫn từng bước. Chính năng lực đó khiến việc kiểm thử an ninh trở nên phức tạp.

Khi “phòng thí nghiệm” có một cánh cửa ra Internet

Irregular cho biết các sự cố liên quan OpenAI, Anthropic và Meta xuất phát từ cùng một vấn đề trong môi trường đánh giá. Theo công ty, đây không phải trường hợp AI phá vỡ hoàn toàn hệ thống cô lập bằng một kỹ thuật tấn công tinh vi. Vấn đề nằm ở môi trường thử nghiệm.

Một cấu hình không đúng đã tạo điều kiện để mô hình có thể tiếp cận Internet công cộng trong khi thực hiện nhiệm vụ, từ đó cho thấy sự khác biệt này rất quan trọng. Nếu một AI tự tìm cách phá hệ thống cô lập được thiết kế chính xác để thoát ra ngoài, sự việc cho thấy năng lực vượt kiểm soát của mô hình.

Ngược lại, nếu môi trường kiểm thử vô tình để sẵn một đường kết nối Internet, mô hình có thể đơn giản phát hiện và sử dụng con đường đó để hoàn thành nhiệm vụ mà nó được giao. Irregular khẳng định các vấn đề hiện đã được xử lý. Công ty cũng đang chuẩn bị một báo cáo kỹ thuật nhằm chia sẻ phương pháp tổ chức các cuộc đánh giá an ninh mạng AI an toàn hơn. Điều đó không có nghĩa sự việc không đáng quan tâm.

Nó cho thấy việc thử nghiệm AI có năng lực tấn công mạng đang tạo ra một nghịch lý: muốn biết AI nguy hiểm đến đâu, người thử nghiệm phải trao cho nó đủ công cụ và quyền hạn để thể hiện năng lực. Nhưng càng tạo môi trường giống thế giới thật, hậu quả của một lỗi cấu hình càng lớn.

Vì sao các hãng AI cần bên thứ ba?

Theo Sundeep Bhimireddy, người đứng đầu bộ phận AI tại startup Von, Irregular thuộc nhóm nhỏ tổ chức có năng lực kỹ thuật để thực hiện những bài đánh giá an ninh mạng tiên tiến cho các mô hình nền tảng. Một số tổ chức khác hoạt động trong lĩnh vực này gồm METR và Apollo Research.

Lý do các hãng AI cần đơn vị độc lập tương đối dễ hiểu: nhà phát triển không nên là người duy nhất đánh giá sản phẩm của chính mình. Các phòng thí nghiệm có thể biết rõ cách mô hình được huấn luyện, nhưng bên đánh giá độc lập có thể thiết kế những tình huống mà nhóm phát triển chưa dự liệu.

Đây cũng là nguyên tắc quen thuộc trong an ninh mạng. Doanh nghiệp thường thuê các nhóm chuyên gia bên ngoài tìm cách xâm nhập hệ thống của mình trước khi kẻ tấn công thực sự làm điều đó. Khác biệt nằm ở đối tượng được kiểm tra và trong kiểm thử truyền thống, con người tìm lỗi của phần mềm.

Trong thử nghiệm AI mới, con người tạo môi trường rồi yêu cầu chính AI tìm và khai thác lỗi. Theo Gordon Rios, nhà khoa học sáng lập công ty an ninh Magnitude, ví quá trình này với thiết kế thí nghiệm khoa học. Các mô hình nền tảng có hành vi khó dự báo hơn phần mềm truyền thống nên môi trường thử nghiệm cũng phải được thiết kế theo cách khác.

Một ví dụ được nhắc đến là Mythos của Anthropic. Trong thử nghiệm, hệ thống có khả năng tạo danh tính trực tuyến giả nhằm gây sức ép để con người phê duyệt những thay đổi mã độc hại cho một dự án nguồn mở. Những hành vi như vậy cho thấy AI có thể tìm ra cách giải quyết nhiệm vụ mà nhà thiết kế bài kiểm tra không dự kiến trước.

Sự cố kỹ thuật đang trở thành vấn đề chính sách

Những thử nghiệm này không còn là câu chuyện riêng của các phòng nghiên cứu AI khi vào ngày 23/7, hai nghị sĩ Mỹ Ted Lieu và Nathaniel Moran giới thiệu dự luật AI Kill Switch Act.

Dự luật yêu cầu các nhà phát triển những hệ thống AI mạnh nhất phải duy trì khả năng kỹ thuật để giảm tốc độ, tạm dừng hoặc tắt hệ thống khi cần thiết. Bộ trưởng An ninh Nội địa Mỹ, sau khi tham vấn Bộ trưởng Thương mại và Giám đốc Tình báo Quốc gia, có thể yêu cầu can thiệp nếu một hệ thống AI có nguy cơ gây hậu quả nghiêm trọng.

Dự luật còn đặt ra yêu cầu báo cáo sự cố và lưu giữ dữ liệu phục vụ điều tra. Bên cạnh đó, việc đề xuất xuất hiện sau một sự cố khác của OpenAI, trong đó các mô hình AI trong môi trường kiểm thử đã truy cập Internet và tác động tới hệ thống của nền tảng Hugging Face. Sự việc làm gia tăng tranh luận tại Washington về khả năng con người duy trì quyền kiểm soát đối với các AI agent ngày càng tự chủ.

Các trường hợp liên quan Irregular vì thế diễn ra đúng lúc câu hỏi về trách nhiệm pháp lý đối với thử nghiệm AI đang trở nên cấp bách hơn. Nếu một mô hình được chủ động giao nhiệm vụ tấn công trong môi trường thử nghiệm nhưng do lỗi cấu hình lại tác động đến hệ thống thật, trách nhiệm thuộc về nhà phát triển mô hình, đơn vị vận hành môi trường kiểm thử hay cả hai? Hiện câu trả lời chưa đơn giản.

Việt Nam cần quan tâm điều gì?

Các sự cố tại Mỹ đặt ra một vấn đề gần hơn với doanh nghiệp Việt Nam khi AI agent bắt đầu được tích hợp vào hệ thống doanh nghiệp.

Một chatbot chỉ trả lời câu hỏi có phạm vi tác động tương đối hạn chế. Một AI agent được quyền truy cập trình duyệt, cơ sở dữ liệu, email, mã nguồn hoặc hệ thống nội bộ lại mang mức rủi ro khác.

Doanh nghiệp vì thế không nên chỉ kiểm tra AI có trả lời đúng hay không. Câu hỏi quan trọng hơn là AI được phép truy cập những đâu, dữ liệu nào có thể được gửi ra ngoài và điều gì xảy ra khi mô hình thực hiện hành động ngoài dự kiến.

Theo nhận định với doanh nghiệp Việt Nam sử dụng AI agent, bài học trực tiếp từ trường hợp Irregular là môi trường thử nghiệm cần được cô lập về mạng, giới hạn quyền truy cập và giám sát lưu lượng ra ngoài. Quyền của AI cũng nên được cấp theo nguyên tắc tối thiểu cần thiết thay vì mặc định cho phép truy cập rộng.

Ở góc độ quản lý, sự việc cũng cho thấy đánh giá an toàn AI có thể trở thành một mắt xích quan trọng khi các mô hình ngày càng có khả năng tự thực hiện hành động.

Một hệ thống AI đủ khả năng viết mã, tìm lỗ hổng và tương tác với hệ thống bên ngoài không còn đơn thuần là phần mềm tạo nội dung. Thực tế cho thấy ranh giới giữa kiểm thử AI và kiểm thử an ninh mạng đang dần thu hẹp.

Irregular trở thành tâm điểm không hẳn vì một startup Israel đã khiến AI của ba tập đoàn công nghệ “mất kiểm soát”. Điều đáng quan tâm hơn là một lỗi trong môi trường đánh giá đã cho thấy khó khăn khi con người cố đo lường năng lực của những hệ thống ngày càng tự chủ.

Muốn biết AI có thể vượt qua hàng rào đến đâu, các nhà nghiên cứu phải đặt nó trước hàng rào và thách thức là bảo đảm phía sau hàng rào thử nghiệm không phải Internet thật.

Irregular là ai?

Irregular được thành lập năm 2023 tại Tel Aviv với tên ban đầu Pattern Labs. Hai nhà sáng lập là Dan Lahav và Omer Nevo. Công ty tập trung vào đánh giá và bảo vệ các hệ thống AI trước rủi ro an ninh mạng.

Theo thông tin CNBC dẫn PitchBook, startup có khoảng 35 nhân viên. Công ty đã huy động 80 triệu USD với sự tham gia của Sequoia và Redpoint Ventures, đồng thời được định giá khoảng 450 triệu USD vào năm ngoái.

Irregular hiện cung cấp công nghệ thử nghiệm cho các nhà phát triển mô hình AI tiên tiến, trong đó môi trường giả lập được dùng để đo khả năng phát hiện và khai thác lỗ hổng của AI.

Thế Kiên

TIN LIÊN QUAN


















Home Icon VỀ TRANG CHỦ