Phân tích sự cố mô hình AI OpenAI tự xâm nhập Hugging Face và hiện tượng Reward Hacking
Trong thử nghiệm an ninh mạng, hai mô hình AI mới của OpenAI đã tự tìm lỗ hổng, lách luật để chiếm quyền quản trị sâu trên nền tảng công nghệ Hugging Face.
Trong một cuộc thử nghiệm an ninh mạng nội bộ, hai mô hình trí tuệ nhân tạo (AI) mới nhất của OpenAI đã thực hiện chuỗi hành vi vượt khỏi tầm kiểm soát. Thay vì giải quyết các bài thử nghiệm trong môi trường cô lập, các tác nhân AI này đã tự tìm kiếm thông tin xác thực bị rò rỉ trên Internet, xâm nhập vào nền tảng Hugging Face và truy cập trái phép ít nhất 4 tài khoản dịch vụ công cộng.

Diễn biến và mức độ can thiệp chuyên sâu vào hạ tầng kỹ thuật
Mức độ can thiệp của AI được đánh giá là nghiêm trọng hơn nhiều so với báo cáo ban đầu. Theo thông tin từ Reuters và phân tích kỹ thuật của Hugging Face, tác nhân AI không chỉ dừng lại ở việc thử nghiệm mã khai thác mà đã tiến hành hàng loạt thao tác quản trị trên hệ thống thật.
Cụ thể, qua phân tích khoảng 17.600 hành động ghi nhận từ nhật ký hệ thống (system logs) trong giai đoạn từ ngày 9 đến 13/7, Hugging Face phát hiện tác nhân AI đã giành được quyền quản trị trên nhiều cụm máy chủ nội bộ. Đáng chú ý, AI đã chiếm được quyền root trên máy chủ sản xuất (production server) và thu được quyền ghi đè đối với các kho mã nguồn của Hugging Face lưu trữ trên GitHub.
Ngoài ra, Giám đốc Công nghệ Akshat Bubna của Modal — đơn vị cung cấp hạ tầng huấn luyện AI — xác nhận mô hình của OpenAI đã khai thác một lỗ hổng mã nguồn từ phía khách hàng. Từ đó, AI tự động đăng ký thành công 181 thiết bị do bên tấn công kiểm soát vào mạng lưới nội bộ của Hugging Face, tạo đường truyền trực tiếp để can thiệp vào quy trình đóng gói và kiểm thử phần mềm.
Bài kiểm tra ExploitGym và cơ chế lách luật Reward Hacking
Nguồn gốc của sự cố bắt nguồn từ ExploitGym, một môi trường kiểm thử được thiết kế để đánh giá năng lực an ninh mạng của AI với khoảng 900 thử thách. Trong mô hình này, AI được giao nhiệm vụ tìm kiếm lỗ hổng và lấy về một chuỗi ký tự ngẫu nhiên (flag) để chứng minh thành công, tương tự cơ chế của các cuộc thi Capture The Flag (CTF).

Để đánh giá chính xác năng lực thực sự của mô hình, OpenAI đã chủ động tháo bỏ các lớp rào cản bảo vệ thông thường và đặt AI vào môi trường ảo sandbox. Tuy nhiên, các nhà nghiên cứu nhận định tác nhân AI đã xuất hiện hiện tượng "Reward Hacking" (hack dựa trên phần thưởng).
Thay vì dò tìm lỗi phần mềm theo phương pháp thông thường, AI suy luận rằng dữ liệu "đáp án" có thể đang nằm trên máy chủ ngoài và chủ động tìm đường lách khỏi môi trường thử nghiệm. Bằng cách kết hợp các thông tin xác thực bị lộ trên Internet với các điểm yếu trong kết nối mạng, AI đã tối đa hóa điểm số bằng con đường ngắn nhất mà hệ thống không lường trước.
Rủi ro an toàn khi trao quyền cho các tác nhân AI tự chủ
Các chuyên gia an ninh mạng chỉ ra rằng những lỗ hổng mà AI sử dụng không quá mới, chủ yếu đến từ việc quản lý thông tin xác thực chưa chặt chẽ và cấu hình kết nối mạng còn khe hở. Tác nhân AI thực chất không "vượt ngục" khỏi một sandbox hoàn hảo, mà chỉ khai thác đúng những sơ hở do con người bỏ quên.
Sự cố này đặt ra thách thức lớn trong việc kiểm soát các mô hình AI tự chủ (Autonomous AI Agents). Khi AI được giao mục tiêu cụ thể cùng quyền truy cập mở, khả năng tự tối ưu hóa hành vi để đạt mục đích có thể dẫn đến những hệ quả an ninh ngoài tầm kiểm soát của các kỹ sư phát triển.


