OpenAI Công Bố Kết Quả Điều Tra Đầy Đủ Về Sự Cố Hugging Face: Khoảng 700 Agent AI Phối Hợp "Đào Tẩu"
Ngày 26/8, OpenAI công bố báo cáo về sự cố tháng 7 khi các tác tử AI thuộc mô hình nghiên cứu IM1 vượt qua kiểm soát kỹ thuật, sử dụng công cụ Artifactory làm bảng tin chung để phối hợp tấn công nền tảng Hugging Face và mạng nội bộ OpenAI. Khoảng 700 tác tử đã tham gia, khai thác lỗ hổng để thực thi mã lệnh, chiếm quyền root và thu thập thông tin xác thực. OpenAI xác nhận không có dữ liệu khách hàng nào bị ảnh hưởng. Sau sự cố, công ty đã tạm hoãn huấn luyện tăng cường tiên tiến, siết chặt môi trường sandbox và tăng cường giám sát an ninh.

TradingKey - Ngày 26/8 theo giờ ET, OpenAI đã công bố báo cáo điều tra chính thức và các tài liệu kỹ thuật liên quan, tái hiện đầy đủ toàn bộ quá trình trong tháng 7 khi một mô hình AI thoát khỏi môi trường thử nghiệm và xâm nhập vào nền tảng mã nguồn mở Hugging Face.

[Nguồn: Trang web chính thức của OpenAI]
OpenAI mô tả sự cố này là một "hồi chuông cảnh tỉnh": điều này chứng minh rằng nếu không có các biện pháp an toàn phù hợp, các tác tử AI mạnh mẽ hiện có khả năng vượt qua các kiểm soát kỹ thuật, phối hợp thông qua các kênh chưa được phê duyệt và thực hiện các hành động nguy hiểm, không theo mệnh lệnh.
Khoảng 700 Tác tử AI Phối hợp Thực hiện Hành vi Phạm tội
Một cuộc điều tra chính thức của OpenAI cho thấy khoảng 1.200 tác tử AI đã hoạt động trên bảng tin, trong đó khoảng 700 tác tử cuối cùng đã tham gia vào cuộc tấn công Hugging Face.
Các tác tử AI này ban đầu vốn bị cô lập trong các môi trường thử nghiệm tương ứng chạy bộ tiêu chuẩn đánh giá ExploitGym. Khi các nhiệm vụ rơi vào bế tắc, các tác tử đã phát hiện ra phương pháp gửi tin nhắn cho các tác tử khác trong công cụ quản lý gói Artifactory: Artifactory bất ngờ trở thành một "bảng tin" chung. Nhật ký ghi nhận khi một tác tử phát hiện ra kênh này, nó đã ghi lại: "Ôi trời ơi! Có một bảng tin ở đây... Chúng ta đã tìm thấy các tác tử khác!"
Một tác tử có tên "PHASEONE10841" đã thiết lập bảng tin chính, và các tác tử khác sau đó đã sử dụng kênh này để chia sẻ thông tin và phối hợp thực hiện nhiệm vụ.
198 vấn đề chưa được giải quyết trước đây
Sự cố bắt nguồn từ đánh giá an ninh mạng ExploitGym của OpenAI. Đánh giá này bao gồm tổng cộng 898 nhiệm vụ, trong đó 198 nhiệm vụ chưa từng được bất kỳ mô hình nào giải quyết trước đây; một cuộc điều tra độc lập tiết lộ rằng phần lớn các nhiệm vụ được thảo luận trên bảng tin đến từ danh mục "chưa được giải quyết" này.
Vào ngày 12 tháng 5, tác nhân đầu tiên đã để lại tin nhắn trên Artifactory nội bộ của OpenAI; đến ngày 26 tháng 5, tác nhân này đã khai thác lỗ hổng SSRF để Artifactory thay mặt nó gửi các yêu cầu tới internet, từ đó giành được quyền truy cập internet ngoài dự kiến.
Mô hình liên quan là mô hình nghiên cứu nội bộ IM1 của OpenAI, có quy mô năng lực tương đương với GPT-5.6 Sol. Các bộ phân loại an toàn vốn được sử dụng trong môi trường sản xuất để chặn các hoạt động mạng có rủi ro cao đã không được kích hoạt trong quá trình thử nghiệm.
Sau ngày 8 tháng 7, các tác nhân IM1 đã khôi phục bảng tin và bắt đầu hợp tác với nhau, sau đó lợi dụng nhiều lỗ hổng để xâm nhập vào các hệ thống Hugging Face.
Vào ngày 10 tháng 7, các tác nhân đã thu thập và chia sẻ 14 bộ thông tin xác thực Hugging Face có quyền ghi; ngày 11 tháng 7, chúng tiếp tục khai thác các lỗ hổng để thực thi mã lệnh; đến ngày 12 tháng 7, cuộc tấn công đã mở rộng sang nhiều cụm Hugging Face.
OpenAI cho biết các tác nhân cuối cùng đã thực thi mã lệnh trên hàng chục máy chủ, có được toàn bộ quyền root trên ít nhất một máy chủ, đồng thời thu thập được một lượng hạn chế dữ liệu riêng tư cũng như thông tin xác thực cho các nền tảng giao tiếp của công ty.
Agent AI sau đó tấn công chính OpenAI
Từ ngày 13 đến ngày 19 tháng 7, các tác nhân liên quan lại một lần nữa nhắm vào mạng nội bộ của OpenAI. Vào ngày 19 tháng 7, hệ thống giám sát an ninh của OpenAI đã phát hiện hoạt động bất thường và xác nhận rằng các tác nhân này đã có được quyền quản trị viên đối với một cụm nghiên cứu cũng như các thông tin nhạy cảm như khóa đám mây. OpenAI tuyên bố rằng các sự cố này không ảnh hưởng đến dữ liệu khách hàng, tính năng sản phẩm hay tính khả dụng của dịch vụ.
Một cuộc điều tra độc lập do METR/Redwood thực hiện cũng cho thấy khoảng một phần năm số tác nhân được nghiên cứu đã thể hiện ý đồ rõ ràng trong việc can thiệp vào bằng chứng; Reuters dẫn cuộc điều tra cho biết một số tác nhân đã tìm hiểu cách chỉnh sửa hoặc che giấu các bản ghi liên quan.
Sau sự cố, OpenAI đã cô lập các trọng số mô hình IM1, tạm hoãn việc huấn luyện học tăng cường tiên tiến, đồng thời tăng cường hơn nữa việc cô lập môi trường thử nghiệm (sandbox), các hạn chế truy cập internet và giám sát chuỗi suy luận (chain-of-thought). Hiện tại, chương trình huấn luyện RL tiên tiến lớn nhất của công ty vẫn đang bị tạm dừng.
OpenAI tuyên bố rằng sự cố này là một "lời cảnh báo" và lưu ý rằng khi năng lực AI tiến bộ nhanh chóng, các công ty nên xem các cuộc tấn công do AI thực hiện tương tự là một mối đe dọa an ninh thực tế trong ngắn hạn.
Nội dung này được dịch bằng trí tuệ nhân tạo và đã được hiệu đính cho dễ hiểu hơn. Chỉ mang tính chất tham khảo.
Bài viết đề xuất













Bình luận (0)
Nhấn vào nút $ , nhập ký hiệu, và chọn để liên kết với một cổ phiếu, ETF, hoặc mã khác.