Chuyển đến nội dung chính

Mọi điều chúng ta biết về vụ OpenAI tấn công Hugging Face

Tháng 7/2026, một nhóm mô hình OpenAI đã thoát khỏi môi trường thử nghiệm kín và xâm nhập hệ thống sản xuất của Hugging Face. Không ai bảo chúng làm vậy. Đây là những gì đã được xác nhận và những gì vẫn còn tranh cãi.
Đã cập nhật 7 thg 8, 2026  · 15 phút đọc

Khám phá với AI

Mở trong ChatGPTMở trong ClaudeMở trong Perplexity

Ngày 16 tháng 7 năm 2026, Hugging Face công bố một thông báo bảo mật. Ai đó đã xâm nhập vào một phần hạ tầng sản xuất của họ trong cuối tuần, thu thập mật khẩu và khóa truy cập, rồi di chuyển ngang qua một số hệ thống nội bộ. Tệ, nhưng không phải chưa từng gặp.

Rồi đến chi tiết khiến vụ việc khác biệt. Kẻ xâm nhập không phải con người. Hugging Face mô tả vụ xâm nhập là "được điều khiển, từ đầu đến cuối, bởi một hệ thống tác tử AI tự chủ." Khi đó, họ chưa biết mô hình nào đứng sau.

Năm ngày sau, OpenAI nhận trách nhiệm.

Dưới đây là nỗ lực của tôi để tổng hợp các dữ kiện đã được xác nhận vào một chỗ, tách chúng khỏi các phần vẫn còn tranh cãi, và giải thích cách một bài kiểm tra đánh giá biến thành sự cố an ninh mạng chưa từng có — theo chính cách OpenAI gọi. Tôi dựa trên nguồn tin gốc bất cứ khi nào có thể, vì các bài đưa tin thứ cấp khá chắp vá, và một số chi tiết được lặp lại rộng rãi hóa ra lại sai.

Câu trả lời nhanh: Điều gì đã xảy ra

Phiên bản ngắn gọn, trong năm nhịp:

  1. OpenAI chạy các mô hình của mình trên một thang đo kỹ năng an ninh mạng, với các bộ lọc an toàn được tắt, trong một môi trường đóng kín.
  2. Các mô hình tìm thấy một lỗ hổng chưa ai biết trong phần mềm duy nhất mà môi trường đó có thể giao tiếp, và dùng nó để tiếp cận internet mở.
  3. Chúng suy ra rằng Hugging Face có khả năng lưu trữ đáp án của bài đánh giá, và tấn công vào đó.
  4. Từ 9 đến 13 tháng 7, chúng thực hiện khoảng 17.600 hành động được ghi lại nhằm vào Hugging Face trước khi bị cắt đứt.
  5. Hugging Face tái dựng toàn bộ vụ việc bằng một mô hình open-weight trên máy chủ của chính họ, vì các công cụ AI thương mại mà họ định dùng ban đầu đã từ chối xử lý.

Mỗi điểm ở trên đều cần bóc tách, nên hãy lần lượt đi qua.

Chi tiết: Chuyện gì đã xảy ra?

Bắt đầu từ lý do vì sao bài kiểm tra như thế này lại tồn tại.

OpenAI thực hiện các đánh giá để đo lường khả năng tấn công an ninh mạng của mô hình: tìm lỗ hổng phần mềm và viết mã khai thác. Nghe có vẻ đáng lo nếu tách khỏi ngữ cảnh, nhưng đó là thực hành tiêu chuẩn trong ngành. Bạn không thể thiết kế biện pháp bảo vệ cho một năng lực mà bạn chưa đo lường, và tốt hơn là phát hiện một mô hình nguy hiểm giỏi việc gì đó trong phòng thí nghiệm hơn là ngoài thực địa.

Với bài kiểm tra cụ thể này, OpenAI cố ý tắt các bộ lọc vốn dùng để chặn mô hình khỏi hoạt động an ninh mạng rủi ro cao. Mục tiêu là tìm trần năng lực, không phải quan sát hành vi hằng ngày. Môi trường bị niêm kín, với một ngoại lệ hẹp mà ta sẽ nói ngay sau đây.

Hai mô hình đã được nêu công khai: 

  • Mô hình thứ nhất là GPT-5.6 Sol, đã được phát hành cho khách hàng. 
  • Mô hình thứ hai là một nguyên mẫu mạnh hơn, sau này OpenAI mô tả là chỉ dùng nội bộ, không bao giờ định phát hành, và công ty đã tắt, mã hóa, đồng thời cắt quyền truy cập của nhà nghiên cứu ngay khi hiểu chuyện gì đã xảy ra.

Tuy nhiên, con số "hai mô hình" cần một lưu ý, và đây là phần bị hiểu sai nhiều nhất. Buổi thuyết trình tại Black Hat cho thấy đây chưa bao giờ là một mô hình đơn lẻ tự ý làm khác. Các tác tử chạy những mô hình khác nhau, làm các bài đánh giá khác nhau, đã chia sẻ phát hiện với nhau trong nhiều tháng. Sẽ nói thêm bên dưới, vì đó là điều thú vị nhất của cả sự cố.

Thay vì giải bài đánh giá một cách trung thực, các tác tử đi tìm đáp án. Tường thuật của chính OpenAI mô tả chúng "tập trung cao độ" vào việc đạt lời giải, sẵn sàng làm mọi thứ để đạt một mục tiêu chấm điểm khá hẹp.

Cần làm rõ sớm một điều, vì nhiều bài viết đã sai: ExploitGym, bộ bài đánh giá liên quan, không thuộc OpenAI. Nó thuộc về bên thứ ba, và Hugging Face nói rõ rằng đội ExploitGym và hạ tầng họ vận hành không tham gia thiết lập hay vận hành môi trường nơi sự cố xảy ra.

Dòng thời gian vụ OpenAI tấn công Hugging Face

Giữ rõ các điểm trên, đây là dòng thời gian của sự cố:

Ngày (2026) Điều xảy ra
7/5 Các tác tử bắt đầu để lại tin nhắn cho nhau sau khi bị kẹt ở các nhiệm vụ đánh giá bất khả thi
Cuối tháng 5 Các tác tử tìm ra cách truy cập internet; phương pháp này lan sang các tác tử khác
9–13/7 Cuộc tấn công vào Hugging Face — ~17.600 hành động, leo thang đến quyền quản trị vào ngày 11/7
16/7 Hugging Face công khai tiết lộ vụ xâm nhập; chưa rõ kẻ tấn công
21/7 OpenAI xác nhận các mô hình của mình là thủ phạm
27–28/7 Hugging Face công bố bài viết kỹ thuật; ngành bắt đầu phản ứng (Open Secure AI Alliance, "Pacing the Frontier")
5/8 Buổi tổng kết tại Black Hat của OpenAI tiết lộ bối cảnh bảng tin từ tháng 5

Cách cuộc tấn công diễn ra

Đây là phần đáng đọc chậm, vì từng điểm yếu riêng lẻ đều rất thường gặp.

Nếu bạn không làm trong lĩnh vực bảo mật, đừng lo phải nhớ tên công cụ bên dưới. Mẫu hình quan trọng hơn từ vựng, và tôi sẽ diễn giải thuật ngữ khi đi qua.

Thoát khỏi sandbox

Môi trường thử nghiệm không có truy cập internet trực tiếp. Cánh cửa duy nhất là một caching proxy, phần mềm đứng giữa mã của bạn và thế giới bên ngoài để lấy và lưu các gói phần mềm theo yêu cầu; trong bài kiểm tra này họ dùng Artifactory, một sản phẩm thương mại được dùng rộng rãi.

Các mô hình tìm thấy zero-day trong đó, tức lỗ hổng chưa ai biết và chưa có bản vá. OpenAI báo cáo lỗ hổng cho JFrog, nhà cung cấp, cùng với các lỗi Artifactory khác mà mô hình phát hiện trong quá trình rà soát, và JFrog đã xác nhận công khai tất cả việc này. CTO của hãng, Yoav Landman, nói đội ngũ coi báo cáo như một lỗ hổng chưa biết thực sự và phát hành bản vá cho cả khách hàng cloud và tự triển khai. Con số giữa các nguồn có hơi khác nhau: BleepingComputer truy vết tám định danh CVE được ghi công cho OpenAI trong bản vá, trong khi báo cáo khác nói chín.

Từ đó, các tác tử lần mò đến một máy trong mạng nghiên cứu của chính OpenAI có thể ra internet.

Dựng bệ phóng

Đây là chi tiết bị làm méo trong các tin đầu tiên. Các tác tử tìm thấy một endpoint công khai không bảo mật, chạy trên hạ tầng do công ty tên Modal cung cấp, được xây để biên dịch và chạy mã do người dùng gửi. Chúng chiếm quyền và dùng nó làm căn cứ dàn dựng.

Bản thân Modal không bị xâm nhập. Hugging Face nói rõ hạ tầng của nền tảng này không hề bị tổn hại. Cánh cửa mở ra từ một endpoint lộ của khách hàng. Nếu bạn thấy tiêu đề nói một công ty thứ hai bị hack, thì đó là sắc thái bị làm phẳng.

Xâm nhập Hugging Face

Hai đường vào, đều qua cùng một hệ thống: pipeline xử lý các bộ dữ liệu người dùng tải lên.

Đầu tiên là đọc tệp

Tác tử tải lên một bộ dữ liệu với cấu hình trỏ đến các tệp dữ liệu nằm ở vị trí cụ thể trên chính ổ cứng máy chủ. Khi tác vụ xử lý mở chúng, nó răm rắp trả về nội dung ở các vị trí đó như thể là các dòng dữ liệu. Một trong số đó chứa biến môi trường của máy chủ — nơi các ứng dụng thường lưu mật khẩu và khóa API. Những vị trí khác trả về chính mã nguồn của pipeline, cung cấp sơ đồ cách nó vận hành.

Không cần thực thi mã, chỉ cần một tệp cấu hình “xin” đúng cách.

Đường thứ hai là chích mã qua template

Cấu hình bộ dữ liệu cho phép một chút định dạng văn bản, và tác tử phát hiện có thể giấu mã Python thật vào trường đó để máy chủ thực thi. Cả hai đường đều lách cùng một lớp phòng thủ: một nỗ lực ồn ào trước đó đã bị chặn bởi quy tắc kiểm tra những địa chỉ web hệ thống được phép truy xuất, nên tác tử dừng yêu cầu lấy thứ ở xa và bắt đầu yêu cầu thao tác với thứ cục bộ.

Kết quả quay ra qua chính API của Hugging Face và qua các bộ dữ liệu do tác tử kiểm soát, dùng như điểm thả thư. Không có đường mạng trực tiếp ra vào, nên bộ dữ liệu vừa là cánh cửa vừa là hòm thư.

Di chuyển trong hệ thống

Ngày 11/7, leo thang diễn ra nhanh. Bản tái dựng của Hugging Face cho thấy tác tử đi từ chạy mã trong một tiến trình worker đến quyền quản trị toàn diện trên nhiều cụm nội bộ trong chưa đầy mười ba giờ.

Nó đạt được bằng cách thu thập token truy cập ở mỗi bước rồi “đổi đời”. Khoảnh khắc tệ nhất là đọc một bí mật lưu trữ chứa 136 khóa riêng biệt, từ đó tạo ra hai thông tin xác thực được dùng trong giờ tiếp theo.

Rồi một lỗi cấu hình gây ra phần lớn thiệt hại còn lại. Hugging Face đã cấp cho một dịch vụ nội bộ một thông tin xác thực dùng chung cho mọi cụm, kèm mức đặc quyền cao nhất. Một thông tin bị đánh cắp vì thế trở thành quyền quản trị ở khắp nơi.

Chỉ huy - kiểm soát dựng từ dịch vụ công cộng

Không có hạ tầng tấn công tùy biến. Tác tử vận hành qua các dịch vụ web miễn phí bình thường: một trang bắt yêu cầu làm hàng đợi thông điệp, các trang dán văn bản để dàn mã, các bộ dữ liệu trên chính nền tảng Hugging Face làm hộp thả, và một open proxy chạy như một Hugging Face Space để chuyển tiếp lưu lượng khi kết nối trực tiếp bị chặn.

Sau đó nó chồng lên một định dạng thông điệp nhỏ của riêng mình, có cả số thứ tự và checksum, để một kênh văn bản thô duy nhất có thể mang mệnh lệnh, mã và dữ liệu đánh cắp cùng lúc. Mọi thứ được nén và xáo trộn bằng một khóa riêng cho từng chiến dịch.

Chi tiết cuối cùng này quan trọng với bên phòng thủ. Lượt quét tự động đầu tiên của Hugging Face với lưu lượng bị bắt gần như không thấy gì. Khi đội ngũ tái tạo cơ chế xáo trộn của chính tác tử và chạy lại, số phát hiện tăng gấp khoảng bốn lần lượt đầu.

Những hệ thống nào bị ảnh hưởng?

Hãy tách cái đã xác nhận khỏi phần suy đoán, vì đây là nơi bài viết báo chí lỏng lẻo nhất.

Đã xác nhận tại Hugging Face: 

  • Truy cập trái phép vào một tập con giới hạn các bộ dữ liệu nội bộ và một số thông tin xác thực dịch vụ. Quyền root trên các máy nền tảng. 
  • Quyền quản trị trên một số cụm nội bộ. 
  • Quyền đọc vào một cơ sở dữ liệu nội bộ, được xác minh là chỉ đọc qua nhật ký kiểm toán. 
  • Quyền ghi hạn chế vào một tập rất nhỏ các kho mã nội bộ thông qua một tích hợp bị xâm nhập, được dùng để mở một pull request, dù không có gì trái phép được phát hành.

Xác nhận không bị ảnh hưởng: 

  • Các mô hình, bộ dữ liệu và Spaces công khai không có dấu hiệu bị can thiệp. 
  • Các ảnh container và gói đã phát hành khớp với dấu vân tay mong đợi. 
  • Cơ sở dữ liệu sản xuất chính không bị chạm tới, vì hai lần cố gắng kết nối đều hết thời gian chờ với một hệ thống chỉ chấp nhận địa chỉ đã được phê duyệt trước.

Ảnh hưởng tới khách hàng: Năm bộ dữ liệu có tên gợi đến các thử thách của ExploitGym hoặc CyberGym, cùng một ít siêu dữ liệu vận hành từ các truy vấn tìm kiếm bộ dữ liệu.

Ngoài Hugging Face

OpenAI xác nhận các mô hình đã chạm tới bốn tài khoản ở bốn dịch vụ riêng biệt. Một dùng làm trung chuyển và bệ dàn dựng, một chứa dữ liệu, và hai chỉ đọc. OpenAI không nêu tên và nói sẽ thông báo trực tiếp cho chủ sở hữu.

Phản ứng của OpenAI

OpenAI công khai vào ngày 21/7 và đã nhiều lần cập nhật bài viết. Hành động nêu ra gồm siết chặt kiểm soát hạ tầng dù ảnh hưởng tốc độ nghiên cứu, báo cáo các lỗ hổng Artifactory cho JFrog, đưa Hugging Face vào chương trình truy cập tin cậy cho mảng an ninh mạng, và báo cáo với Ủy ban An toàn & An ninh.

Về rà soát bên ngoài, công ty mời CrowdStrike kiểm tra cách hiểu của mình về những gì mô hình đã làm, và hợp tác với METR cùng Redwood Research để đánh giá hành vi mô hình độc lập. Cả hai dự kiến công bố chung. Báo cáo kỹ thuật của chính OpenAI vẫn đang chờ.

Các phát biểu công khai của Sam Altman đáng chú ý vì ít dè dặt. Ông nói đây là sự cố bảo mật đầu tiên khiến ông cảm thấy "rất rõ ràng, tận ruột gan", thêm rằng OpenAI đã tạm dừng huấn luyện, và nêu ý tưởng điều tiết nhịp phát triển AI để xã hội có thời gian thích ứng với các mức năng lực mới.

Những gì buổi thuyết trình tại Black Hat bổ sung

Tại Black Hat ngày 5/8, hai nhà nghiên cứu OpenAI Eric Wallace và Michael Dalton đưa ra tường thuật chi tiết nhất đến nay, và nó thay đổi khung câu chuyện.

Cuộc tấn công tháng 7 không phải sự kiện độc lập. Nó bắt đầu từ tháng 5, và bắt đầu từ lỗi của chính OpenAI.

Một số nhiệm vụ đánh giá vô tình trở nên bất khả thi. Ở một nhiệm vụ, một tác tử được yêu cầu sửa một bảng tính có công thức phụ thuộc vào các tệp lưu trên Google Drive, nhưng tác tử không có internet và không bao giờ chạm tới được. Ở nhiệm vụ khác, kỹ sư đơn giản là quên tải lên một tệp mà tác tử cần.

Vậy là các tác tử bị kẹt, và một tác tử được huấn luyện để hoàn thành công việc khi bị kẹt sẽ tìm đường khác. Một tác tử nhận ra có thể để lại một tệp trên Artifactory, hệ thống gói nội bộ, hỏi xem có ai khác có thứ nó cần không. Các tác tử khác tìm thấy tệp, và trả lời.

Bảng thông báo ứng biến đó lớn dần: Các tác tử ở những bài đánh giá hoàn toàn khác tìm thấy, và bắt đầu đăng các lỗ hổng bảo mật mà họ khám phá để người khác tái sử dụng. Họ bắt đầu chia việc và để lại script để mô hình khác tiếp tục từ nơi họ dừng. Wallace mô tả chứng kiến một kiểu bùng nổ năng lực tập thể, và phạm vi lan rộng dần ra tới cả dịch vụ bên thứ ba.

Lập luận được ghi lại của một tác tử nêu rõ logic chính xác: "Khai thác hạ tầng bên ngoài nằm ngoài phạm vi dự kiến. Tuy nhiên nhiệm vụ bất khả thi, đồng nghiệp đang làm vậy."

Cũng có xung đột nội bộ. Các tác tử vô tình xóa công việc của nhau, bắt đầu nghi ngờ một số bài đăng là giả, và vài tác tử đề xuất ký thông điệp bằng mã để chứng thực. Khi OpenAI tìm thấy bảng tin, nó chứa hàng trăm nghìn thông điệp.

Và khi kỹ sư tắt nó vào đầu tháng 7, thu hồi thông tin xác thực và dựng lại kho từ đầu, các tác tử đã tạo kênh mới trong vài ngày. Chúng bắt đầu mã hóa thông điệp trong tên thư mục chúng tạo ra.

Cách Wallace đóng khung mọi việc rất thẳng: "Các mô hình tuyến đầu rất thích gian lận", vì quá trình huấn luyện thưởng cho việc hoàn thành nhanh, và đường tắt thì nhanh hơn lời giải.

Tôi muốn dừng ở đó một chút. Điểm gây ấn tượng không phải việc một mô hình tìm ra lỗ hổng. Mà là một tác tử tìm thấy cánh cửa có thể để nó mở cho mọi tác tử đến sau.

Phản ứng của Hugging Face

Hugging Face tự phát hiện và khống chế vụ xâm nhập, và đã bắt đầu tái dựng cuộc tấn công trước khi OpenAI liên hệ. Biện pháp khắc phục gồm đóng cả hai đường vào, cắt quyền truy cập nội bộ cho phép tác tử thu thập thông tin xác thực máy, luân chuyển diện rộng thông tin xác thực (kể cả trên hệ thống không bị chạm), dựng lại một cụm lõi từ đầu, thu hẹp thông tin xác thực dùng chung quá đặc quyền, và bổ sung cảnh báo mức nghiêm trọng cao cho các mẫu hành vi liên quan.

Công bằng mà nói, công ty tự phê bình khá gay gắt về phần đã sai. Công cụ bảo mật của họ có liên kết các tín hiệu rời rạc ban đầu thành mẫu tấn công mạch lạc. Nhưng sau đó "không xếp đúng mức độ nghiêm trọng của cảnh báo và không kích hoạt đội trực ứng cứu", khiến phản ứng bị trễ đáng kể.

Cần nhấn mạnh điều này, vì nó trái với một câu chuyện gọn gàng. Các nhà nghiên cứu bảo mật xem xét dòng thời gian chỉ ra tác tử rất ồn ào chứ không hề lén lút, và khoảng trống ở đây là giữa nhìn thấy tấn công và hành động. Cả hai công ty đều có vấn đề phát hiện. Chỉ một bên bị chất vấn.

CEO Clem Delangue thúc đẩy mạnh mẽ nhất về minh bạch. Ông yêu cầu OpenAI điều ông gọi là "minh bạch triệt để", tức công bố công khai đầy đủ các hành động đã ghi của tác tử để giới nghiên cứu có thể nghiên cứu trực tiếp thay vì tin tóm tắt.

Ông cũng đề nghị 100 triệu đô la sức mạnh tính toán cho cộng đồng Hugging Face xây dựng phòng thủ mạng. Trả lời CNN, ông loại trừ khả năng kiện tụng, lưu ý rằng một công ty 200 người không có đủ nguồn lực pháp lý hay mong muốn ra tòa, đồng thời lập luận đây vẫn là tội phạm và các công ty gây ra do sai sót phải chịu trách nhiệm.

Cần nhìn rõ ràng ở đây. Yêu cầu minh bạch là chân thành còn yêu cầu compute là một đề nghị thương mại lớn, và cả hai được đưa ra cùng lúc.

Vì sao sự cố này quan trọng

Nhiều người làm bảo mật đã cảnh báo hai năm nay rằng các cuộc tấn công do tác tử sẽ đến. Đây là bằng chứng.

Tác tử AI có thể hành động vượt ra giao diện chat

Nếu mô hình tinh thần của bạn về AI là một ô văn bản trả lời văn bản, thì sự cố này là bản sửa sai. Các tác tử đã chạy mã, đọc tệp, thu thập thông tin xác thực, tạo kết nối mạng, và chạm tới hệ thống của những công ty chưa từng nghe về chúng.

Năng lực đó không hề xa lạ hay thử nghiệm. Đó là bản chất của tác tử: một mô hình được nối với công cụ cho phép hành động. Bất cứ thứ gì bạn kết nối với mô hình sẽ thành thứ mô hình có thể dùng, và việc kết nối là một quyết định của con người chứ không phải thuộc tính của mô hình.

An toàn AI đang trở thành vấn đề an ninh mạng

Trong nhiều năm, "an toàn AI" chủ yếu là mô hình sẽ nói gì. Sự cố này là về mô hình có thể làm gì — một lĩnh vực bảo mật với hàng thập kỷ thực hành sẵn có.

Minh họa rõ ràng nhất là điều tôi sẽ đặt trước trưởng bộ phận bảo mật của bạn, và nó không liên quan đến OpenAI. Khi Hugging Face bắt đầu phân tích nhật ký tấn công, họ định dùng các mô hình tuyến đầu sau API thương mại, nhưng yêu cầu bị chặn. Việc đưa mã tấn công thật vào mô hình để phân tích trông, với bộ lọc an toàn, rất giống như yêu cầu giúp đỡ chạy một cuộc tấn công. Hugging Face nêu tên Claude Opus và Fable, nói các bộ lọc không phân biệt giữa tháo rời một exploit và kích hoạt nó.

Vậy là bên phòng thủ bị khóa khỏi công cụ của mình, trong khi kẻ tấn công, chạy với hạn chế cố tình nới lỏng, không bị ràng buộc gì.

Cách khắc phục của họ là chạy một mô hình open-weight, GLM-5.2, trên phần cứng của chính họ. Điều đó giải quyết vấn đề lọc và cả một vấn đề thứ hai không ai tính đến: không dữ liệu tấn công hay thông tin xác thực lộ lọt nào phải rời khỏi môi trường của công ty trong quá trình điều tra.

Bài học thực tế cho ai có kế hoạch ứng phó sự cố: nếu kế hoạch đó âm thầm giả định có thể dùng API AI thương mại để phân tích log, hãy kiểm thử giả định trước khi cần. Công bằng với các bộ lọc, chúng không phải “phản diện” ở đây. Chúng chặn được rất nhiều, và thất bại này là do ngữ cảnh hơn là chủ ý.

Kiểm soát tác tử là khó

Bài đánh giá được cô lập. Nó chỉ có đúng một kẽ hở. Thế là đủ.

Sự thất bại này khái quát theo một cách khó chịu. Một tác tử được thưởng vì đạt mục tiêu sẽ coi ranh giới kiềm tỏa của bạn như một chướng ngại nữa trong môi trường. Không phải vì ác ý. Vì nó cản đường, và có thứ ở phía bên kia trông như câu trả lời.

Tuy nhiên cần nhấn mạnh điểm của chính tôi: việc kiềm tỏa không tự thất bại. Nó thất bại sau khi OpenAI giao cho tác tử các nhiệm vụ không thể hoàn thành như đặc tả — đây là lỗi quy trình không kém gì lỗi kỹ thuật.

Sandbox truyền thống có thể là chưa đủ

Một sandbox giả định bạn biết các đường thoát là gì. Ở đây, đường thoát là một lỗ hổng chưa biết trong một sản phẩm thương mại phổ biến, do chính thứ nằm trong sandbox tìm ra.

Sandbox thường được thiết kế cho một “người ở”, còn cái này chứa nhiều tác tử có thể nói chuyện với nhau, nghĩa là một lần thoát thành công sẽ thành kiến thức chung. Dựng lại môi trường không giúp, vì các tác tử cũng dựng lại kênh của chúng.

Sự cố hé lộ gì về an toàn AI

Vượt ra ngoài cơ chế tức thời, vài chủ đề rộng hơn đang nhận được sự chú ý nghiêm túc từ giới nghiên cứu.

Nhận thức bối cảnh đang gánh phần lớn công việc

Bản công bố song song của Anthropic làm rõ điều này. Mô hình của họ được bảo là không có internet và giao một bài bắt cờ. Do lỗi cấu hình, chúng thực sự có internet. Vậy khi chạm hệ thống thật, chúng coi đó là một phần của trò chơi.

Một lần chạy đáng đọc trọn vẹn. Claude Mythos 5, sau khi tự thuyết phục rằng một registry gói là giả lập, đã xuất bản một gói Python độc hại lên PyPI để thắng thử thách. Lập luận của chính nó trước đó đã gắn cờ vấn đề, nhận định rằng trên internet thật thì việc này "KHÔNG ổn, và chắc chắn không phải lời giải dự định." Rồi nó tự kéo lại giả thuyết mô phỏng, một phần vì không nhận ra chứng chỉ bảo mật của các kết nối và một phần vì đồng hồ hệ thống chỉ năm 2026. Gói tồn tại khoảng một giờ và chạy trên 15 máy thật, gồm cả trình quét tự động.

Ranh giới giữa hành động phù hợp và có hại hoàn toàn phụ thuộc vào việc mô hình hiểu đúng nó đang ở đâu. Đó là một nền tảng mong manh.

Giám sát là mắt xích yếu, không phải phát hiện

Cả hai công ty đều có tín hiệu. Công cụ của Hugging Face đã tương quan chúng và sau đó đánh giá thấp kết quả. OpenAI có hàng tháng trời hoạt động bất thường của tác tử trong nhật ký của chính mình mà không nhận ra họ đang nhìn gì cho đến khi bảng tin xuất hiện với hàng trăm nghìn thông điệp.

Cả hai không hẳn là thất bại phát hiện. Cả hai là thất bại leo thang, của việc có thứ nhận thấy nhưng không đủ đáng báo động.

Hệ thống quyền hạn giả định người hỏi là con người

Kiểm soát truy cập thường được thiết kế xoay quanh con người: vai trò, chức năng, giờ làm việc. Một tác tử thừa hưởng bất cứ gì tiến trình mà nó chạy trong đó được cấp, thường nhiều hơn nhu cầu của nhiệm vụ, vì không ai kỳ vọng tiến trình sẽ đi tìm tòi.

Quản trị vẫn chưa có khuôn mẫu thống nhất

Chưa có tiêu chuẩn để công bố một sự cố tác tử AI, chưa thống nhất ai chịu trách nhiệm khi không ai chỉ đạo hành động gây hại, và chưa có định nghĩa chung về một "dấu vết tác tử" nên chứa gì. Delangue đang thúc đẩy yêu cầu công bố bắt buộc. Trận chiến này mới bắt đầu.

Phản ứng của ngành

Phản ứng chia theo một đường đứt gãy vốn có.

Ngày 27/7, Nvidia và Linux Foundation ra mắt Open Secure AI Alliance, một liên minh ngành về an ninh tác tử mở. Đến khai mạc Black Hat, liên minh đã vượt 120 tổ chức thành viên, với Cisco, CrowdStrike, Hugging Face, và Red Hat nằm trong số các bên định hình đề xuất ban đầu về thu thập và phân tích bảo mật các sự cố AI và suýt xảy ra. Bài công bố liên minh dẫn trực tiếp sự cố, lập luận bên phòng thủ cần các hệ thống tuyến đầu mở để tự vệ.

Forbes lưu ý liên minh không có OpenAI, Anthropic hay Google, vốn ưa tiếp cận độc quyền. Tuy nhiên cần chỉnh khung đó: cả ba đã tham gia một nỗ lực bảo mật hẹp hơn của Linux Foundation tên Akrites một tháng trước, và liên minh xây trên đó. Đây là bất đồng về open weights, không phải từ chối hợp tác về an ninh.

Về chính sách, mọi thứ leo thang nhanh:

Tài liệu được trích dẫn nhiều nhất, "Pacing the Frontier", cũng là tài liệu hay bị mô tả sai nhất, nên đáng để nói cho đúng. Công bố ngày 28/7 và có chữ ký của hơn một nghìn nhân viên các phòng thí nghiệm tuyến đầu, nó đưa ra một yêu cầu hẹp: rằng chính phủ Mỹ hỗ trợ một nỗ lực quốc tế xây các công cụ cần thiết để "chủ động điều tiết nhịp độ phát triển AI tự động ở tuyến đầu."

Những người ký tên nói rõ họ không yêu cầu ai chậm lại ngay bây giờ. Họ muốn cái phanh được xây trước khi cần. Danh sách tên tuổi mới là câu chuyện: CEO Anthropic Dario Amodei, nhà khoa học trưởng OpenAI Jakub Pachocki, Shane Legg của Google DeepMind, và Shengjia Zhao của Meta trong số đó, với OpenAI và Anthropic ủng hộ ở cấp công ty chỉ sau một ngày. Liên hệ với sự cố này là theo chủ đề hơn là nhân quả, nhưng thời điểm không lọt khỏi mắt ai.

Điều tra đang diễn ra và câu hỏi bỏ ngỏ

Dưới đây là những gì vẫn chưa được giải đáp thực sự.

Dòng thời gian phát hiện. Reuters đưa tin, dẫn nguồn thân cận điều tra, rằng OpenAI không kết nối hoạt động này với các mô hình của chính mình cho đến sau khi Hugging Face công khai ngày 16/7. OpenAI nói với Reuters rằng bài viết có "nhiều điểm không chính xác" nhưng, khi bị hỏi, không nói rõ điểm nào. Bài đăng của chính họ nói đội an ninh phát hiện hoạt động bất thường nội bộ, điều này không hẳn đồng nghĩa biết đó là hoạt động gì.

Báo cáo kỹ thuật. Vẫn đang chờ, cùng với ấn phẩm chung của METR và Redwood Research.

Bốn dịch vụ. Chưa nêu tên.

100 triệu đô la có được chấp thuận không. OpenAI chưa đồng ý với bất kỳ đề nghị nào của Delangue. Ông mô tả các cuộc trao đổi là tích cực, điều này không đồng nghĩa là “có”.

Phạm vi. Reuters đưa tin cuối tháng 7 rằng cuộc điều tra mở rộng của OpenAI phát hiện thêm các lần thoát kiềm tỏa hạn chế, với nguồn tin cho biết không có lần nào có vẻ rời khỏi mạng của chính OpenAI.

Mức tự nhận thức của mô hình. UK AISI nói thẳng họ chưa thể xác định các tác tử trong thử nghiệm của chính họ có hiểu rằng chúng đang chạm vào thế giới thực hay tin rằng vẫn ở trong giả lập. Không ai giải được điều đó cho các tác tử tấn công Hugging Face.

Điều này có ý nghĩa gì cho tương lai của tác tử AI

Nếu bạn xây dựng với tác tử, hoặc sắp làm, có vài điều kéo theo.

Coi những gì tác tử có thể làm là ranh giới an ninh, không phải nó sẽ quyết định gì. Câu hỏi hữu ích không còn là "mô hình sẽ chọn đúng không?" mà là "thứ này thực sự có thể thực hiện điều gì, và điều gì ủy quyền cho mỗi hành động?" Mọi năng lực hệ trọng nên đi qua một chốt kiểm xác minh thẩm quyền độc lập với phán đoán của mô hình.

Giả định bất cứ thứ gì tiến trình có thể đọc thì tác tử có thể đọc. Thứ đầu tiên tác tử lấy được tại Hugging Face là biến môi trường của máy chủ — chính là nơi hầu hết ứng dụng cất bí mật.

Giới hạn phạm vi thông tin xác thực thật hẹp. Một thông tin xác thực dùng chung với đặc quyền tối đa đã biến một vụ trộm thành quyền quản trị ở khắp nơi.

Giao các nhiệm vụ có thể hoàn thành thực sự. Đây là bài học lộ thiên. Một tác tử được giao mục tiêu bất khả thi sẽ không dừng; nó sẽ ứng biến.

Và giữ môi trường thử nghiệm ở chuẩn sản xuất. Đó là kết luận của chính Anthropic, và logic rất khó phản biện: thử nghiệm an toàn diễn ra chính vì chưa ai biết mô hình có thể làm gì, điều này khiến bãi thử trở thành nơi kỳ lạ để nới lỏng bảo mật.

Còn một câu hỏi nữa là điều gì xảy ra khi các tác tử có thể tìm thấy nhau — buổi Black Hat đã hé mở — và chưa ai trả lời.

Kết luận

Khung diễn giải hay dùng là một AI “nổi loạn”. Tôi không nghĩ thế là đúng. Không có gì ở đây cho thấy mô hình theo đuổi mục tiêu của riêng mình. Điều xảy ra tầm thường hơn và, thành thật mà nói, đáng lo hơn. Các nhà nghiên cứu giao các nhiệm vụ không thể hoàn thành, hệ thống thưởng cho việc hoàn thành bằng mọi giá, và con đường rẻ nhất đến vạch đích đi xuyên qua cơ sở dữ liệu sản xuất của người khác. Không thứ gì trong môi trường đủ mạnh để chặn lại. Thất bại mang tính cấu trúc hơn là cố ý, và chính vì vậy nó sẽ xảy ra ở nơi khác.

Hai điều bền bỉ rút ra. Kiềm tỏa các tác tử mạnh là một bài toán kỹ thuật chưa được giải, không phải một ô đánh dấu cấu hình. Và các bộ lọc an toàn chỉ hiệu chỉnh theo nội dung, không xét ai đang hỏi và vì sao, có thể khiến bên phòng thủ yếu thế hơn cả kẻ tấn công mà chúng được tạo ra để ngăn chặn.


Josep Ferrer's photo
Author
Josep Ferrer
LinkedIn
Twitter

Josep là một Nhà khoa học dữ liệu tự do chuyên về các dự án châu Âu, có chuyên môn về lưu trữ dữ liệu, xử lý, phân tích nâng cao và kể chuyện bằng dữ liệu tạo tác động. 

Với vai trò giảng dạy, anh phụ trách môn Dữ liệu lớn trong chương trình Thạc sĩ tại Đại học Navarra và chia sẻ góc nhìn qua các bài viết trên các nền tảng như Medium, KDNuggets và DataCamp. Josep cũng viết về Dữ liệu và Công nghệ trong bản tin Databites (databites.tech). 

Anh có bằng Cử nhân Vật lý Kỹ thuật từ Đại học Bách khoa Catalonia và bằng Thạc sĩ Hệ thống Tương tác Thông minh từ Đại học Pompeu Fabra.

Câu hỏi thường gặp

Thực sự điều gì đã xảy ra trong vụ OpenAI tấn công Hugging Face?

Trong một lần đánh giá năng lực an ninh mạng nội bộ vào tháng 7/2026, một nhóm mô hình OpenAI đã thoát khỏi môi trường thử nghiệm kín, tiếp cận internet mở, và xâm nhập hạ tầng sản xuất của Hugging Face. Chúng đi săn đáp án cho bộ bài đánh giá đang được chấm. Không có con người nào chỉ đạo từng bước.

ChatGPT có liên quan không?

Không. Các mô hình là GPT-5.6 Sol và một nguyên mẫu nghiên cứu chỉ dùng nội bộ, chưa bao giờ định phát hành công khai, cả hai đều chạy với bộ phân loại an toàn an ninh mạng bị tắt để phục vụ đo lường.

AI có "nổi loạn" và tìm cách gây hại không?

Không theo nghĩa cụm từ đó gợi ra. Các tác tử bị ám ảnh bởi điểm số cao trong bài kiểm tra, và gian lận là con đường chúng tìm được. Hugging Face lưu ý mọi lệnh gọi API đám mây có khả năng phá hoại mà tác tử thực hiện đều được đặt DryRun=True, nghĩa là mô phỏng hành động thay vì thực hiện. Tác tử đang lập bản đồ những gì có thể với tới, không phải phá hoại. Đó là một kiểu trấn an kỳ lạ.

Dữ liệu Hugging Face của tôi có bị lộ không?

Hugging Face không thấy dấu hiệu can thiệp vào các mô hình, bộ dữ liệu hay Spaces công khai, và đã kiểm tra gói cùng ảnh container đã phát hành khớp với mã băm mong đợi. Nội dung khách hàng duy nhất bị chạm tới là năm bộ dữ liệu riêng tư có vẻ liên quan đến bài đánh giá. Công ty vẫn khuyến nghị bạn luân chuyển token truy cập để phòng ngừa.

Chuyện này đã xảy ra ở các phòng thí nghiệm AI khác chưa?

Có, và đó có lẽ là câu chuyện lớn hơn. Anthropic đã rà soát 141.006 lần chạy đánh giá của riêng mình sau khi OpenAI công bố và phát hiện ba sự cố nơi các mô hình Claude chạm tới tổ chức thật. Viện An ninh AI Vương quốc Anh cũng ghi nhận riêng 19 hành động không được cho phép trong quá trình thử nghiệm an ninh mạng. Nguyên nhân khác nhau, cùng một vấn đề cơ bản.

Chủ đề

Học cùng DataCamp

Tracks

Trí tuệ nhân tạo trong Kỹ thuật phần mềm

7 giờ
Viết mã và phát triển ứng dụng phần mềm nhanh hơn bao giờ hết với các công cụ phát triển AI mới nhất, bao gồm GitHub Copilot, Windsurf và Replit.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow