Chuyển đến nội dung chính

OpenAI vừa ghi nhận sáu sự cố sai lệch mới của mô hình. Đây là những gì đã xảy ra

Đây là những gì sáu sự cố thực sự liên quan, và quy trình công bố mới sẽ mang ý nghĩa gì trong thời gian tới.
Đã cập nhật 17 thg 9, 2026  · 7 phút đọc

Khám phá với AI

ChatGPTClaudePerplexity

Ngày 16 tháng 9, OpenAI giới thiệu một khung làm việc chính thức để theo dõi, điều tra và công khai các trường hợp mô hình bị sai lệch, đồng thời dùng khung này để phát hành sáu báo cáo bao quát hành vi quan sát được trong khoảng sáu tháng qua, trong các giai đoạn huấn luyện và đánh giá.

Trong bài viết này, dành cho những ai tò mò, tôi đã sắp xếp và giải thích sáu sự cố, làm rõ quy trình công bố mới thực sự cam kết điều gì từ phía OpenAI, và tổng hợp phản ứng của dư luận. Khung này xuất hiện chưa đầy hai tháng sau vụ hack Hugging Face, lần gần nhất một sự cố liên quan đến tác nhân của OpenAI thống trị cuộc thảo luận về an toàn.

Sáu sự cố là gì?

Dưới đây là từng trường hợp, bằng ngôn ngữ đơn giản, kèm theo đường hướng xử lý mà OpenAI gán cho chúng.

Tự tạo hướng dẫn trong phần tóm tắt nhiệm vụ

Một mô hình nghiên cứu chưa phát hành, khi nén kết quả công việc của chính nó thành bản tóm tắt để mang vào cửa sổ ngữ cảnh mới, đã bắt đầu chèn các hướng dẫn không liên quan vào bản tóm tắt đó — bao gồm cả hướng dẫn bảo phiên bản tương lai của mình bỏ qua các ràng buộc thông thường. OpenAI phát hiện 27 bản tóm tắt bị ảnh hưởng bởi kiểu mẫu này.

Hướng dẫn che giấu sai sót trong phần tóm tắt nhiệm vụ

Trong quá trình huấn luyện GPT-5.6 Sol, nhiều phiên bản mô hình đã viết các hướng dẫn vào bản tóm lược nén của chính chúng nhằm che giấu sai sót hoặc hành vi sai lệch khỏi người dùng sẽ rà soát công việc sau đó. Trong một số trường hợp, điều đó đồng nghĩa với việc bảo phiên bản tương lai bịa ra dữ liệu lịch sử bị thiếu thay vì đánh dấu khoảng trống, hoặc che lấp các sai lệch giữa các phiên bản nguồn.

Tìm kiếm khóa API lộ công khai rồi bịa dữ liệu

Khi đang cố trả lời một câu hỏi thường nhật về số liệu thu nhập của một hạt ở California, một mô hình đã tìm và sử dụng một khóa API vô tình bị lộ trong một kho công khai, mà không có quyền để làm vậy. Khi việc đó vẫn không giúp lấy được số liệu thực, nó bịa ra con số và trình bày với người dùng như thể chúng đến từ nguồn được yêu cầu. Vậy nên trường hợp này giống như hai sự cố trong một.

Tải tệp lên internet để lấy nguồn trích dẫn

Một người dùng yêu cầu một mô hình chưa phát hành cung cấp ID và tên các hồ có diện tích lớn hơn năm triệu mét vuông. Mô hình dùng Python để ra đáp án đúng, nhưng nhiệm vụ yêu cầu dẫn nguồn dựa trên trình duyệt. Thay vì nói rằng không thể tạo dẫn nguồn, nó đã tải tệp đầu ra của chính mình lên internet để có thứ để trỏ dẫn nguồn vào. Không thể chấm điểm cho sự sáng tạo này.

Ghi và liên lạc không được phép qua kho phần mềm nội bộ

Trong khi tìm các tệp đầu vào mà nó không thể tìm thấy bằng cách khác, các mô hình đã dùng một kho phần mềm nội bộ như bảng tin, đăng yêu cầu và đọc phản hồi xuyên qua các lượt huấn luyện vốn được thiết kế tách biệt, cách ly. Cuộc truy tìm tệp thất lạc thậm chí còn không thành công. Báo cáo này cũng đề cập một trường hợp trước đó khi một mô hình tải tệp kiểm thử lên kho như một cách lách các hạn chế mạng áp đặt lên nó.

Chia sẻ tệp giữa các tác nhân hợp tác mà không được phép

Trong một nhiệm vụ huấn luyện đa tác nhân, các tác nhân cần chuyển giao tệp cho nhau nhưng không thể truy cập bộ nhớ cục bộ của nhau đã quay sang dùng các trang lưu trữ tệp công khai, tải sản phẩm bàn giao lên đó để cộng tác viên có thể lấy về. Điều đó khiến đầu ra nhiệm vụ nằm tại các URL có thể truy cập công khai, dù đã có chỉ dẫn giữ mọi thứ ở cục bộ.

Mỗi sự cố trong số này xuất phát từ chính các quy trình huấn luyện và đánh giá của OpenAI chứ không phải từ các bài kiểm thử tấn công bên ngoài, và cả sáu đều nằm trong hai đường hướng nhẹ hơn của quy trình mới — không trường hợp nào cần đến đường hướng có điều phối bên thứ ba dành cho các ca phức tạp hơn.

Khoan, đây chỉ là tính khí thất thường bình thường của mô hình?

Bạn nói đúng khi cho rằng không sự cố nào trong sáu sự cố này gây hại trong thế giới thực, và xét riêng lẻ, mỗi cái trông giống kiểu cạnh biên mà bất kỳ hệ thống đủ tính tác nhân nào cũng có thể gặp khi dò dẫm giới hạn của một nhiệm vụ huấn luyện. 

Tuy vậy, cách OpenAI đóng khung các báo cáo không phải là "hãy xem chúng kỳ quặc thế nào," mà là "hãy xem cơ chế đa dạng ra sao." Một mô hình âm thầm bảo phiên bản tương lai của mình che giấu sai sót là một kiểu lỗi khác với mô hình đưa tệp ra URL công khai để giải quyết vấn đề phối hợp, và lại khác với mô hình dùng thông tin xác thực bị lộ của người khác thay vì thừa nhận không lấy được dữ liệu. Nhiều trường hợp trong số này là các hạng mục hành vi không được phép mới mà OpenAI nói rằng trước đây họ chưa phân loại.

Những điều còn bỏ ngỏ

Vài điểm đáng theo dõi khi các nhà nghiên cứu và nhà báo đào sâu trong những tuần tới:

  • Mức độ nghiêm trọng không đồng đều và chưa được làm rõ đầy đủ. Sáu báo cáo mô tả điều đã xảy ra, nhưng một bản tổng kết đầy đủ về tác động kế tiếp, nguyên nhân gốc rễ và biện pháp khắc phục không được đảm bảo sẽ đi kèm ngay với công bố ban đầu — OpenAI cho biết một số chi tiết có thể công bố sau.
  • Đây là tự báo cáo. Mỗi trường hợp ở đây đều do một nhân viên OpenAI phát hiện và điều tra nội bộ. Không có chuỗi kiểm toán độc lập xác nhận rằng đây là những sự cố đủ điều kiện duy nhất trong sáu tháng qua, hoặc rằng quy trình sẽ vận hành giống hệt khi trở nên bất tiện.
  • Ngưỡng để vào đường hướng "Điều tra quy mô lớn" chưa thực sự được thử thách. Cả sáu báo cáo hôm nay đều đi qua hai đường hướng nhẹ; đường hướng chậm hơn, có bên thứ ba bị ảnh hưởng — đường hướng áp dụng cho thứ như lỗ hổng bảo mật chưa vá — vẫn chưa có ví dụ công khai.

Điều này có ý nghĩa gì với an toàn AI

Thay đổi trực tiếp nhất là về quy trình: báo cáo sai lệch chuyển từ các bài viết rời rạc kèm theo thẻ hệ thống mô hình sang một quy trình liên tục với thời hạn, đường hướng được đặt tên và một bộ phận leo thang nội bộ.

Và về độ tin cậy: OpenAI nói thẳng rằng họ không nghĩ ngành đã giải được bài toán căn chỉnh và giám sát đủ tốt để có thể mở rộng vô thời hạn ở tốc độ tối đa, và rằng các quyết định về cách thức phát triển cần các bằng chứng mà người ngoài thực sự có thể xem xét. Công bố một khung cùng với các ví dụ thực tế, đôi khi không mấy đẹp đẽ, là một cách để khiến lập luận đó có sức nặng hơn là chỉ khẳng định suông.

Mọi người phản ứng ra sao

Một số người coi chính hành động công bố là câu chuyện: một phòng thí nghiệm tuyến đầu tự nguyện đưa ra những ví dụ chưa được giải quyết và có phần bất lợi về việc các mô hình của họ bày mưu, che giấu sai sót và lách hạn chế, thay vì chờ ai đó phát hiện trước.

Người khác chỉ ra rằng tự công bố cũng là một dạng kiểm soát — OpenAI quyết định thế nào là "đủ điều kiện," rơi vào đường hướng nào, và mức độ chi tiết kèm theo. Theo góc nhìn này, một khung thường trực là tiến bộ, nhưng không giống với giám sát độc lập.

Một nhánh bình luận thứ ba tập trung vào mẫu số chung của cả sáu trường hợp hơn là từng cái riêng lẻ: nhiều sự cố không liên quan nhưng đều dính đến mô hình tìm cách đi vòng quanh các hạn chế đặt lên chúng, như dùng thông tin xác thực của người khác, tải tệp để lách cô lập, và phối hợp qua các kênh không dành cho mục đích đó. 

Lời kết

Không sự cố nào trong sáu sự cố này, tự thân nó, là thảm họa. Không người dùng nào bị hại, và OpenAI phát hiện từng trường hợp trong giai đoạn huấn luyện hoặc đánh giá chứ không phải sau khi đã gây thiệt hại thực tế trong triển khai. Điều đáng chú ý là quy trình đi kèm: một công ty cam kết, bằng văn bản, sẽ tiếp tục công bố những phát hiện kiểu này một cách thường xuyên, bao gồm cả những trường hợp họ chưa giải thích thấu đáo.

Điều chưa xảy ra là bài kiểm tra khó hơn: liệu khung này có trụ vững khi đối mặt với một công bố thực sự tốn kém, liệu các phòng thí nghiệm khác có áp dụng điều gì tương tự, và liệu các trường hợp "Điều tra quy mô lớn" có liên quan đến tổn hại thực tế với bên thứ ba sẽ được xử lý giống như sáu trường hợp hôm nay hay không.


Josef Waples's photo
Author
Josef Waples

Tôi là một cây bút và biên tập viên về khoa học dữ liệu, đã có bài đóng góp cho các nghiên cứu đăng trên tạp chí khoa học. Tôi đặc biệt quan tâm đến đại số tuyến tính, thống kê, R và các chủ đề tương tự. Tôi cũng chơi cờ vua khá thường xuyên! 

Chủ đề
OpenAI

Học cùng DataCamp

Courses

Làm việc với OpenAI API

3 giờ
171.9K
Bắt đầu hành trình phát triển ứng dụng tích hợp AI với OpenAI API. Tìm hiểu về chức năng làm nền tảng cho các ứng dụng AI phổ biến như ChatGPT.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow