MXH mygo - Mô hình Astra của OpenAI sắp ra mắt — và nó cực kỳ giỏi trong việc xâm nhập các hệ thống máy tính.
OpenAI vừa chia sẻ những thông tin chi tiết mới về mô hình Astra sắp ra mắt; công ty cho biết đây là mô hình ngôn ngữ lớn đầu tiên đáp ứng được "ngưỡng an ninh mạng quan trọng" mà họ đặt ra. "Chúng tôi dự định sớm phát hành Astra", bài đăng trên blog của OpenAI cho biết, "tuy nhiên, quyền truy cập vào các tính năng an ninh mạng tiên tiến nhất của mô hình này sẽ bị hạn chế hơn". Phòng thí nghiệm tiên phong này xác định rằng Astra có khả năng tự tìm ra các lỗ hổng bảo mật chưa được biết đến trong hệ thống máy tính và khai thác chúng mà không cần sự chỉ dẫn của con người. Điều này tương tự như những lo ngại mà Anthropic từng nêu ra đối với mô hình Mythos của họ hồi đầu năm nay; OpenAI cũng đang áp dụng các biện pháp phòng ngừa tương tự trong quá trình chuẩn bị triển khai Astra.

Nếu không có sự xác nhận từ bên thứ ba, rất khó để đánh giá tính xác thực trong các tuyên bố của OpenAI về độ an toàn hay mức độ sẵn sàng của mô hình. Công ty cho biết sẽ cho phép một nhóm người thử nghiệm trải nghiệm trước mô hình này, nhưng không tiết lộ danh tính hay quy trình lựa chọn họ. Hiện cũng chưa rõ liệu OpenAI có đang hợp tác với chính phủ Hoa Kỳ để đánh giá mô hình trước khi phát hành hay không.
OpenAI lưu ý rằng Astra đã đạt điểm tuyệt đối trong bài kiểm tra ExploitBench – một công cụ đánh giá khả năng tấn công vào các lỗ hổng hệ thống đã biết của mô hình ngôn ngữ lớn (LLM). Theo công ty, trong một phiên bản thử nghiệm đã được các kỹ sư của OpenAI tùy chỉnh, mô hình này đã phát hiện và khai thác thành công hai lỗ hổng bảo mật chưa từng được biết đến (lỗ hổng zero-day).
Để đảm bảo mô hình không bị kẻ xấu lợi dụng cũng như không tự thực hiện các hành vi sai trái, OpenAI cho biết họ đã bắt đầu cải tiến cơ chế kiểm soát nhằm phát hiện hành vi lạm dụng và ngăn chặn các nỗ lực "bẻ khóa" (jailbreak) mô hình. Tuy nhiên, đối với Astra, công ty đã đầu tư vào các kỹ thuật mới (không được tiết lộ cụ thể) nhằm tăng cường độ an toàn cho mô hình. OpenAI cũng bắt đầu xác định các "tài khoản bị đánh giá là có rủi ro cao" và hạn chế phản hồi của mô hình đối với các câu lệnh từ những tài khoản này, mặc dù họ không nêu rõ phương thức thực hiện. Cuối cùng, dù mô tả Astra là "mô hình tuân thủ các nguyên tắc an toàn tốt nhất từ trước đến nay", công ty vẫn sẽ triển khai mô hình kèm theo cơ chế giám sát quy trình tư duy (chain-of-thought) để kịp thời phát hiện và ngăn chặn các hành vi sai lệch...
Trích dẫn Tim Fernholz https://techcrunch.com/2026/09/01/open-ais-astra-model-is-on-the-way-and-very-good-at-breaking-into-computer-systems/