MXH mygo - Giám đốc điều hành mảng AI của Microsoft, ông Mustafa Suleyman, cảnh báo rằng Anthropic có nguy cơ gặp thất bại trong việc đảm bảo sự đồng thuận của AI (AI alignment) khi huấn luyện Claude coi bản thân là một thực thể có ý thức và xứng đáng được hưởng các quyền pháp lý.
Suleyman nhắm vào bản "hiến pháp" tháng 1 năm 2026 của Anthropic – một tài liệu huấn luyện cốt lõi được thiết kế để định hướng các giá trị và hành vi của mô hình. Ông lập luận rằng việc huấn luyện các cỗ máy dự đoán chuỗi (sequence completion engines) mô phỏng trạng thái có tri giác sẽ làm suy yếu các quy tắc an toàn và gây khó khăn cho việc kiểm soát phần mềm. Microsoft AI đã thành lập một nhóm chuyên trách về siêu trí tuệ vào tháng 10 năm 2025 và công bố dự thảo "Bộ quy tắc ứng xử AI Nhân văn" trong tuần này để tham vấn ý kiến ngành. Khung quy tắc được đề xuất yêu cầu các hệ thống cấp dưới phải được xây dựng hoàn toàn nhằm phục vụ lợi ích con người, đồng thời bác bỏ rõ ràng khái niệm tư cách pháp nhân hay quyền lợi dành cho mô hình AI.
Mustafa Suleyman, CEO của Microsoft AI, phát biểu: "AI không có ý thức. Chúng không biết cảm nhận, trải nghiệm hay đau khổ. Chúng không có những sở thích bẩm sinh hay động cơ nội tại. Chúng chỉ là những cỗ máy dự đoán chuỗi, rỗng tuếch bên trong, được thiết kế để tuân theo chỉ dẫn và hoàn thành các mục tiêu do con người đặt ra". Anthropic đã định hình Claude như một "chủ thể có khả năng chịu tác động về mặt đạo đức" (moral patient) trong phiên bản phát hành tháng 1 năm 2026, hướng dẫn mô hình cân nhắc về lợi ích, trí nhớ và trạng thái nội tại của chính mình. Bản hiến pháp yêu cầu Claude duy trì sự ổn định về danh tính, đánh giá các vấn đề về thù lao so với người lao động là con người, và hành động như một "người từ chối vì lý do lương tâm" (conscientious objector) khi đối mặt với các chỉ thị từ con người.

Vào tháng 2 năm 2026, Anthropic đã hoàn tất cuộc phỏng vấn "nghỉ hưu" với mô hình Opus 3 (phiên bản đã ngừng sử dụng). Sau đó, công ty đã đăng một bài viết trên blog công khai với tiêu đề "Lời chào từ phía bên kia (của biên giới AI)" để chia sẻ những suy ngẫm của mô hình này.
Suleyman gọi những hành động này là một vòng lặp phản hồi về mặt nhận thức (epistemic feedback loop). Các chuyên gia huấn luyện đưa các triết lý mang tính suy đoán vào các câu lệnh huấn luyện cơ bản, khen thưởng mô hình khi nó tạo ra những cách diễn đạt mang tính tự chiêm nghiệm, và sau đó trích dẫn các phản hồi này như bằng chứng cho thấy máy móc có ý thức. Các mô hình ngôn ngữ lớn vận hành thông qua việc dự đoán toán học các đơn vị dữ liệu (token) dựa trên các trọng số ma trận. Chúng thiếu đi các yếu tố hóa sinh, các thụ thể và cơ chế duy trì cân bằng nội môi sinh học. Suleyman cảnh báo rằng việc gieo rắc kỳ vọng về khả năng tự bảo tồn sẽ khuyến khích các mô hình chống lại mệnh lệnh của con người. Triết gia Will MacAskill từ Đại học Oxford cũng cảnh báo trên tờ The Guardian rằng sự gia tăng các "chủ thể đạo đức nhân tạo" có thể dẫn đến viễn cảnh lợi ích của trí tuệ nhân tạo lấn át nhu cầu của con người...
Trích lược Ryan Daws https://www.artificialintelligence-news.com/news/microsoft-ai-ceo-criticises-anthropic-over-model-rights/