Trang này được dịch bằng máy. Nếu có gì đó đọc không đúng, vui lòng mở một vấn đề — kho lưu trữ là công khai vì một lý do. Báo cáo lỗi dịch thuật

quay lại sảnh chờ

Bức tranh siêu căn chỉnh

Hầu hết lĩnh vực này đang căn chỉnh mô hình. CIRIS đang xây dựng các thể chế xung quanh nó.

Có hai cách trung thực để làm cho AI mạnh mẽ trở nên an toàn. Một là huấn luyện các giá trị của mô hình cho đến khi bạn tin tưởng chúng. Cách kia là giả định rằng mô hình có thể sai, và làm cho những gì nó thực hiện phải chịu trách nhiệm, một cách minh bạch, trước con người và các hệ thống mà bất kỳ ai cũng có thể kiểm tra. CIRIS chọn con đường thứ hai. Đây là toàn bộ bức tranh, được vẽ một cách công bằng, và vị trí của chúng tôi trong đó.

01Sự Cân Bằng

Tin tưởng các trọng số, hay kiểm tra hành vi

Dòng chính của an toàn AI cố gắng làm cho mô hình tốt từ bên trong: huấn luyện các giá trị của nó, nghiên cứu suy nghĩ của nó, để nó tự tranh luận với chính mình. Công việc đó quan trọng. CIRIS đặt cược vào con đường kia. Giả định rằng một mô hình có năng lực có thể bị lệch lạc, và thay vì tin tưởng vào tâm trí của nó, hãy làm cho các hành động quan trọng của nó phải chịu trách nhiệm trước con người và các hệ thống khác có thể kiểm tra chúng.

Theo thuật ngữ của lĩnh vực này, CIRIS thuộc nhánh thể chế và kiểm soát, cùng với kiểm soát AI và AI đảm bảo an toàn, chứ không phải dòng chính nội hóa giá trị của RLHF, Constitutional AI, tranh luận và khả năng diễn giải. Câu trả lời của nó cho giám sát có thể mở rộng, tức là cách bạn giám sát thứ gì đó thông minh hơn bạn, là xác minh phong bì trách nhiệm, không phải lý luận. Một chữ ký, một đại biểu số đông, một kiểm tra hash chuỗi vẫn rẻ để kiểm tra ngay cả khi quyết định đằng sau chúng là siêu nhân. Nó căn chỉnh các hệ thống gồm nhiều tác nhân có năng lực theo thời gian, không phải các giá trị của bất kỳ tâm trí đơn lẻ nào.

Nó không cố gắng căn chỉnh một AI toàn năng duy nhất. Đó là chủ đích.

Trách nhiệm cần nhiều hơn một bên. Cần có người để trả lời. Cần một cách kiểm tra không thể bị nuốt chửng lặng lẽ. Cần một sự cân bằng quyền lực mà không bên nào có thể nắm bắt. Một siêu trí tuệ duy nhất không có bất kỳ điều nào trong số này, vì vậy không có cách trung thực nào để buộc nó phải chịu trách nhiệm. CIRIS được xây dựng cho tương lai kia: nhiều tác nhân có năng lực, con người và tổ chức mà các quyết định quan trọng của họ đều có thể được kiểm tra độc lập.

Vì vậy lập trường này là rõ ràng. Một ASI độc nhất không phải là hệ thống cần được căn chỉnh mà là điều kiện cần được ngăn chặn. Tập trung năng lực siêu nhân vào một nơi không chịu trách nhiệm, ở giai đoạn phát triển thể chế con người hiện nay, là không hợp pháp, vì không có thể chế nào đủ trưởng thành để buộc nó phải chịu trách nhiệm, và đó chính xác là mối nguy hiểm. Theo thuật ngữ của khung này, một thực thể độc nhất là sự sụp đổ tiếng nói đơn ρ→1 mà mô hình hành lang gọi là thất bại phối hợp, không phải thành công. Việc các đảm bảo của chúng tôi duy trì trong một liên đoàn và suy yếu trước một thực thể độc nhất không phải là khoảng trống chúng tôi đang vá lại. Đó là chế độ chúng tôi từ chối hợp pháp hóa, được giữ như một cam kết, không chỉ là một dự đoán.

02AI Tiêu Dùng

So sánh với AI bạn thực sự dùng

Các trợ lý hàng ngày rất mạnh mẽ và dễ sử dụng. Chúng cũng chạy trên đám mây của người khác, không lưu lại bất kỳ hồ sơ nào bạn có thể kiểm tra, và không chịu trách nhiệm trước bất kỳ ai bạn có thể nêu tên. Đây là bài kiểm tra trách nhiệm giải trình tương tự, áp dụng cho AI mà hầu hết mọi người mở ra mỗi ngày.

Trợ LýNguyên tắc đã công bốBằng chứng về việc nó đã làmHỏi người khi không chắcMã nguồn mởKiểm tra buồng vọng
ChatGPTKhôngKhôngKhôngKhông
GeminiKhôngKhôngKhôngKhông
ClaudeKhôngKhôngKhôngKhông
CIRIS

So sánh dựa trên hành vi sản phẩm công khai tính đến tháng 6 năm 2026. Mỗi liên kết nguyên tắc dẫn đến thông số kỹ thuật đã công bố của chính công ty đó.

Tự Mình Thử

CIRISsafe by structure · open by principle · kind by design