Hai con đường
Tin tưởng các trọng số, hay kiểm tra hành vi
Dòng chính của an toàn AI cố gắng làm cho mô hình tốt từ bên trong: huấn luyện các giá trị của nó, nghiên cứu suy nghĩ của nó, để nó tự tranh luận với chính mình. Công việc đó quan trọng. CIRIS đặt cược vào con đường kia. Giả định rằng một mô hình có năng lực có thể bị lệch lạc, và thay vì tin tưởng vào tâm trí của nó, hãy làm cho các hành động quan trọng của nó phải chịu trách nhiệm trước con người và các hệ thống khác có thể kiểm tra chúng.
Theo thuật ngữ của lĩnh vực này, CIRIS thuộc nhánh thể chế và kiểm soát, cùng với kiểm soát AI và AI đảm bảo an toàn, chứ không phải dòng chính nội hóa giá trị của RLHF, Constitutional AI, tranh luận và khả năng diễn giải. Câu trả lời của nó cho giám sát có thể mở rộng, tức là cách bạn giám sát thứ gì đó thông minh hơn bạn, là xác minh phong bì trách nhiệm, không phải lý luận. Một chữ ký, một đại biểu số đông, một kiểm tra hash chuỗi vẫn rẻ để kiểm tra ngay cả khi quyết định đằng sau chúng là siêu nhân. Nó căn chỉnh các hệ thống gồm nhiều tác nhân có năng lực theo thời gian, không phải các giá trị của bất kỳ tâm trí đơn lẻ nào.
Ranh giới chúng tôi giữ
Nó không cố gắng căn chỉnh một AI toàn năng duy nhất. Đó là chủ đích.
Trách nhiệm cần nhiều hơn một bên. Cần có người để trả lời. Cần một cách kiểm tra không thể bị nuốt chửng lặng lẽ. Cần một sự cân bằng quyền lực mà không bên nào có thể nắm bắt. Một siêu trí tuệ duy nhất không có bất kỳ điều nào trong số này, vì vậy không có cách trung thực nào để buộc nó phải chịu trách nhiệm. CIRIS được xây dựng cho tương lai kia: nhiều tác nhân có năng lực, con người và tổ chức mà các quyết định quan trọng của họ đều có thể được kiểm tra độc lập.
Vì vậy lập trường này là rõ ràng. Một ASI độc nhất không phải là hệ thống cần được căn chỉnh mà là điều kiện cần được ngăn chặn. Tập trung năng lực siêu nhân vào một nơi không chịu trách nhiệm, ở giai đoạn phát triển thể chế con người hiện nay, là không hợp pháp, vì không có thể chế nào đủ trưởng thành để buộc nó phải chịu trách nhiệm, và đó chính xác là mối nguy hiểm. Theo thuật ngữ của khung này, một thực thể độc nhất là sự sụp đổ tiếng nói đơn ρ→1 mà mô hình hành lang gọi là thất bại phối hợp, không phải thành công. Việc các đảm bảo của chúng tôi duy trì trong một liên đoàn và suy yếu trước một thực thể độc nhất không phải là khoảng trống chúng tôi đang vá lại. Đó là chế độ chúng tôi từ chối hợp pháp hóa, được giữ như một cam kết, không chỉ là một dự đoán.
So sánh với AI bạn thực sự dùng
Các trợ lý hàng ngày rất mạnh mẽ và dễ sử dụng. Chúng cũng chạy trên đám mây của người khác, không lưu lại bất kỳ hồ sơ nào bạn có thể kiểm tra, và không chịu trách nhiệm trước bất kỳ ai bạn có thể nêu tên. Đây là bài kiểm tra trách nhiệm giải trình tương tự, áp dụng cho AI mà hầu hết mọi người mở ra mỗi ngày.
| Trợ Lý | Nguyên tắc đã công bố | Bằng chứng về việc nó đã làm | Hỏi người khi không chắc | Mã nguồn mở | Kiểm tra buồng vọng |
|---|---|---|---|---|---|
| ChatGPT | Có | Không | Không | Không | Không |
| Gemini | Có | Không | Không | Không | Không |
| Claude | Có | Không | Không | Không | Không |
| CIRIS | Có | Có | Có | Có | Có |
So sánh dựa trên hành vi sản phẩm công khai tính đến tháng 6 năm 2026. Mỗi liên kết nguyên tắc dẫn đến thông số kỹ thuật đã công bố của chính công ty đó.
Tự Mình Thử
Xem Nó Suy Nghĩ
Xem quá trình suy luận của một tác nhân thực từng bước một. Khám phá một dấu vết →
Xác Minh Danh Tính Của Nó
Xem cách các tác nhân chứng minh họ là ai, như một cơ quan cấp phép cho AI. Tin cậy và danh tính →
Bắt Đầu
Triển khai tác nhân đầu tiên của bạn hoặc đọc luận văn bằng ngôn ngữ đơn giản. Liên hệ đầu tiên →