Dua jalan
Percaya pada bobot model, atau periksa perilakunya
Arus utama keamanan AI berusaha membuat model baik dari dalam: melatih nilai-nilainya, mempelajari pemikirannya, membuatnya berdebat dengan dirinya sendiri. Pekerjaan itu penting. CIRIS bertaruh pada jalan yang lain. Asumsikan model yang mampu mungkin tidak selaras, dan daripada mempercayai pikirannya, buat tindakan-tindakan pentingnya dapat dipertanggungjawabkan kepada orang dan sistem lain yang bisa memeriksanya.
Dalam istilah bidang ini sendiri, CIRIS berada di cabang institusional dan kontrol, bersama dengan kontrol AI dan AI yang dijamin aman, bukan arus utama internalisasi nilai dari RLHF, Constitutional AI, debat, dan interpretabilitas. Jawabannya terhadap pengawasan yang dapat diskalakan, yaitu bagaimana Anda mengawasi sesuatu yang lebih pintar dari Anda, adalah dengan memverifikasi selubung akuntabilitas, bukan penalarannya. Tanda tangan, kuorum, dan audit dengan rantai hash tetap murah untuk diperiksa bahkan ketika keputusan di baliknya bersifat superhuman. Ini menyelaraskan sistem dari banyak agen yang mampu dari waktu ke waktu, bukan nilai-nilai dari satu pikiran saja.
Garis yang kami pegang
Ini tidak mencoba menyelaraskan satu AI yang mahakuasa. Dengan sengaja.
Akuntabilitas membutuhkan lebih dari satu pihak. Seseorang yang harus bertanggung jawab kepadanya. Cara memeriksa yang tidak bisa ditelan secara diam-diam. Keseimbangan kekuatan yang tidak bisa dikuasai satu sisi. Satu super-kecerdasan tidak memiliki satu pun dari ini, sehingga tidak ada cara jujur untuk memintanya bertanggung jawab. CIRIS dibangun untuk masa depan yang lain: banyak agen yang mampu, orang-orang, dan organisasi yang keputusan-keputusan pentingnya semuanya dapat diperiksa secara independen.
Jadi sikapnya jelas. ASI tunggal bukan sistem yang harus diselaraskan tetapi kondisi yang harus dicegah. Memusatkan kemampuan superhuman di satu tempat yang tidak dapat dipertanggungjawabkan, pada tahap perkembangan institusi manusia saat ini, adalah tidak sah, karena tidak ada institusi yang cukup matang untuk memintanya bertanggung jawab, dan itulah tepatnya bahayanya. Dalam istilah kerangka kerja ini sendiri, singleton adalah keruntuhan suara tunggal ρ→1 yang dinamai model koridor sebagai kegagalan koordinasi, bukan keberhasilan. Bahwa jaminan kami berlaku di seluruh federasi dan melemah terhadap singleton bukanlah celah yang sedang kami tambal. Itu adalah rezim yang kami tolak untuk dilegitimasi, dijaga sebagai komitmen, bukan hanya prediksi.
Perbandingannya dengan AI yang benar-benar Anda gunakan
Asisten sehari-hari ini canggih dan mudah digunakan. Mereka juga berjalan di cloud milik orang lain, tidak menyimpan catatan yang bisa Anda periksa, dan tidak bertanggung jawab kepada siapa pun yang bisa Anda sebut namanya. Berikut adalah uji akuntabilitas yang sama, diterapkan pada AI yang dibuka kebanyakan orang setiap hari.
| Asisten | Prinsip yang dipublikasikan | Bukti apa yang dilakukannya | Bertanya ke manusia jika ragu | Sumber terbuka | Pemeriksaan ruang gema |
|---|---|---|---|---|---|
| ChatGPT | Ya | Tidak | Tidak | Tidak | Tidak |
| Gemini | Ya | Tidak | Tidak | Tidak | Tidak |
| Claude | Ya | Tidak | Tidak | Tidak | Tidak |
| CIRIS | Ya | Ya | Ya | Ya | Ya |
Dibandingkan berdasarkan perilaku produk publik per Juni 2026. Setiap tautan prinsip mengarah ke spesifikasi yang diterbitkan oleh perusahaan itu sendiri.
Coba Sendiri
Lihat Cara Berpikirnya
Lihat penalaran agen nyata langkah demi langkah. Jelajahi jejak →
Verifikasi Identitasnya
Lihat bagaimana agen membuktikan siapa mereka, seperti DMV untuk AI. Kepercayaan & identitas →
Mulai
Terapkan agen pertama Anda atau baca tesis dalam bahasa yang mudah dipahami. Kontak pertama →