Halaman ini diterjemahkan oleh mesin. Jika ada yang terasa tidak tepat, silakan buka laporan masalah — reponya publik untuk alasan yang baik. Laporkan masalah terjemahan

kembali ke lobi

Lanskap superalignment

Sebagian besar bidang ini berfokus pada penyelarasan model. CIRIS membangun institusi di sekitarnya.

Ada dua cara jujur untuk membuat AI yang kuat menjadi aman. Yang pertama adalah melatih nilai-nilai model sampai kita bisa mempercayainya. Yang kedua adalah mengasumsikan bahwa model bisa saja salah, dan membuat apa yang dilakukannya dapat dipertanggungjawabkan, secara terbuka, kepada orang-orang dan sistem yang bisa diperiksa siapa saja. CIRIS memilih jalan kedua. Berikut adalah seluruh lanskap, dipetakan secara adil, dan di mana kami berada di dalamnya.

01Keselarasan

Percaya pada bobot model, atau periksa perilakunya

Arus utama keamanan AI berusaha membuat model baik dari dalam: melatih nilai-nilainya, mempelajari pemikirannya, membuatnya berdebat dengan dirinya sendiri. Pekerjaan itu penting. CIRIS bertaruh pada jalan yang lain. Asumsikan model yang mampu mungkin tidak selaras, dan daripada mempercayai pikirannya, buat tindakan-tindakan pentingnya dapat dipertanggungjawabkan kepada orang dan sistem lain yang bisa memeriksanya.

Dalam istilah bidang ini sendiri, CIRIS berada di cabang institusional dan kontrol, bersama dengan kontrol AI dan AI yang dijamin aman, bukan arus utama internalisasi nilai dari RLHF, Constitutional AI, debat, dan interpretabilitas. Jawabannya terhadap pengawasan yang dapat diskalakan, yaitu bagaimana Anda mengawasi sesuatu yang lebih pintar dari Anda, adalah dengan memverifikasi selubung akuntabilitas, bukan penalarannya. Tanda tangan, kuorum, dan audit dengan rantai hash tetap murah untuk diperiksa bahkan ketika keputusan di baliknya bersifat superhuman. Ini menyelaraskan sistem dari banyak agen yang mampu dari waktu ke waktu, bukan nilai-nilai dari satu pikiran saja.

Ini tidak mencoba menyelaraskan satu AI yang mahakuasa. Dengan sengaja.

Akuntabilitas membutuhkan lebih dari satu pihak. Seseorang yang harus bertanggung jawab kepadanya. Cara memeriksa yang tidak bisa ditelan secara diam-diam. Keseimbangan kekuatan yang tidak bisa dikuasai satu sisi. Satu super-kecerdasan tidak memiliki satu pun dari ini, sehingga tidak ada cara jujur untuk memintanya bertanggung jawab. CIRIS dibangun untuk masa depan yang lain: banyak agen yang mampu, orang-orang, dan organisasi yang keputusan-keputusan pentingnya semuanya dapat diperiksa secara independen.

Jadi sikapnya jelas. ASI tunggal bukan sistem yang harus diselaraskan tetapi kondisi yang harus dicegah. Memusatkan kemampuan superhuman di satu tempat yang tidak dapat dipertanggungjawabkan, pada tahap perkembangan institusi manusia saat ini, adalah tidak sah, karena tidak ada institusi yang cukup matang untuk memintanya bertanggung jawab, dan itulah tepatnya bahayanya. Dalam istilah kerangka kerja ini sendiri, singleton adalah keruntuhan suara tunggal ρ→1 yang dinamai model koridor sebagai kegagalan koordinasi, bukan keberhasilan. Bahwa jaminan kami berlaku di seluruh federasi dan melemah terhadap singleton bukanlah celah yang sedang kami tambal. Itu adalah rezim yang kami tolak untuk dilegitimasi, dijaga sebagai komitmen, bukan hanya prediksi.

02AI Konsumen

Perbandingannya dengan AI yang benar-benar Anda gunakan

Asisten sehari-hari ini canggih dan mudah digunakan. Mereka juga berjalan di cloud milik orang lain, tidak menyimpan catatan yang bisa Anda periksa, dan tidak bertanggung jawab kepada siapa pun yang bisa Anda sebut namanya. Berikut adalah uji akuntabilitas yang sama, diterapkan pada AI yang dibuka kebanyakan orang setiap hari.

AsistenPrinsip yang dipublikasikanBukti apa yang dilakukannyaBertanya ke manusia jika raguSumber terbukaPemeriksaan ruang gema
ChatGPTYaTidakTidakTidakTidak
GeminiYaTidakTidakTidakTidak
ClaudeYaTidakTidakTidakTidak
CIRISYaYaYaYaYa

Dibandingkan berdasarkan perilaku produk publik per Juni 2026. Setiap tautan prinsip mengarah ke spesifikasi yang diterbitkan oleh perusahaan itu sendiri.

Coba Sendiri

CIRISsafe by structure · open by principle · kind by design