İki yol
Ağırlıklara güven ya da davranışı denetle
Yapay zeka güvenliğinin ana akımı, modeli içten iyi yapmaya çalışıyor: değerlerini eğitiyor, düşüncelerini inceliyor, kendisiyle tartışmasını sağlıyor. Bu çalışma önemli. CIRIS ise diğer yola inanıyor. Yetenekli bir modelin yanlış hizalanmış olabileceğini varsay ve zihnine güvenmek yerine, önemli eylemlerini bunları denetleyebilecek kişilere ve sistemlere karşı hesap verebilir kıl.
Alanın kendi terimleriyle, CIRIS; RLHF, Anayasal Yapay Zeka, tartışma ve yorumlanabilirlik gibi değer içselleştirme ana akımının değil, kurumsal ve kontrol dalının içinde yer alıyor. Yapay zeka kontrolü ve garantili güvenli yapay zekayla aynı safta duruyor. Ölçeklenebilir gözetim sorusuna, yani senden daha akıllı bir şeyi nasıl denetlersin sorusuna verdiği yanıt, akıl yürütmeyi değil hesap verebilirlik zarfını doğrulamak. Bir imza, bir çekirdek, zincirlenmiş bir denetim kaydı, arkasındaki karar insanüstü bile olsa ucuza doğrulanabilir kalır. Tek bir zihnin değerlerini değil, zamanla birçok yetenekli etkenin oluşturduğu sistemleri hizalar.
Tuttuğumuz çizgi
Tek, her şeye gücü yeten bir yapay zekayı hizalamaya çalışmıyor. Bilerek.
Hesap verebilirlik birden fazla taraf gerektirir. Yanıt verilecek biri. Sessizce yutulmayan bir denetim yolu. Hiçbir tarafın ele geçiremeyeceği bir güç dengesi. Tek bir süper zekada bunların hiçbiri yok, dolayısıyla onu hesap verebilir kılmanın dürüst bir yolu da yok. CIRIS başka bir gelecek için inşa edildi: önemli kararların tamamı bağımsız olarak doğrulanabilen, pek çok yetenekli etken, insan ve kuruluşun oluşturduğu bir dünya.
Bu nedenle tutum açık. Tekil bir ASI, hizalanacak bir sistem değil, önlenecek bir koşuldur. İnsani kurumsal gelişimin bu aşamasında, insanüstü yeteneği hesap veremez tek bir yerde yoğunlaştırmak meşru değildir. Çünkü hiçbir kurum onu hesap verebilir kılacak olgunluğa erişmemiştir; tehlike tam da budur. Çerçevenin kendi terimleriyle, tekil, koridor modelinin koordinasyon başarısı değil başarısızlık olarak tanımladığı ρ→1 tek ses çöküşüdür. Güvencelerimizin bir federasyon genelinde geçerli olup tekil karşısında aşınıyor olması bir açık değil, yamalanacak bir boşluk değil. Bu, meşrulaştırmayı reddettiğimiz rejimdir ve bu bir tahmin değil, bir taahhüttür.
Gerçekten kullandığın yapay zeka ile karşılaştırma
Günlük asistanlar güçlü ve kullanımı kolaydır. Aynı zamanda başkasının bulutunda çalışırlar, kontrol edebileceğin bir kayıt tutmazlar ve adını söyleyebileceğin birine hesap vermezler. İşte aynı hesap verebilirlik testi, çoğu insanın her gün açtığı yapay zekaya uygulandı.
| Asistan | Yayımlanmış ilkeler | Ne yaptığının kanıtı | Emin olmadığında bir insana sorar | Açık kaynak | Yankı odası kontrolü |
|---|---|---|---|---|---|
| ChatGPT | Evet | Hayır | Hayır | Hayır | Hayır |
| Gemini | Evet | Hayır | Hayır | Hayır | Hayır |
| Claude | Evet | Hayır | Hayır | Hayır | Hayır |
| CIRIS | Evet | Evet | Evet | Evet | Evet |
Haziran 2026 itibarıyla kamuya açık ürün davranışına göre karşılaştırıldı. Her ilkeler bağlantısı, o şirketin kendi yayımladığı belgeye gider.