İki yol
Ağırlıklara güven ya da davranışı denetle
Yapay zeka güvenliğinin ana akımı, modeli içten iyi yapmaya çalışıyor: değerlerini eğitiyor, düşüncelerini inceliyor, kendisiyle tartışmasını sağlıyor. Bu çalışma önemli. CIRIS ise diğer yola inanıyor. Yetenekli bir modelin yanlış hizalanmış olabileceğini varsay ve zihnine güvenmek yerine, önemli eylemlerini bunları denetleyebilecek kişilere ve sistemlere karşı hesap verebilir kıl.
Alanın kendi terimleriyle CIRIS; RLHF, Constitutional AI, tartışma ve yorumlanabilirlik gibi değer içselleştirme ana akımının değil, kurumsal ve kontrol dalının içinde, yapay zeka kontrolü ve garantili güvenli yapay zeka ile yan yana yer alır. Ölçeklenebilir gözetim sorusuna (sizden daha akıllı bir şeyi nasıl denetlersiniz sorusuna) verdiği yanıt, akıl yürütmeyi değil hesap verebilirlik zarfını doğrulamaktır. Bir imza, bir yeter sayı, karma zincirli bir denetim kaydı, arkasındaki karar insanüstü olsa bile ucuza denetlenebilir kalır. Tek bir zihnin değerlerini değil, zaman içinde birçok yetenekli ajandan oluşan sistemleri hizalar.
Tuttuğumuz çizgi
Tek, her şeye gücü yeten bir yapay zekayı hizalamaya çalışmıyor. Bilerek.
Hesap verebilirlik birden fazla taraf gerektirir. Yanıt verilecek biri. Sessizce yutulmayan bir denetim yolu. Hiçbir tarafın ele geçiremeyeceği bir güç dengesi. Tek bir süper zekada bunların hiçbiri yok, dolayısıyla onu hesap verebilir kılmanın dürüst bir yolu da yok. CIRIS başka bir gelecek için inşa edildi: önemli kararların tamamı bağımsız olarak doğrulanabilen, pek çok yetenekli etken, insan ve kuruluşun oluşturduğu bir dünya.
Bu nedenle tutum açık. Tekil bir ASI, hizalanacak bir sistem değil, önlenecek bir koşuldur. İnsani kurumsal gelişimin bu aşamasında, insanüstü yeteneği hesap veremez tek bir yerde yoğunlaştırmak meşru değildir. Çünkü hiçbir kurum onu hesap verebilir kılacak olgunluğa erişmemiştir; tehlike tam da budur. Çerçevenin kendi terimleriyle tekil bir yapı, koridor modelinin bir koordinasyon başarısı değil başarısızlığı olarak tanımladığı ρ→1 tek ses çöküşüdür. Güvencelerimizin bir federasyon genelinde geçerli olup tekil karşısında aşınıyor olması bir açık, yamalanacak bir boşluk değildir. Bu, meşrulaştırmayı reddettiğimiz rejimdir ve yalnızca bir tahmin değil, bir taahhüttür.
Gerçekten kullandığınız yapay zeka ile karşılaştırma
Günlük asistanlar güçlü ve kullanımı kolaydır. Aynı zamanda başkasının bulutunda çalışırlar, kontrol edebileceğiniz bir kayıt tutmazlar ve adını söyleyebileceğiniz birine hesap vermezler. İşte aynı hesap verebilirlik testi, çoğu insanın her gün açtığı yapay zekaya uygulandı.
| Asistan | Yayımlanmış ilkeler | Ne yaptığının kanıtı | Emin olmadığında bir insana sorar | Açık kaynak | Yankı odası kontrolü |
|---|---|---|---|---|---|
| ChatGPT | Evet | Hayır | Hayır | Hayır | Hayır |
| Gemini | Evet | Hayır | Hayır | Hayır | Hayır |
| Claude | Evet | Hayır | Hayır | Hayır | Hayır |
| CIRIS | Evet | Evet | Evet | Evet | Evet |
Haziran 2026 itibarıyla kamuya açık ürün davranışına göre karşılaştırıldı. Her ilkeler bağlantısı, o şirketin kendi yayımladığı belgeye gider.