Bu sayfa makine tarafından çevrilmiştir. Bir şeyler yanlış geliyorsa lütfen bir sorun bildirin; depo zaten herkese açık. Çeviri sorunu bildirin

lobiye dön

Süper hizalama manzarası

Alanın büyük çoğunluğu modeli hizalamaya çalışıyor. CIRIS ise onun etrafındaki kurumları inşa ediyor.

Güçlü yapay zekayı güvenli kılmanın iki dürüst yolu var. Birincisi, modelin değerlerini güvenilir olana kadar eğitmek. İkincisi, modelin yanılıyor olabileceğini kabul edip yaptıklarını herkesin denetleyebileceği kişilere ve sistemlere karşı açık ve hesap verebilir kılmak. CIRIS ikinci yolu seçiyor. İşte tüm manzara, dürüstçe haritalanmış ve bizim nerede durduğumuz.

01Uyum

Ağırlıklara güven ya da davranışı denetle

Yapay zeka güvenliğinin ana akımı, modeli içten iyi yapmaya çalışıyor: değerlerini eğitiyor, düşüncelerini inceliyor, kendisiyle tartışmasını sağlıyor. Bu çalışma önemli. CIRIS ise diğer yola inanıyor. Yetenekli bir modelin yanlış hizalanmış olabileceğini varsay ve zihnine güvenmek yerine, önemli eylemlerini bunları denetleyebilecek kişilere ve sistemlere karşı hesap verebilir kıl.

Alanın kendi terimleriyle, CIRIS; RLHF, Anayasal Yapay Zeka, tartışma ve yorumlanabilirlik gibi değer içselleştirme ana akımının değil, kurumsal ve kontrol dalının içinde yer alıyor. Yapay zeka kontrolü ve garantili güvenli yapay zekayla aynı safta duruyor. Ölçeklenebilir gözetim sorusuna, yani senden daha akıllı bir şeyi nasıl denetlersin sorusuna verdiği yanıt, akıl yürütmeyi değil hesap verebilirlik zarfını doğrulamak. Bir imza, bir çekirdek, zincirlenmiş bir denetim kaydı, arkasındaki karar insanüstü bile olsa ucuza doğrulanabilir kalır. Tek bir zihnin değerlerini değil, zamanla birçok yetenekli etkenin oluşturduğu sistemleri hizalar.

Tek, her şeye gücü yeten bir yapay zekayı hizalamaya çalışmıyor. Bilerek.

Hesap verebilirlik birden fazla taraf gerektirir. Yanıt verilecek biri. Sessizce yutulmayan bir denetim yolu. Hiçbir tarafın ele geçiremeyeceği bir güç dengesi. Tek bir süper zekada bunların hiçbiri yok, dolayısıyla onu hesap verebilir kılmanın dürüst bir yolu da yok. CIRIS başka bir gelecek için inşa edildi: önemli kararların tamamı bağımsız olarak doğrulanabilen, pek çok yetenekli etken, insan ve kuruluşun oluşturduğu bir dünya.

Bu nedenle tutum açık. Tekil bir ASI, hizalanacak bir sistem değil, önlenecek bir koşuldur. İnsani kurumsal gelişimin bu aşamasında, insanüstü yeteneği hesap veremez tek bir yerde yoğunlaştırmak meşru değildir. Çünkü hiçbir kurum onu hesap verebilir kılacak olgunluğa erişmemiştir; tehlike tam da budur. Çerçevenin kendi terimleriyle, tekil, koridor modelinin koordinasyon başarısı değil başarısızlık olarak tanımladığı ρ→1 tek ses çöküşüdür. Güvencelerimizin bir federasyon genelinde geçerli olup tekil karşısında aşınıyor olması bir açık değil, yamalanacak bir boşluk değil. Bu, meşrulaştırmayı reddettiğimiz rejimdir ve bu bir tahmin değil, bir taahhüttür.

02Tüketici Yapay Zekası

Gerçekten kullandığın yapay zeka ile karşılaştırma

Günlük asistanlar güçlü ve kullanımı kolaydır. Aynı zamanda başkasının bulutunda çalışırlar, kontrol edebileceğin bir kayıt tutmazlar ve adını söyleyebileceğin birine hesap vermezler. İşte aynı hesap verebilirlik testi, çoğu insanın her gün açtığı yapay zekaya uygulandı.

AsistanYayımlanmış ilkelerNe yaptığının kanıtıEmin olmadığında bir insana sorarAçık kaynakYankı odası kontrolü
ChatGPTEvetHayırHayırHayırHayır
GeminiEvetHayırHayırHayırHayır
ClaudeEvetHayırHayırHayırHayır
CIRISEvetEvetEvetEvetEvet

Haziran 2026 itibarıyla kamuya açık ürün davranışına göre karşılaştırıldı. Her ilkeler bağlantısı, o şirketin kendi yayımladığı belgeye gider.

Kendiniz Deneyin

CIRISsafe by structure · open by principle · kind by design