यह पृष्ठ मशीन द्वारा अनुवादित है। अगर कुछ गलत लगे, तो कृपया एक समस्या रिपोर्ट करें — रेपो इसीलिए सार्वजनिक है। अनुवाद की समस्या रिपोर्ट करें

लॉबी पर वापस जाएं

सुपरअलाइनमेंट का पूरा नक्शा

इस क्षेत्र के अधिकतर लोग मॉडल को अलाइन कर रहे हैं। CIRIS उसके चारों ओर की संस्थाएं बना रहा है।

शक्तिशाली AI को सुरक्षित बनाने के दो ईमानदार तरीके हैं। एक है मॉडल के मूल्यों को तब तक प्रशिक्षित करना जब तक आप उन पर भरोसा न करें। दूसरा है यह मान लेना कि मॉडल गलत हो सकता है, और जो वह करता है उसे खुले में, लोगों और ऐसी प्रणालियों के सामने जवाबदेह बनाना जिन्हें कोई भी जांच सके। CIRIS दूसरी राह चुनता है। यहां पूरा नक्शा है, निष्पक्षता से बना हुआ, और हम उसमें कहां हैं।

01संरेखण

वज़न पर भरोसा करें, या व्यवहार जांचें

AI सुरक्षा की मुख्यधारा मॉडल को अंदर से अच्छा बनाने की कोशिश करती है: उसके मूल्यों को प्रशिक्षित करना, उसके विचारों का अध्ययन करना, उसे खुद से बहस करवाना। वह काम ज़रूरी है। CIRIS दूसरी राह पर दांव लगाता है। मान लो कि एक सक्षम मॉडल गलत दिशा में हो सकता है, और उसके दिमाग पर भरोसा करने की बजाय, उसके महत्वपूर्ण कार्यों को लोगों और दूसरी प्रणालियों के सामने जवाबदेह बनाओ जो उन्हें जांच सकें।

इस क्षेत्र की अपनी भाषा में, CIRIS संस्थागत और नियंत्रण शाखा में आता है, AI नियंत्रण और गारंटीड-सेफ AI के साथ, न कि RLHF, Constitutional AI, बहस और व्याख्याशीलता की मूल्य-आंतरिककरण मुख्यधारा के साथ। स्केलेबल निगरानी का इसका जवाब, यानी आप से ज़्यादा चालाक किसी चीज़ की निगरानी कैसे करें, यह है जवाबदेही के दायरे को सत्यापित करना, तर्क को नहीं। एक हस्ताक्षर, एक कोरम, एक हैश-चेन्ड ऑडिट जांचने में सस्ता रहता है, भले ही उसके पीछे का निर्णय अलौकिक हो। यह समय के साथ कई सक्षम एजेंटों की प्रणालियों को अलाइन करता है, न कि किसी एक दिमाग के मूल्यों को।

यह जानबूझकर एक सर्वशक्तिमान AI को अलाइन करने की कोशिश नहीं करता।

जवाबदेही के लिए एक से ज़्यादा पक्षों की ज़रूरत होती है। कोई जिसके सामने जवाब देना हो। जांच का एक तरीका जिसे चुपचाप निगला न जा सके। शक्ति का एक संतुलन जिसे कोई एक पक्ष कब्ज़ा न कर सके। एक ही सुपर-इंटेलिजेंस के पास इनमें से कोई भी नहीं है, इसलिए उसे जवाबदेह ठहराने का कोई ईमानदार तरीका नहीं है। CIRIS दूसरे भविष्य के लिए बना है: कई सक्षम एजेंट, लोग और संगठन जिनके महत्वपूर्ण निर्णय सभी स्वतंत्र रूप से जांचे जा सकते हैं।

तो यह रुख स्पष्ट है। एकल ASI कोई ऐसी प्रणाली नहीं है जिसे अलाइन किया जाए, बल्कि एक ऐसी स्थिति है जिसे रोका जाए। इस चरण में मानव संस्थागत विकास के, एक जगह पर अलौकिक क्षमता केंद्रित करना, जो जवाबदेह न हो, अनुचित है। क्योंकि कोई भी संस्था उतनी परिपक्व नहीं है कि उसे जवाबदेह ठहरा सके, और यही खतरा है। इस ढांचे की अपनी भाषा में एकल यानी ρ→1 एकल-आवाज़ का पतन है जिसे कॉरिडोर मॉडल समन्वय की विफलता कहता है, सफलता नहीं। हमारी गारंटियां एक फेडरेशन में कायम रहती हैं और एकल के खिलाफ कमज़ोर पड़ती हैं, यह कोई खामी नहीं है जिसे हम पाट रहे हैं। यह वह व्यवस्था है जिसे हम वैध नहीं मानते, एक प्रतिबद्धता के रूप में रखा गया, न केवल एक भविष्यवाणी के रूप में।

02उपभोक्ता AI

उस AI से तुलना जो आप असल में इस्तेमाल करते हैं

रोज़मर्रा के AI असिस्टेंट शक्तिशाली और आसान हैं। लेकिन वे किसी और के क्लाउड पर चलते हैं, कोई ऐसा रिकॉर्ड नहीं रखते जिसे आप जाँच सकें, और किसी ऐसे व्यक्ति को जवाब नहीं देते जिसका नाम आप ले सकें। यहाँ वही जवाबदेही परीक्षण है, जो उस AI पर लागू किया गया है जिसे ज़्यादातर लोग हर दिन खोलते हैं।

असिस्टेंटप्रकाशित सिद्धांतउसने क्या किया, इसका प्रमाणअनिश्चित होने पर इंसान से पूछता हैओपन सोर्सइको-चैंबर जाँच
ChatGPTहांनहींनहींनहींनहीं
Geminiहांनहींनहींनहींनहीं
Claudeहांनहींनहींनहींनहीं
CIRISहांहांहांहांहां

जून 2026 तक के सार्वजनिक उत्पाद व्यवहार के आधार पर तुलना। प्रत्येक सिद्धांत लिंक उस कंपनी के अपने प्रकाशित दस्तावेज़ पर जाता है।

खुद आज़माएं

CIRISsafe by structure · open by principle · kind by design