हे पृष्ठ मशीनने भाषांतरित केले आहे. काही चुकीचे वाटत असल्यास, कृपया एक समस्या उघडा - रेपो सार्वजनिक आहे कारणास्तव. भाषांतर समस्या नोंदवा

लॉबीकडे परत

सुपरअलाइनमेंट क्षेत्राचा आढावा

या क्षेत्रातील बहुतेक लोक मॉडेल अलाइन करत आहेत. CIRIS त्याभोवती संस्था उभ्या करत आहे.

शक्तिशाली AI सुरक्षित करण्याचे दोन प्रामाणिक मार्ग आहेत. एक म्हणजे मॉडेलच्या मूल्यांवर विश्वास ठेवेपर्यंत त्यांना प्रशिक्षित करणे. दुसरा म्हणजे मॉडेल चुकीचे असू शकते असे गृहीत धरणे, आणि ते काय करते ते लोकांसमोर आणि कोणीही तपासू शकेल अशा प्रणालींसमोर जबाबदार ठेवणे. CIRIS दुसरा मार्ग निवडते. येथे संपूर्ण क्षेत्राचा नकाशा प्रामाणिकपणे मांडला आहे, आणि आम्ही त्यात कुठे बसतो ते सांगितले आहे.

01संरेखण

वजनांवर विश्वास ठेवा, किंवा वर्तन तपासा

AI सुरक्षिततेचा मुख्य प्रवाह मॉडेलला आतून चांगले बनवण्याचा प्रयत्न करतो: त्याची मूल्ये प्रशिक्षित करतो, त्याचे विचार अभ्यासतो, त्याला स्वतःशीच वाद घालायला लावतो. हे काम महत्त्वाचे आहे. CIRIS दुसऱ्या मार्गावर विश्वास ठेवते. असे गृहीत धरा की एखादे सक्षम मॉडेल चुकीच्या दिशेने जाऊ शकते, आणि त्याच्या मनावर विश्वास ठेवण्याऐवजी, त्याच्या महत्त्वाच्या कृती लोकांसमोर आणि तपासू शकणाऱ्या इतर प्रणालींसमोर जबाबदार ठेवा.

या क्षेत्राच्या स्वतःच्या संकल्पनांनुसार, CIRIS संस्थात्मक आणि नियंत्रण शाखेत बसते, AI नियंत्रण आणि guaranteed-safe AI सोबत, RLHF, Constitutional AI, वाद आणि व्याख्यायोग्यता यांच्या मूल्य-आंतरिकीकरण मुख्य प्रवाहात नाही. स्केलेबल देखरेखीसाठी, म्हणजे तुमच्यापेक्षा हुशार असलेल्या गोष्टींवर तुम्ही देखरेख कशी करता, याचे उत्तर म्हणजे जबाबदारीचे कवच तपासणे, तर्कशास्त्र नाही. एक स्वाक्षरी, एक कोरम, एक हॅश-साखळीत ऑडिट तपासण्यासाठी स्वस्त राहते, जरी त्यामागील निर्णय मानवापेक्षा श्रेष्ठ असला तरी. हे काळाच्या ओघात अनेक सक्षम एजंट्सच्या प्रणाली अलाइन करते, कोणत्याही एकट्या मनाची मूल्ये नव्हे.

हे एका सर्वशक्तिमान AI ला अलाइन करण्याचा प्रयत्न करत नाही. जाणीवपूर्वक.

जबाबदारीसाठी एकापेक्षा जास्त पक्षांची गरज असते. कोणाला उत्तर द्यायचे ते असणे. तपासण्याची एक पद्धत जी शांतपणे गिळली जाऊ शकत नाही. सत्तेचा समतोल जो कोणताही एक पक्ष ताब्यात घेऊ शकत नाही. एकट्या महाबुद्धिमत्तेकडे यापैकी काहीही नाही, त्यामुळे तिला जबाबदार धरण्याचा कोणताही प्रामाणिक मार्ग नाही. CIRIS दुसऱ्या भविष्यासाठी बनले आहे: अनेक सक्षम एजंट्स, लोक आणि संस्था ज्यांचे महत्त्वाचे निर्णय सर्व स्वतंत्रपणे तपासता येतात.

म्हणून ही भूमिका स्पष्ट आहे. एकटी ASI ही अलाइन करण्याची प्रणाली नाही तर रोखायची परिस्थिती आहे. या टप्प्यावर मानवी संस्थात्मक विकासाच्या दृष्टीने, एकाच अनुत्तरदायी ठिकाणी मानवापेक्षा श्रेष्ठ क्षमता एकवटणे अवैध आहे, कारण कोणतीही संस्था ती जबाबदार धरण्याइतकी परिपक्व नाही, हीच खरी धोक्याची गोष्ट आहे. या चौकटीच्या स्वतःच्या संकल्पनांनुसार, एकटी सत्ता म्हणजे ρ→1 एकल-आवाज कोसळणे जे corridor model समन्वय अपयश म्हणून नावे ठेवते, यश नाही. आमची हमी फेडरेशनमध्ये टिकते आणि एकट्या सत्तेविरुद्ध कमकुवत होते हे आम्ही बुजवत असलेले अंतर नाही. हे ते शासन आहे जे आम्ही वैध मानण्यास नकार देतो, फक्त एक भाकीत म्हणून नाही तर वचनबद्धता म्हणून.

02ग्राहक AI

तुम्ही रोज वापरत असलेल्या AI शी तुलना

रोजचे सहाय्यक शक्तिशाली आणि वापरण्यास सोपे आहेत. ते दुसऱ्याच्या क्लाउडवर चालतात, तुम्ही तपासू शकता असा कोणताही रेकॉर्ड ठेवत नाहीत, आणि तुम्ही नाव सांगू शकता अशा कोणाला उत्तर देत नाहीत. हीच जबाबदारीची चाचणी, जो AI बहुतेक लोक रोज उघडतात त्याला लागू केली आहे.

सहाय्यकप्रकाशित तत्त्वेत्याने काय केले याचा पुरावाअनिश्चित असताना माणसाला विचारतोमुक्त स्रोतएकोघरातील विचारांची तपासणी
ChatGPTहोयनाहीनाहीनाहीनाही
Geminiहोयनाहीनाहीनाहीनाही
Claudeहोयनाहीनाहीनाहीनाही
CIRISहोयहोयहोयहोयहोय

जून 2026 पर्यंतच्या सार्वजनिक उत्पादन वर्तनावर आधारित तुलना. प्रत्येक तत्त्वांची लिंक त्या कंपनीने स्वतः प्रकाशित केलेल्या तपशीलाकडे जाते.

स्वतः वापरून पाहा

CIRISsafe by structure · open by principle · kind by design