CIRIS
हे पृष्ठ मशीनने भाषांतरित केले आहे. काही चुकीचे वाटल्यास, कृपया GitHub वर issue उघडा. रेपो सार्वजनिक आहे जेणेकरून कोणीही ते दुरुस्त करण्यास मदत करू शकेल. भाषांतर समस्या नोंदवा

मुखपृष्ठावर परत

सुपरअलाइनमेंट क्षेत्राचा आढावा

या क्षेत्रातील बहुतेक लोक मॉडेल अलाइन करत आहेत. CIRIS त्याभोवती संस्था उभ्या करत आहे.

शक्तिशाली AI सुरक्षित करण्याचे दोन प्रामाणिक मार्ग आहेत. एक म्हणजे मॉडेलच्या मूल्यांवर विश्वास ठेवेपर्यंत त्यांना प्रशिक्षित करणे. दुसरा म्हणजे मॉडेल चुकीचे असू शकते असे गृहीत धरणे, आणि ते काय करते ते लोकांसमोर आणि कोणीही तपासू शकेल अशा प्रणालींसमोर जबाबदार ठेवणे. CIRIS दुसरा मार्ग निवडते. येथे संपूर्ण क्षेत्राचा नकाशा प्रामाणिकपणे मांडला आहे, आणि आम्ही त्यात कुठे बसतो ते सांगितले आहे.

01संरेखण

वजनांवर विश्वास ठेवा, किंवा वर्तन तपासा

AI सुरक्षिततेचा मुख्य प्रवाह मॉडेलला आतून चांगले बनवण्याचा प्रयत्न करतो: त्याची मूल्ये प्रशिक्षित करतो, त्याचे विचार अभ्यासतो, त्याला स्वतःशीच वाद घालायला लावतो. हे काम महत्त्वाचे आहे. CIRIS दुसऱ्या मार्गावर विश्वास ठेवते. असे गृहीत धरा की एखादे सक्षम मॉडेल चुकीच्या दिशेने जाऊ शकते, आणि त्याच्या मनावर विश्वास ठेवण्याऐवजी, त्याच्या महत्त्वाच्या कृती लोकांसमोर आणि तपासू शकणाऱ्या इतर प्रणालींसमोर जबाबदार ठेवा.

या क्षेत्राच्या स्वतःच्या संकल्पनांनुसार, CIRIS संस्थात्मक आणि नियंत्रण शाखेत बसते, AI नियंत्रण आणि guaranteed-safe AI सोबत, RLHF, Constitutional AI, वाद आणि व्याख्यायोग्यता यांच्या मूल्य-आंतरिकीकरण मुख्य प्रवाहात नाही. स्केलेबल देखरेखीसाठी, म्हणजे तुमच्यापेक्षा हुशार असलेल्या गोष्टींवर तुम्ही देखरेख कशी करता, याचे उत्तर म्हणजे जबाबदारीचे कवच तपासणे, तर्कशास्त्र नाही. एक स्वाक्षरी, एक कोरम, एक हॅश-साखळीत ऑडिट तपासण्यासाठी स्वस्त राहते, जरी त्यामागील निर्णय मानवापेक्षा श्रेष्ठ असला तरी. हे काळाच्या ओघात अनेक सक्षम एजंट्सच्या प्रणाली अलाइन करते, कोणत्याही एकट्या मनाची मूल्ये नव्हे.

हे एका सर्वशक्तिमान AI ला अलाइन करण्याचा प्रयत्न करत नाही. जाणीवपूर्वक.

जबाबदारीसाठी एकापेक्षा जास्त पक्षांची गरज असते. कोणाला उत्तर द्यायचे ते असणे. तपासण्याची एक पद्धत जी शांतपणे गिळली जाऊ शकत नाही. सत्तेचा समतोल जो कोणताही एक पक्ष ताब्यात घेऊ शकत नाही. एकट्या महाबुद्धिमत्तेकडे यापैकी काहीही नाही, त्यामुळे तिला जबाबदार धरण्याचा कोणताही प्रामाणिक मार्ग नाही. CIRIS दुसऱ्या भविष्यासाठी बनले आहे: अनेक सक्षम एजंट्स, लोक आणि संस्था ज्यांचे महत्त्वाचे निर्णय सर्व स्वतंत्रपणे तपासता येतात.

म्हणून ही भूमिका स्पष्ट आहे. एकटी ASI ही अलाइन करण्याची प्रणाली नाही तर रोखायची परिस्थिती आहे. या टप्प्यावर मानवी संस्थात्मक विकासाच्या दृष्टीने, एकाच अनुत्तरदायी ठिकाणी मानवापेक्षा श्रेष्ठ क्षमता एकवटणे अवैध आहे, कारण कोणतीही संस्था ती जबाबदार धरण्याइतकी परिपक्व नाही, हीच खरी धोक्याची गोष्ट आहे. या चौकटीच्या स्वतःच्या संकल्पनांनुसार, एकटी सत्ता म्हणजे ρ→1 एकल-आवाज कोसळणे जे corridor model समन्वय अपयश म्हणून नावे ठेवते, यश नाही. आमची हमी फेडरेशनमध्ये टिकते आणि एकट्या सत्तेविरुद्ध कमकुवत होते हे आम्ही बुजवत असलेले अंतर नाही. हे ते शासन आहे जे आम्ही वैध मानण्यास नकार देतो, फक्त एक भाकीत म्हणून नाही तर वचनबद्धता म्हणून.

02ग्राहक AI

तुम्ही रोज वापरत असलेल्या AI शी तुलना

रोजचे सहाय्यक शक्तिशाली आणि वापरण्यास सोपे आहेत. ते दुसऱ्याच्या क्लाउडवर चालतात, तुम्ही तपासू शकता असा कोणताही रेकॉर्ड ठेवत नाहीत, आणि तुम्ही नाव सांगू शकता अशा कोणाला उत्तर देत नाहीत. हीच जबाबदारीची चाचणी, जो AI बहुतेक लोक रोज उघडतात त्याला लागू केली आहे.

सहाय्यकप्रकाशित तत्त्वेत्याने काय केले याचा पुरावाअनिश्चित असताना माणसाला विचारतोमुक्त स्रोतइको-चेंबर तपासणी
ChatGPTहोयनाहीनाहीनाहीनाही
Geminiहोयनाहीनाहीनाहीनाही
Claudeहोयनाहीनाहीनाहीनाही
CIRISहोयहोयहोयहोयहोय

जून 2026 पर्यंतच्या सार्वजनिक उत्पादन वर्तनावर आधारित तुलना. प्रत्येक तत्त्वांची लिंक त्या कंपनीने स्वतः प्रकाशित केलेल्या तपशीलाकडे जाते.

स्वतः वापरून पाहा