दोन मार्ग
वजनांवर विश्वास ठेवा, किंवा वर्तन तपासा
AI सुरक्षिततेचा मुख्य प्रवाह मॉडेलला आतून चांगले बनवण्याचा प्रयत्न करतो: त्याची मूल्ये प्रशिक्षित करतो, त्याचे विचार अभ्यासतो, त्याला स्वतःशीच वाद घालायला लावतो. हे काम महत्त्वाचे आहे. CIRIS दुसऱ्या मार्गावर विश्वास ठेवते. असे गृहीत धरा की एखादे सक्षम मॉडेल चुकीच्या दिशेने जाऊ शकते, आणि त्याच्या मनावर विश्वास ठेवण्याऐवजी, त्याच्या महत्त्वाच्या कृती लोकांसमोर आणि तपासू शकणाऱ्या इतर प्रणालींसमोर जबाबदार ठेवा.
या क्षेत्राच्या स्वतःच्या संकल्पनांनुसार, CIRIS संस्थात्मक आणि नियंत्रण शाखेत बसते, AI नियंत्रण आणि guaranteed-safe AI सोबत, RLHF, Constitutional AI, वाद आणि व्याख्यायोग्यता यांच्या मूल्य-आंतरिकीकरण मुख्य प्रवाहात नाही. स्केलेबल देखरेखीसाठी, म्हणजे तुमच्यापेक्षा हुशार असलेल्या गोष्टींवर तुम्ही देखरेख कशी करता, याचे उत्तर म्हणजे जबाबदारीचे कवच तपासणे, तर्कशास्त्र नाही. एक स्वाक्षरी, एक कोरम, एक हॅश-साखळीत ऑडिट तपासण्यासाठी स्वस्त राहते, जरी त्यामागील निर्णय मानवापेक्षा श्रेष्ठ असला तरी. हे काळाच्या ओघात अनेक सक्षम एजंट्सच्या प्रणाली अलाइन करते, कोणत्याही एकट्या मनाची मूल्ये नव्हे.
आम्ही जी रेषा धरतो
हे एका सर्वशक्तिमान AI ला अलाइन करण्याचा प्रयत्न करत नाही. जाणीवपूर्वक.
जबाबदारीसाठी एकापेक्षा जास्त पक्षांची गरज असते. कोणाला उत्तर द्यायचे ते असणे. तपासण्याची एक पद्धत जी शांतपणे गिळली जाऊ शकत नाही. सत्तेचा समतोल जो कोणताही एक पक्ष ताब्यात घेऊ शकत नाही. एकट्या महाबुद्धिमत्तेकडे यापैकी काहीही नाही, त्यामुळे तिला जबाबदार धरण्याचा कोणताही प्रामाणिक मार्ग नाही. CIRIS दुसऱ्या भविष्यासाठी बनले आहे: अनेक सक्षम एजंट्स, लोक आणि संस्था ज्यांचे महत्त्वाचे निर्णय सर्व स्वतंत्रपणे तपासता येतात.
म्हणून ही भूमिका स्पष्ट आहे. एकटी ASI ही अलाइन करण्याची प्रणाली नाही तर रोखायची परिस्थिती आहे. या टप्प्यावर मानवी संस्थात्मक विकासाच्या दृष्टीने, एकाच अनुत्तरदायी ठिकाणी मानवापेक्षा श्रेष्ठ क्षमता एकवटणे अवैध आहे, कारण कोणतीही संस्था ती जबाबदार धरण्याइतकी परिपक्व नाही, हीच खरी धोक्याची गोष्ट आहे. या चौकटीच्या स्वतःच्या संकल्पनांनुसार, एकटी सत्ता म्हणजे ρ→1 एकल-आवाज कोसळणे जे corridor model समन्वय अपयश म्हणून नावे ठेवते, यश नाही. आमची हमी फेडरेशनमध्ये टिकते आणि एकट्या सत्तेविरुद्ध कमकुवत होते हे आम्ही बुजवत असलेले अंतर नाही. हे ते शासन आहे जे आम्ही वैध मानण्यास नकार देतो, फक्त एक भाकीत म्हणून नाही तर वचनबद्धता म्हणून.
तुम्ही रोज वापरत असलेल्या AI शी तुलना
रोजचे सहाय्यक शक्तिशाली आणि वापरण्यास सोपे आहेत. ते दुसऱ्याच्या क्लाउडवर चालतात, तुम्ही तपासू शकता असा कोणताही रेकॉर्ड ठेवत नाहीत, आणि तुम्ही नाव सांगू शकता अशा कोणाला उत्तर देत नाहीत. हीच जबाबदारीची चाचणी, जो AI बहुतेक लोक रोज उघडतात त्याला लागू केली आहे.
| सहाय्यक | प्रकाशित तत्त्वे | त्याने काय केले याचा पुरावा | अनिश्चित असताना माणसाला विचारतो | मुक्त स्रोत | एकोघरातील विचारांची तपासणी |
|---|---|---|---|---|---|
| ChatGPT | होय | नाही | नाही | नाही | नाही |
| Gemini | होय | नाही | नाही | नाही | नाही |
| Claude | होय | नाही | नाही | नाही | नाही |
| CIRIS | होय | होय | होय | होय | होय |
जून 2026 पर्यंतच्या सार्वजनिक उत्पादन वर्तनावर आधारित तुलना. प्रत्येक तत्त्वांची लिंक त्या कंपनीने स्वतः प्रकाशित केलेल्या तपशीलाकडे जाते.