تُرجمت هذه الصفحة آلياً. إذا بدا أي شيء غير صحيح، يرجى فتح تقرير، المستودع عام لهذا السبب. أبلغ عن مشكلة في الترجمة

العودة إلى الردهة

مشهد المحاذاة الفائقة

معظم المجال يعمل على محاذاة النموذج. CIRIS يبني المؤسسات من حوله.

هناك طريقتان صادقتان لجعل الذكاء الاصطناعي القوي آمنًا. الأولى هي تدريب قيم النموذج حتى تثق به. والثانية هي افتراض أن النموذج قد يكون مخطئًا، وجعل ما يفعله خاضعًا للمساءلة، في العلن، أمام أشخاص وأنظمة يمكن لأي شخص التحقق منها. CIRIS يسلك الطريق الثاني. ها هو المشهد كاملًا، مرسومًا بإنصاف، وموضعنا فيه.

01التوافق

الثقة بالأوزان، أم فحص السلوك

الخط الرئيسي في سلامة الذكاء الاصطناعي يحاول جعل النموذج جيدًا من الداخل: تدريب قيمه، ودراسة أفكاره، وجعله يناقش نفسه. هذا العمل مهم. CIRIS يراهن على الطريق الآخر. افترض أن نموذجًا قادرًا قد يكون غير محاذٍ، وبدلًا من الثقة بعقله، اجعل أفعاله المؤثرة خاضعة للمساءلة أمام أشخاص وأنظمة أخرى يمكنها التحقق منها.

بمصطلحات المجال نفسها، يقع CIRIS في الفرع المؤسسي وفرع التحكم، إلى جانب التحكم في الذكاء الاصطناعي والذكاء الاصطناعي المضمون الأمان (GS-AI)، لا في الخط الرئيسي لترسيخ القيم الذي يضم RLHF والذكاء الاصطناعي الدستوري والنقاش والتفسيرية. إجابته على مسألة الرقابة القابلة للتوسع، أي كيف تشرف على شيء أذكى منك، هي التحقق من غلاف المساءلة لا من التفكير ذاته. التوقيع والنصاب وسجل التدقيق المتسلسل يظل التحقق منها رخيصًا حتى حين يكون القرار خلفها فوق طاقة البشر. إنه ينسق أنظمة من وكلاء قادرين كثيرين عبر الزمن، لا قيم عقل واحد.

لا يحاول محاذاة ذكاء اصطناعي واحد كلي القدرة. وهذا مقصود.

المساءلة تحتاج إلى أكثر من طرف واحد. شخص تُحاسَب أمامه. طريقة للتحقق لا يمكن ابتلاعها بهدوء. توازن للقوى لا تستطيع أي جهة الاستيلاء عليه. ذكاء اصطناعي فائق واحد لا يملك أيًا من هذه الأشياء، لذا لا توجد طريقة صادقة لمحاسبته. CIRIS مبني للمستقبل الآخر: وكلاء كثيرون قادرون وأشخاص ومنظمات تخضع قراراتهم المؤثرة جميعها للتحقق المستقل.

لذا فإن الموقف صريح. ASI منفرد ليس نظامًا يجب محاذاته بل حالة يجب منعها. تركيز قدرة فوق بشرية في مكان واحد غير خاضع للمساءلة، في هذه المرحلة من تطور المؤسسات البشرية، أمر غير مشروع، لأن لا مؤسسات ناضجة بما يكفي لمحاسبته، وهذا هو الخطر بالضبط. بمصطلحات الإطار نفسه، المنفرد هو انهيار الصوت الواحد ρ→1 الذي يسميه نموذج الممر فشلًا في التنسيق، لا نجاحًا. أن ضماناتنا تصمد عبر اتحاد وتتآكل أمام منفرد ليس فجوة نرقعها. إنه النظام الذي نرفض إضفاء الشرعية عليه، محفوظًا كالتزام لا كتنبؤ فحسب.

02الذكاء الاصطناعي الاستهلاكي

كيف يقارن بالذكاء الاصطناعي الذي تستخدمه فعلاً

المساعدون اليوميون أقوياء وسهلون الاستخدام. لكنهم يعملون على خوادم شخص آخر، ولا يحتفظون بسجل يمكنك مراجعته، ولا يخضعون لأحد يمكنك تسميته. إليك نفس اختبار المساءلة، مطبقاً على الذكاء الاصطناعي الذي يفتحه معظم الناس كل يوم.

المساعدمبادئ منشورةدليل على ما فعلهيسأل إنساناً عند الشكمفتوح المصدرفحص غرفة الصدى
ChatGPTنعملالالالا
Geminiنعملالالالا
Claudeنعملالالالا
CIRISنعمنعمنعمنعمنعم

المقارنة مبنية على سلوك المنتج العام اعتباراً من يونيو 2026. كل رابط للمبادئ يؤدي إلى المواصفات المنشورة من الشركة نفسها.

جربه بنفسك

CIRISsafe by structure · open by principle · kind by design