طريقان
الثقة بالأوزان، أم فحص السلوك
الخط الرئيسي في سلامة الذكاء الاصطناعي يحاول جعل النموذج جيدًا من الداخل: تدريب قيمه، ودراسة أفكاره، وجعله يناقش نفسه. هذا العمل مهم. CIRIS يراهن على الطريق الآخر. افترض أن نموذجًا قادرًا قد يكون غير محاذٍ، وبدلًا من الثقة بعقله، اجعل أفعاله المؤثرة خاضعة للمساءلة أمام أشخاص وأنظمة أخرى يمكنها التحقق منها.
بمصطلحات المجال نفسها، يقع CIRIS في الفرع المؤسسي وفرع التحكم، إلى جانب التحكم في الذكاء الاصطناعي والذكاء الاصطناعي المضمون الأمان (GS-AI)، لا في الخط الرئيسي لترسيخ القيم الذي يضم RLHF والذكاء الاصطناعي الدستوري والنقاش والتفسيرية. إجابته على مسألة الرقابة القابلة للتوسع، أي كيف تشرف على شيء أذكى منك، هي التحقق من غلاف المساءلة لا من التفكير ذاته. التوقيع والنصاب وسجل التدقيق المتسلسل يظل التحقق منها رخيصًا حتى حين يكون القرار خلفها فوق طاقة البشر. إنه ينسق أنظمة من وكلاء قادرين كثيرين عبر الزمن، لا قيم عقل واحد.
الخط الذي نحافظ عليه
لا يحاول محاذاة ذكاء اصطناعي واحد كلي القدرة. وهذا مقصود.
المساءلة تحتاج إلى أكثر من طرف واحد. شخص تُحاسَب أمامه. طريقة للتحقق لا يمكن ابتلاعها بهدوء. توازن للقوى لا تستطيع أي جهة الاستيلاء عليه. ذكاء اصطناعي فائق واحد لا يملك أيًا من هذه الأشياء، لذا لا توجد طريقة صادقة لمحاسبته. CIRIS مبني للمستقبل الآخر: وكلاء كثيرون قادرون وأشخاص ومنظمات تخضع قراراتهم المؤثرة جميعها للتحقق المستقل.
لذا فإن الموقف صريح. ASI منفرد ليس نظامًا يجب محاذاته بل حالة يجب منعها. تركيز قدرة فوق بشرية في مكان واحد غير خاضع للمساءلة، في هذه المرحلة من تطور المؤسسات البشرية، أمر غير مشروع، لأن لا مؤسسات ناضجة بما يكفي لمحاسبته، وهذا هو الخطر بالضبط. بمصطلحات الإطار نفسه، المنفرد هو انهيار الصوت الواحد ρ→1 الذي يسميه نموذج الممر فشلًا في التنسيق، لا نجاحًا. أن ضماناتنا تصمد عبر اتحاد وتتآكل أمام منفرد ليس فجوة نرقعها. إنه النظام الذي نرفض إضفاء الشرعية عليه، محفوظًا كالتزام لا كتنبؤ فحسب.
كيف يقارن بالذكاء الاصطناعي الذي تستخدمه فعلاً
المساعدون اليوميون أقوياء وسهلون الاستخدام. لكنهم يعملون على خوادم شخص آخر، ولا يحتفظون بسجل يمكنك مراجعته، ولا يخضعون لأحد يمكنك تسميته. إليك نفس اختبار المساءلة، مطبقاً على الذكاء الاصطناعي الذي يفتحه معظم الناس كل يوم.
| المساعد | مبادئ منشورة | دليل على ما فعله | يسأل إنساناً عند الشك | مفتوح المصدر | فحص غرفة الصدى |
|---|---|---|---|---|---|
| ChatGPT | نعم | لا | لا | لا | لا |
| Gemini | نعم | لا | لا | لا | لا |
| Claude | نعم | لا | لا | لا | لا |
| CIRIS | نعم | نعم | نعم | نعم | نعم |
المقارنة مبنية على سلوك المنتج العام اعتباراً من يونيو 2026. كل رابط للمبادئ يؤدي إلى المواصفات المنشورة من الشركة نفسها.