دو راہیں
وزن پر بھروسہ کریں، یا رویے کو جانچیں
AI سیفٹی کا مرکزی دھارا ماڈل کو اندر سے اچھا بنانے کی کوشش کرتا ہے: اس کی اقدار کو تربیت دیں، اس کے خیالات کا مطالعہ کریں، اسے خود سے بحث کرائیں۔ یہ کام اہم ہے۔ CIRIS دوسری راہ پر یقین رکھتا ہے۔ فرض کریں ایک قابل ماڈل غلط طریقے سے الائن ہو سکتا ہے، اور اس کے ذہن پر بھروسہ کرنے کی بجائے، اس کے اہم اقدامات کو لوگوں اور دوسرے نظاموں کے سامنے جوابدہ بنائیں جو انہیں جانچ سکیں۔
اس شعبے کی اپنی اصطلاحات میں، CIRIS ادارتی اور کنٹرول شاخ میں ہے، AI کنٹرول اور guaranteed-safe AI کے ساتھ، نہ کہ RLHF، Constitutional AI، بحث اور تفسیر کے اقدار-داخلی مرکزی دھارے میں۔ توسیع پذیر نگرانی کا اس کا جواب، یعنی آپ سے زیادہ ذہین کسی چیز کی نگرانی کیسے کریں، جوابدہی کے لفافے کی تصدیق کرنا ہے، نہ کہ استدلال کی۔ ایک دستخط، ایک کورم، ایک ہیش چین آڈٹ جانچنے میں سستا رہتا ہے چاہے ان کے پیچھے کا فیصلہ غیر انسانی ہو۔ یہ وقت کے ساتھ بہت سے قابل ایجنٹوں کے نظاموں کو الائن کرتا ہے، کسی ایک ذہن کی اقدار کو نہیں۔
وہ خط جسے ہم تھامے ہیں
یہ جان بوجھ کر ایک سب پر حاوی AI کو الائن کرنے کی کوشش نہیں کرتا۔
جوابدہی کے لیے ایک سے زیادہ فریق چاہیے۔ کوئی جس کو جواب دیا جائے۔ جانچنے کا ایک طریقہ جسے خاموشی سے نگل نہ لیا جا سکے۔ طاقت کا توازن جسے کوئی ایک فریق قابض نہ کر سکے۔ ایک واحد سپر انٹیلی جنس میں یہ سب نہیں ہے، اس لیے اسے جوابدہ ٹھہرانے کا کوئی ایمانداری والا طریقہ نہیں۔ CIRIS دوسرے مستقبل کے لیے بنا ہے: بہت سے قابل ایجنٹ، لوگ، اور تنظیمیں جن کے تمام اہم فیصلے آزادانہ طور پر قابل جانچ ہیں۔
اس لیے موقف واضح ہے۔ ایک واحد ASI الائن کیے جانے والا نظام نہیں بلکہ روکی جانے والی صورتحال ہے۔ انسانی ادارتی ترقی کے اس مرحلے پر، ایک جگہ غیر جوابدہ طریقے سے غیر انسانی صلاحیت کو مرکوز کرنا ناجائز ہے، کیونکہ کوئی بھی ادارہ اتنا پختہ نہیں جو اسے جوابدہ ٹھہرا سکے، اور یہی خطرہ ہے۔ فریم ورک کی اپنی اصطلاحات میں، ایک singleton وہ ρ→1 single-voice collapse ہے جسے corridor model ہم آہنگی کی ناکامی کا نام دیتا ہے، کامیابی کا نہیں۔ یہ کہ ہماری ضمانتیں ایک federation میں قائم رہتی ہیں اور singleton کے خلاف کمزور پڑ جاتی ہیں، یہ کوئی خامی نہیں جسے ہم پاٹ رہے ہوں۔ یہ وہ نظام ہے جسے ہم جائز ماننے سے انکار کرتے ہیں، ایک عزم کے طور پر، نہ صرف ایک پیشگوئی۔
آپ کے روزمرہ AI سے موازنہ
روزمرہ کے معاون طاقتور اور آسان ہیں۔ وہ کسی اور کے کلاؤڈ پر چلتے ہیں، کوئی ریکارڈ نہیں رکھتے جسے آپ جانچ سکیں، اور کسی ایسے کو جواب نہیں دیتے جسے آپ جانتے ہوں۔ یہاں وہی جوابدہی کا معیار ہے جو اس AI پر لاگو کیا گیا جسے زیادہ تر لوگ ہر روز کھولتے ہیں۔
| معاون | شائع شدہ اصول | کیے گئے کام کا ثبوت | غیر یقینی صورت میں انسان سے پوچھتا ہے | اوپن سورس | بازگشت چیمبر کی جانچ |
|---|---|---|---|---|---|
| ChatGPT | ہاں | نہیں | نہیں | نہیں | نہیں |
| Gemini | ہاں | نہیں | نہیں | نہیں | نہیں |
| Claude | ہاں | نہیں | نہیں | نہیں | نہیں |
| CIRIS | ہاں | ہاں | ہاں | ہاں | ہاں |
جون 2026 تک عوامی مصنوع کے رویے پر موازنہ کیا گیا۔ ہر اصولوں کا لنک اس کمپنی کی اپنی شائع کردہ تفصیل پر جاتا ہے۔