دو راه
اعتماد به وزنها، یا بررسی رفتار
جریان اصلی ایمنی هوش مصنوعی تلاش میکند مدل را از درون خوب کند: ارزشهایش را آموزش دهد، افکارش را بررسی کند، و بگذارد با خودش مناظره کند. این کار اهمیت دارد. CIRIS روی راه دیگر شرط میبندد. فرض کنید یک مدل توانمند ممکن است ناهمسو باشد، و به جای اعتماد به ذهن آن، اقدامات مهمش را در برابر مردم و سامانههای دیگری که میتوانند آن را بررسی کنند، پاسخگو کنید.
در اصطلاح خود این حوزه، CIRIS در شاخه نهادی و کنترلی قرار دارد، در کنار کنترل هوش مصنوعی و هوش مصنوعی با تضمین ایمنی، نه در جریان اصلی درونیسازی ارزشها مانند RLHF، هوش مصنوعی مبتنی بر قانون اساسی، مناظره، و تفسیرپذیری. پاسخ CIRIS به نظارت مقیاسپذیر، یعنی چگونه چیزی را نظارت کنید که از شما باهوشتر است، تأیید پوشش پاسخگویی است، نه استدلال. یک امضا، یک نصاب، یک ممیزی با زنجیره هش، حتی وقتی تصمیم پشت آنها فوق بشری است، همچنان ارزان و قابل بررسی میمانند. این رویکرد سامانههای متشکل از عوامل توانمند را در طول زمان همسو میکند، نه ارزشهای یک ذهن واحد را.
خطی که حفظ میکنیم
این رویکرد تلاش نمیکند یک هوش مصنوعی تمامقدرت را همسو کند. این عمدی است.
پاسخگویی به بیش از یک طرف نیاز دارد. کسی که باید پاسخگو باشد. روشی برای بررسی که نتوان آن را بیسروصدا بلعید. توازن قدرتی که هیچ طرفی نتواند آن را در دست بگیرد. یک فوقهوش واحد هیچکدام از اینها را ندارد، پس هیچ راه صادقانهای برای پاسخگو نگه داشتن آن وجود ندارد. CIRIS برای آینده دیگری ساخته شده است: عوامل توانمند بسیار، مردم، و سازمانهایی که تصمیمات مهمشان همه به صورت مستقل قابل بررسی هستند.
پس این موضع صریح است. یک ASI تکین نه سامانهای است که باید همسو شود، بلکه وضعیتی است که باید از آن جلوگیری شود. تمرکز توانایی فوق بشری در یک جای واحد و غیرپاسخگو، در این مرحله از توسعه نهادی بشر، نامشروع است، زیرا هیچ نهادی به اندازه کافی بالغ نیست که آن را پاسخگو نگه دارد، و این دقیقاً همان خطر است. در اصطلاح خود این چارچوب، یک تکین همان فروپاشی تکصدایی ρ→1 است که مدل کریدور آن را شکست هماهنگی مینامد، نه موفقیت. اینکه تضمینهای ما در یک فدراسیون پابرجا بمانند و در برابر یک تکین تضعیف شوند، شکافی نیست که داریم وصله میزنیم. این رژیمی است که از مشروع دانستن آن سر باز میزنیم، به عنوان یک تعهد نگه داشته میشود، نه فقط یک پیشبینی.
مقایسه با هوش مصنوعی که واقعاً استفاده میکنید
دستیارهای روزمره قدرتمند و آسان هستند. اما در فضای ابری شخص دیگری اجرا میشوند، هیچ سابقهای که بتوانید بررسی کنید ندارند، و پاسخگوی کسی که بشناسید نیستند. این همان آزمون پاسخگویی است، برای هوش مصنوعی که بیشتر مردم هر روز باز میکنند.
| دستیار | اصول منتشرشده | مدرک آنچه انجام داده | در موارد شک از انسان میپرسد | متنباز | بررسی اتاق پژواک |
|---|---|---|---|---|---|
| ChatGPT | بله | خیر | خیر | خیر | خیر |
| Gemini | بله | خیر | خیر | خیر | خیر |
| Claude | بله | خیر | خیر | خیر | خیر |
| CIRIS | بله | بله | بله | بله | بله |
مقایسه بر اساس رفتار عمومی محصول تا ژوئن ۲۰۲۶. هر پیوند اصول به مشخصات منتشرشده خود آن شرکت میرود.