این صفحه توسط ماشین ترجمه شده است. اگر چیزی نادرست به نظر می‌رسد، لطفاً یک مشکل گزارش دهید — مخزن به دلیلی عمومی است. گزارش مشکل ترجمه

بازگشت به لابی

چشم‌انداز فراهم‌سازی همسویی

بیشتر این حوزه روی همسوسازی مدل متمرکز است. CIRIS نهادهای پیرامون آن را می‌سازد.

دو راه صادقانه برای ایمن کردن هوش مصنوعی قدرتمند وجود دارد. یکی این است که ارزش‌های مدل را آنقدر آموزش دهید تا به آن اعتماد کنید. دیگری این است که فرض کنید مدل ممکن است اشتباه کند، و کارهایی که انجام می‌دهد را پاسخگو، شفاف، و قابل بررسی توسط مردم و سامانه‌هایی کنید که همه می‌توانند آن‌ها را بررسی کنند. CIRIS راه دوم را انتخاب می‌کند. اینجا کل این چشم‌انداز، با امانت‌داری ترسیم شده، و جایگاه ما در آن مشخص است.

01همسویی

اعتماد به وزن‌ها، یا بررسی رفتار

جریان اصلی ایمنی هوش مصنوعی تلاش می‌کند مدل را از درون خوب کند: ارزش‌هایش را آموزش دهد، افکارش را بررسی کند، و بگذارد با خودش مناظره کند. این کار اهمیت دارد. CIRIS روی راه دیگر شرط می‌بندد. فرض کنید یک مدل توانمند ممکن است ناهمسو باشد، و به جای اعتماد به ذهن آن، اقدامات مهمش را در برابر مردم و سامانه‌های دیگری که می‌توانند آن را بررسی کنند، پاسخگو کنید.

در اصطلاح خود این حوزه، CIRIS در شاخه نهادی و کنترلی قرار دارد، در کنار کنترل هوش مصنوعی و هوش مصنوعی با تضمین ایمنی، نه در جریان اصلی درونی‌سازی ارزش‌ها مانند RLHF، هوش مصنوعی مبتنی بر قانون اساسی، مناظره، و تفسیرپذیری. پاسخ CIRIS به نظارت مقیاس‌پذیر، یعنی چگونه چیزی را نظارت کنید که از شما باهوش‌تر است، تأیید پوشش پاسخگویی است، نه استدلال. یک امضا، یک نصاب، یک ممیزی با زنجیره هش، حتی وقتی تصمیم پشت آن‌ها فوق بشری است، همچنان ارزان و قابل بررسی می‌مانند. این رویکرد سامانه‌های متشکل از عوامل توانمند را در طول زمان همسو می‌کند، نه ارزش‌های یک ذهن واحد را.

این رویکرد تلاش نمی‌کند یک هوش مصنوعی تمام‌قدرت را همسو کند. این عمدی است.

پاسخگویی به بیش از یک طرف نیاز دارد. کسی که باید پاسخگو باشد. روشی برای بررسی که نتوان آن را بی‌سروصدا بلعید. توازن قدرتی که هیچ طرفی نتواند آن را در دست بگیرد. یک فوق‌هوش واحد هیچ‌کدام از این‌ها را ندارد، پس هیچ راه صادقانه‌ای برای پاسخگو نگه داشتن آن وجود ندارد. CIRIS برای آینده دیگری ساخته شده است: عوامل توانمند بسیار، مردم، و سازمان‌هایی که تصمیمات مهمشان همه به صورت مستقل قابل بررسی هستند.

پس این موضع صریح است. یک ASI تکین نه سامانه‌ای است که باید همسو شود، بلکه وضعیتی است که باید از آن جلوگیری شود. تمرکز توانایی فوق بشری در یک جای واحد و غیرپاسخگو، در این مرحله از توسعه نهادی بشر، نامشروع است، زیرا هیچ نهادی به اندازه کافی بالغ نیست که آن را پاسخگو نگه دارد، و این دقیقاً همان خطر است. در اصطلاح خود این چارچوب، یک تکین همان فروپاشی تک‌صدایی ρ→1 است که مدل کریدور آن را شکست هماهنگی می‌نامد، نه موفقیت. اینکه تضمین‌های ما در یک فدراسیون پابرجا بمانند و در برابر یک تکین تضعیف شوند، شکافی نیست که داریم وصله می‌زنیم. این رژیمی است که از مشروع دانستن آن سر باز می‌زنیم، به عنوان یک تعهد نگه داشته می‌شود، نه فقط یک پیش‌بینی.

02هوش مصنوعی مصرفی

مقایسه با هوش مصنوعی که واقعاً استفاده می‌کنید

دستیارهای روزمره قدرتمند و آسان هستند. اما در فضای ابری شخص دیگری اجرا می‌شوند، هیچ سابقه‌ای که بتوانید بررسی کنید ندارند، و پاسخگوی کسی که بشناسید نیستند. این همان آزمون پاسخگویی است، برای هوش مصنوعی که بیشتر مردم هر روز باز می‌کنند.

دستیاراصول منتشرشدهمدرک آنچه انجام دادهدر موارد شک از انسان می‌پرسدمتن‌بازبررسی اتاق پژواک
ChatGPTبلهخیرخیرخیرخیر
Geminiبلهخیرخیرخیرخیر
Claudeبلهخیرخیرخیرخیر
CIRISبلهبلهبلهبلهبله

مقایسه بر اساس رفتار عمومی محصول تا ژوئن ۲۰۲۶. هر پیوند اصول به مشخصات منتشرشده خود آن شرکت می‌رود.

خودتان امتحان کنید

CIRISsafe by structure · open by principle · kind by design