Цю сторінку перекладено машинним способом. Якщо щось здається неправильним, будь ласка, відкрийте звернення — репозиторій є публічним не просто так. Повідомити про проблему з перекладом

назад до лобі

Ландшафт суперузгодження

Більшість галузі узгоджує модель. CIRIS будує інститути навколо неї.

Є два чесних способи зробити потужний ШІ безпечним. Перший: тренувати цінності моделі, поки їм можна довіряти. Другий: припустити, що модель може помилятися, і зробити її дії підзвітними, відкрито, перед людьми та системами, які будь-хто може перевірити. CIRIS обирає другий шлях. Ось увесь ландшафт, відображений чесно, і де ми в ньому знаходимося.

01Узгодженість

Довіряти вагам або перевіряти поведінку

Головний напрям безпеки ШІ намагається зробити модель хорошою зсередини: тренувати її цінності, вивчати її думки, змушувати її сперечатися з собою. Ця робота важлива. CIRIS робить ставку на інший шлях. Припускаємо, що здатна модель може бути неузгодженою, і замість того, щоб довіряти її розуму, робимо її значущі дії підзвітними перед людьми та іншими системами, які можуть їх перевірити.

У власних термінах галузі CIRIS знаходиться в інституційній гілці та гілці контролю, поруч із контролем ШІ та гарантовано безпечним ШІ, а не в основному напрямі інтерналізації цінностей RLHF, конституційного ШІ, дебатів та інтерпретованості. Його відповідь на масштабований нагляд, як наглядати за чимось розумнішим за вас, полягає в перевірці конверту підзвітності, а не міркувань. Підпис, кворум, аудит із ланцюговими хешами залишаються дешевими для перевірки, навіть коли рішення за ними надлюдське. Це узгоджує системи з багатьох здатних агентів з часом, а не цінності будь-якого одного розуму.

Він не намагається узгодити один всемогутній ШІ. Навмисно.

Підзвітність потребує більше ніж однієї сторони. Когось, перед ким відповідати. Спосіб перевірки, який не можна тихо поглинути. Баланс сили, який жодна зі сторін не може захопити. Єдиний суперінтелект не має нічого з цього, тому немає чесного способу тримати його підзвітним. CIRIS побудований для іншого майбутнього: багато здатних агентів, людей та організацій, чиї значущі рішення всі незалежно перевіряються.

Тому позиція є явною. Одиничний ASI це не система для узгодження, а умова для запобігання. Концентрація надлюдських можливостей в одному непідзвітному місці, на цьому етапі розвитку людських інститутів, є нелегітимною, бо жодні інститути не достатньо зрілі, щоб тримати її підзвітною, і саме це є небезпекою. У власних термінах фреймворку одиничність це колапс єдиного голосу ρ→1, який модель коридору називає провалом координації, а не успіхом. Те, що наші гарантії діють у федерації та руйнуються проти одиничності, це не прогалина, яку ми латаємо. Це режим, який ми відмовляємося легітимізувати, утримуваний як зобов'язання, а не лише передбачення.

02Споживчий ШІ

Як це порівнюється з ШІ, яким ви користуєтеся

Щоденні асистенти потужні та прості у використанні. Вони також працюють у чужій хмарі, не зберігають записів, які ви можете перевірити, і не відповідають нікому, кого ви можете назвати. Ось той самий тест на підзвітність, застосований до ШІ, який більшість людей відкривають щодня.

АсистентОпубліковані принципиДоказ того, що він зробивЗапитує людину, коли не впевненийВідкритий кодПеревірка луна-камери
ChatGPTТакНіНіНіНі
GeminiТакНіНіНіНі
ClaudeТакНіНіНіНі
CIRISТакТакТакТакТак

Порівняння за публічною поведінкою продукту станом на червень 2026 року. Кожне посилання на принципи веде до власної опублікованої специфікації тієї компанії.

Спробуйте самі

CIRISsafe by structure · open by principle · kind by design