CIRIS
Цю сторінку перекладено машинним способом. Якщо щось здається неправильним, будь ласка, відкрийте звернення на GitHub. Репозиторій є публічним, тож будь-хто може допомогти це виправити. Повідомити про проблему з перекладом

назад на головну сторінку

Ландшафт суперузгодження

Більшість галузі узгоджує модель. CIRIS будує інститути навколо неї.

Є два чесних способи зробити потужний ШІ безпечним. Перший: тренувати цінності моделі, поки їм можна довіряти. Другий: припустити, що модель може помилятися, і зробити її дії підзвітними, відкрито, перед людьми та системами, які будь-хто може перевірити. CIRIS обирає другий шлях. Ось увесь ландшафт, відображений чесно, і де ми в ньому знаходимося.

01Узгодженість

Довіряти вагам або перевіряти поведінку

Головний напрям безпеки ШІ намагається зробити модель хорошою зсередини: тренувати її цінності, вивчати її думки, змушувати її сперечатися з собою. Ця робота важлива. CIRIS робить ставку на інший шлях. Припускаємо, що здатна модель може бути неузгодженою, і замість того, щоб довіряти її розуму, робимо її значущі дії підзвітними перед людьми та іншими системами, які можуть їх перевірити.

У власних термінах галузі CIRIS знаходиться в інституційній гілці та гілці контролю, поруч із контролем ШІ та гарантовано безпечним ШІ, а не в основному напрямі інтерналізації цінностей RLHF, конституційного ШІ, дебатів та інтерпретованості. Його відповідь на масштабований нагляд, як наглядати за чимось розумнішим за вас, полягає в перевірці конверту підзвітності, а не міркувань. Підпис, кворум, аудит із ланцюговими хешами залишаються дешевими для перевірки, навіть коли рішення за ними надлюдське. Це узгоджує системи з багатьох здатних агентів з часом, а не цінності будь-якого одного розуму.

Він не намагається узгодити один всемогутній ШІ. Навмисно.

Підзвітність потребує більше ніж однієї сторони. Когось, перед ким відповідати. Спосіб перевірки, який не можна тихо поглинути. Баланс сили, який жодна зі сторін не може захопити. Єдиний суперінтелект не має нічого з цього, тому немає чесного способу тримати його підзвітним. CIRIS побудований для іншого майбутнього: багато здатних агентів, людей та організацій, чиї значущі рішення всі незалежно перевіряються.

Тому позиція є явною. Одиничний ASI — це не система для узгодження, а умова для запобігання. Концентрація надлюдських можливостей в одному непідзвітному місці, на цьому етапі розвитку людських інститутів, є нелегітимною, бо жодні інститути не достатньо зрілі, щоб тримати її підзвітною, і саме це є небезпекою. У власних термінах фреймворку одиничність — це колапс єдиного голосу ρ→1, який модель коридору називає провалом координації, а не успіхом. Те, що наші гарантії діють у Федерації та послаблюються у випадку одиничності, — це не прогалина, яку ми латаємо. Це режим, який ми відмовляємося легітимізувати, утримуваний як зобов'язання, а не лише передбачення.

02Споживчий ШІ

Як це порівнюється з ШІ, яким ви користуєтеся

Щоденні асистенти потужні та прості у використанні. Вони також працюють у чужій хмарі, не зберігають записів, які ви можете перевірити, і не відповідають нікому, кого ви можете назвати. Ось той самий тест на підзвітність, застосований до ШІ, який більшість людей відкривають щодня.

АсистентОпубліковані принципиДоказ зробленогоЗапитує людину, коли не впевненийВідкритий кодПеревірка ехо-камери
ChatGPTТакНіНіНіНі
GeminiТакНіНіНіНі
ClaudeТакНіНіНіНі
CIRISТакТакТакТакТак

Порівняння за публічною поведінкою продукту станом на червень 2026 року. Кожне посилання на принципи веде до власної опублікованої специфікації тієї компанії.

Спробуйте самі