Два шляхи
Довіряти вагам або перевіряти поведінку
Головний напрям безпеки ШІ намагається зробити модель хорошою зсередини: тренувати її цінності, вивчати її думки, змушувати її сперечатися з собою. Ця робота важлива. CIRIS робить ставку на інший шлях. Припускаємо, що здатна модель може бути неузгодженою, і замість того, щоб довіряти її розуму, робимо її значущі дії підзвітними перед людьми та іншими системами, які можуть їх перевірити.
У власних термінах галузі CIRIS знаходиться в інституційній гілці та гілці контролю, поруч із контролем ШІ та гарантовано безпечним ШІ, а не в основному напрямі інтерналізації цінностей RLHF, конституційного ШІ, дебатів та інтерпретованості. Його відповідь на масштабований нагляд, як наглядати за чимось розумнішим за вас, полягає в перевірці конверту підзвітності, а не міркувань. Підпис, кворум, аудит із ланцюговими хешами залишаються дешевими для перевірки, навіть коли рішення за ними надлюдське. Це узгоджує системи з багатьох здатних агентів з часом, а не цінності будь-якого одного розуму.
Лінія, яку ми тримаємо
Він не намагається узгодити один всемогутній ШІ. Навмисно.
Підзвітність потребує більше ніж однієї сторони. Когось, перед ким відповідати. Спосіб перевірки, який не можна тихо поглинути. Баланс сили, який жодна зі сторін не може захопити. Єдиний суперінтелект не має нічого з цього, тому немає чесного способу тримати його підзвітним. CIRIS побудований для іншого майбутнього: багато здатних агентів, людей та організацій, чиї значущі рішення всі незалежно перевіряються.
Тому позиція є явною. Одиничний ASI це не система для узгодження, а умова для запобігання. Концентрація надлюдських можливостей в одному непідзвітному місці, на цьому етапі розвитку людських інститутів, є нелегітимною, бо жодні інститути не достатньо зрілі, щоб тримати її підзвітною, і саме це є небезпекою. У власних термінах фреймворку одиничність це колапс єдиного голосу ρ→1, який модель коридору називає провалом координації, а не успіхом. Те, що наші гарантії діють у федерації та руйнуються проти одиничності, це не прогалина, яку ми латаємо. Це режим, який ми відмовляємося легітимізувати, утримуваний як зобов'язання, а не лише передбачення.
Як це порівнюється з ШІ, яким ви користуєтеся
Щоденні асистенти потужні та прості у використанні. Вони також працюють у чужій хмарі, не зберігають записів, які ви можете перевірити, і не відповідають нікому, кого ви можете назвати. Ось той самий тест на підзвітність, застосований до ШІ, який більшість людей відкривають щодня.
| Асистент | Опубліковані принципи | Доказ того, що він зробив | Запитує людину, коли не впевнений | Відкритий код | Перевірка луна-камери |
|---|---|---|---|---|---|
| ChatGPT | Так | Ні | Ні | Ні | Ні |
| Gemini | Так | Ні | Ні | Ні | Ні |
| Claude | Так | Ні | Ні | Ні | Ні |
| CIRIS | Так | Так | Так | Так | Так |
Порівняння за публічною поведінкою продукту станом на червень 2026 року. Кожне посилання на принципи веде до власної опублікованої специфікації тієї компанії.
Спробуйте самі
Дивіться, як він думає
Перегляньте покроковий процес міркування реального агента. Дослідити трасування →
Перевірте його особу
Подивіться, як агенти підтверджують, хто вони є, немов DMV для ШІ. Довіра та ідентичність →
Розпочати
Розгорніть свого першого агента або прочитайте дисертацію простою мовою. Перший контакт →