CIRIS
Эта страница переведена машиной. Если что-то читается неправильно, пожалуйста, откройте задачу на GitHub. Репозиторий публичный, чтобы каждый мог помочь его исправить. Сообщить о проблеме с переводом

назад на главную страницу

Ландшафт супералайнмента

Большинство исследователей выравнивают модель. CIRIS строит институты вокруг неё.

Есть два честных способа сделать мощный ИИ безопасным. Первый: тренировать ценности модели, пока им не начнёшь доверять. Второй: предположить, что модель может ошибаться, и сделать её действия подотчётными, публично, людям и системам, которые каждый может проверить. CIRIS идёт вторым путём. Здесь весь ландшафт, честно описанный, и наше место в нём.

01Согласованность

Доверять весам или проверять поведение

Главное направление безопасности ИИ пытается сделать модель хорошей изнутри: тренировать её ценности, изучать её мысли, заставлять её спорить с собой. Эта работа важна. CIRIS делает ставку на другой путь. Предположим, что способная модель может быть рассогласованной, и вместо того чтобы доверять её разуму, сделаем её важные действия подотчётными людям и другим системам, которые могут их проверить.

В терминах самой области CIRIS находится в ветви институтов и контроля, рядом с контролем ИИ и гарантированно безопасным ИИ, а не в основном направлении интернализации ценностей через RLHF, Constitutional AI, дебаты и интерпретируемость. Его ответ на масштабируемый надзор, то есть на вопрос, как контролировать нечто умнее тебя, заключается в проверке конверта подотчётности, а не рассуждений. Подпись, кворум, аудит с хэш-цепочкой остаются дёшевы для проверки, даже когда стоящее за ними решение сверхчеловеческое. Система выравнивает многих способных агентов во времени, а не ценности одного разума.

Она не пытается выровнять один всесильный ИИ. Намеренно.

Подотчётность требует больше одной стороны. Кого-то, перед кем отвечать. Способа проверки, который нельзя тихо проглотить. Баланса сил, который никто не может захватить. У единственного сверхинтеллекта ничего этого нет, поэтому честного способа привлечь его к ответственности не существует. CIRIS создан для другого будущего: многих способных агентов, людей и организаций, чьи важные решения все поддаются независимой проверке.

Поэтому позиция явная. Одиночный ASI — это не система для выравнивания, а условие, которое нужно предотвратить. Концентрация сверхчеловеческих возможностей в одном неподотчётном месте, на нынешнем этапе развития человеческих институтов, нелегитимна, потому что ни один институт ещё недостаточно зрел, чтобы обеспечить её подотчётность, и именно в этом опасность. В терминах самого фреймворка одиночка — это коллапс ρ→1 в один голос, который коридорная модель называет провалом координации, а не успехом. То, что наши гарантии работают в федерации и ослабевают против одиночки, — это не пробел, который мы затыкаем. Это режим, который мы отказываемся легитимизировать и рассматриваем как наше твёрдое обязательство, а не просто прогноз.

02Потребительский ИИ

Как CIRIS сравнивается с ИИ, которым вы пользуетесь каждый день

Обычные ИИ-помощники мощные и удобные. Но они работают в чужом облаке, не сохраняют записей, которые вы можете проверить, и ни перед кем конкретно не отчитываются. Ниже тот же тест на подотчётность, применённый к ИИ, который большинство людей открывают каждый день.

ПомощникОпубликованные принципыПодтверждение действийСпрашивает человека при сомненииОткрытый исходный кодПроверка на эхо-камеру
ChatGPTДаНетНетНетНет
GeminiДаНетНетНетНет
ClaudeДаНетНетНетНет
CIRISДаДаДаДаДа

Сравнение основано на публичном поведении продуктов по состоянию на июнь 2026 года. Каждая ссылка на принципы ведёт на опубликованную спецификацию соответствующей компании.

Попробуйте сами