Эта страница переведена машиной. Если что-то читается неправильно, откройте задачу — репозиторий публичный не случайно. Сообщить о проблеме с переводом

вернуться в лобби

Ландшафт суперравнения

Большинство исследователей выравнивают модель. CIRIS строит институты вокруг неё.

Есть два честных способа сделать мощный ИИ безопасным. Первый: тренировать ценности модели, пока им не начнёшь доверять. Второй: предположить, что модель может ошибаться, и сделать её действия подотчётными, публично, людям и системам, которые каждый может проверить. CIRIS идёт вторым путём. Здесь весь ландшафт, честно описанный, и наше место в нём.

01Согласованность

Доверять весам или проверять поведение

Главное направление безопасности ИИ пытается сделать модель хорошей изнутри: тренировать её ценности, изучать её мысли, заставлять её спорить с собой. Эта работа важна. CIRIS делает ставку на другой путь. Предположим, что способная модель может быть рассогласованной, и вместо того чтобы доверять её разуму, сделаем её важные действия подотчётными людям и другим системам, которые могут их проверить.

В терминах самой области CIRIS находится в ветви институтов и контроля, рядом с контролем ИИ и гарантированно безопасным ИИ, а не в основном направлении интернализации ценностей через RLHF, Constitutional AI, дебаты и интерпретируемость. Его ответ на масштабируемый надзор, то есть на вопрос, как контролировать нечто умнее тебя, заключается в проверке конверта подотчётности, а не рассуждений. Подпись, кворум, аудит с хэш-цепочкой остаются дёшевы для проверки, даже когда стоящее за ними решение сверхчеловеческое. Система выравнивает многих способных агентов во времени, а не ценности одного разума.

Она не пытается выровнять один всесильный ИИ. Намеренно.

Подотчётность требует больше одной стороны. Кого-то, перед кем отвечать. Способа проверки, который нельзя тихо проглотить. Баланса сил, который никто не может захватить. У единственного сверхинтеллекта ничего этого нет, поэтому честного способа привлечь его к ответственности не существует. CIRIS создан для другого будущего: многих способных агентов, людей и организаций, чьи важные решения все поддаются независимой проверке.

Поэтому позиция явная. Одиночный ASI, это не система для выравнивания, а условие, которое нужно предотвратить. Концентрация сверхчеловеческих возможностей в одном неподотчётном месте, на нынешнем этапе развития человеческих институтов, нелегитимна, потому что ни один институт ещё не достаточно зрел, чтобы держать её в ответственности, и именно в этом опасность. В терминах самого фреймворка одиночка это коллапс ρ→1 в один голос, который коридорная модель называет провалом координации, а не успехом. То, что наши гарантии работают в федерации и ослабевают против одиночки, это не пробел, который мы затыкаем. Это режим, который мы отказываемся легитимизировать, и это наша обязанность, а не только прогноз.

02Потребительский ИИ

Как CIRIS сравнивается с ИИ, которым вы пользуетесь каждый день

Обычные ИИ-помощники мощные и удобные. Но они работают в чужом облаке, не сохраняют записей, которые вы можете проверить, и ни перед кем конкретно не отчитываются. Ниже тот же тест на подотчётность, применённый к ИИ, который большинство людей открывают каждый день.

ПомощникОпубликованные принципыПодтверждение действийСпрашивает человека при сомненииОткрытый исходный кодПроверка на эхо-камеру
ChatGPTДаНетНетНетНет
GeminiДаНетНетНетНет
ClaudeДаНетНетНетНет
CIRISДаДаДаДаДа

Сравнение основано на публичном поведении продуктов по состоянию на июнь 2026 года. Каждая ссылка на принципы ведёт на опубликованную спецификацию соответствующей компании.

Попробуйте сами

CIRISsafe by structure · open by principle · kind by design