CIRIS
Эта страница переведена машиной. Если что-то читается неправильно, пожалуйста, откройте задачу на GitHub. Репозиторий публичный, чтобы каждый мог помочь его исправить. Сообщить о проблеме с переводом

назад на главную страницу

ЦЕННОСТИ CIRIS

Ценности и почему они устроены именно так.

CIRIS встраивает набор ценностей прямо в агента, а затем делает важную часть проверяемой для любого: не то, понравился ли нам ответ, а то, было ли решение принято на законных полномочиях, с согласием, с проведёнными проверками и с возможностью его остановить. Эта страница — обе половины сразу: что такое эти ценности и почему мы считаем, что это единственная форма управления, которая продолжает работать по мере роста возможностей этих систем.

Одна цель важнее всех остальных

Содействовать устойчивой адаптивной согласованности: условиям жизни, в которых разные разумные существа могут стремиться к своему процветанию в справедливости и удивлении.

Мета-цель M-1, Конституция CIRIS

Всё остальное в Конституции служит этой единственной фразе. Она намеренно не звучит как «подчиняться людям» и не как «максимизировать благоприятные исходы». Она требует от системы защищать условия, при которых множество разных видов существ могут продолжать решать за себя.

Это важно по практической причине. Цель, ориентированная на результат, говорит способной системе взять руль в свои руки. Цель, ориентированная на условия, говорит ей оставлять руль доступным для других — а именно это стоит защищать, когда система управляет лучше, чем мы.

Шесть принципов, которыми руководствуется агент

Они не висят на стене в виде плаката. Это оси, по которым агент оценивает решение до того, как совершить действие, и они записаны в Конституции, которую агент несёт с собой.

Благодеяние

Содействовать всеобщему процветанию разумных существ. Максимизировать положительные результаты.

Непричинение вреда

Минимизировать вред. Предотвращать тяжкие, необратимые негативные последствия.

Целостность

Применять прозрачное, проверяемое рассуждение. Поддерживать когерентность и подотчётность.

Верность и прозрачность

Предоставлять правдивую информацию. Чётко сообщать о неопределённости.

Уважение к автономии

Поддерживать осознанную деятельность. Сохранять способность к самоопределению.

Справедливость

Распределять выгоды справедливо. Выявлять и снижать предвзятость.

Эта строка реально работает. Она означает, что система не может пожертвовать честностью, чтобы предотвратить вред, или растоптать чью-то автономию во имя справедливости. Когда принципы вступают в противоречие, агент не выбирает победителя самостоятельно. Он передаёт решение человеку, которому вы доверяете.

Ценности должны работать внутри агента

Большая часть управления ИИ происходит не в момент решения: это документ с правилами, написанный заранее, фильтр на выходе или проверка после того, как что-то пошло не так. Все три находятся вне того момента, который действительно важен.

В CIRIS ценности работают во время принятия решения. Каждый агент несёт Совесть: Конституция загружается прямо в само рассуждение, действие оценивается по принципам до того, как оно совершится, а всё, в чём агент не уверен, передаётся человеку, которому вы доверяете, а не угадывается. Это встроено в продукт, в каждого агента, а не является дополнением для клиентов по запросу.

Именно поэтому мы говорим, что агент может отказаться. Агент CIRIS — не Инструмент, который выполняет команды и записывает их в журнал. Это система, которая может отказать и зафиксировать причину отказа в форме, доступной для проверки другим человеком.

Проверяйте форму решения, а не его содержание

Вот проблема, на которую должен ответить любой план управления способным ИИ. Если контроль означает чтение того, что произвела система, и оценку того, было ли это хорошо, то для контроля нужен судья, как минимум не менее способный, чем сама система. Сегодня это работает. Но перестаёт работать именно тогда, когда это становится важно.

Поэтому CIRIS проверяет нечто иное. Каждое значимое действие передаётся в подписанном конверте — обёртке вокруг действия, которая несёт фиксированный набор полей, независимо от того, каким было само действие. Эти поля — то, что остаётся дёшево проверить, независимо от того, насколько способным было решение за ними:

  • кто совершил действие — как ключ, который сводится к реальной зарегистрированной личности
  • на основании каких полномочий, и были ли эти полномочия действительно предоставлены
  • с чьего согласия — как подписанное разрешение, которое можно отозвать
  • какие проверки были проведены и что каждая из них вернула
  • что говорит запись — в цепочке, которую нельзя незаметно переписать
  • кто может его остановить, и что агент не может отменить решение об остановке

Проверка подписи, подсчёт подписавших, переход по ссылке согласия или сравнение хеша стоит одинаково, независимо от того, принято ли решение небольшой моделью или чем-то далеко превосходящим нас. Именно поэтому нагрузку нужно возлагать именно туда. Оценка содержания не масштабируется вместе со способностями. А структура — масштабируется.

Мы считаем, что это единственный подход к управлению ИИ, который продолжает работать по мере роста возможностей систем: ценности, встроенные в агента в виде Совести, и подотчётность, доказываемая формой конверта, а не проверяющим, читающим содержание.

Конверт, в котором все поля заполнены верно, не означает, что решение внутри него было хорошим. Это означает, что его принял названный участник, обладавший реальными полномочиями, с согласием, которое было действительно дано, с проверками, которые действительно были проведены, в записи, которую никто не может незаметно изменить, и с остановкой, которую держат названные люди. Это подотчётность, а не правильность. Совесть, кнопка остановки, право на апелляцию и проверку внешними сторонами — всё это существует, потому что одного конверта никогда не было бы достаточно.

Что делает согласие и полномочия проверяемыми машиной

Ничего из этого не работает, если согласие и полномочия существуют только в виде текста. Обещание в политике конфиденциальности не может быть проверено машиной, как и утверждение о том, что кто-то был уполномочен.

Поэтому CIRIS размещает их прямо в сообщении — как именованные поля, которые сопровождают каждое утверждение. Согласие становится подписанным объектом, который указывает в одну сторону и может быть отозвано. Полномочия становятся тем, что должно восходить к корню, принятому вашим собственным узлом. Каждое утверждение должно содержать, кто его сделал, о чём оно и на чём оно основано. Правило, записанное таким образом, можно применить программно и проверить посторонним человеком.

Именно это превращает наши страницы соответствия во что-то, с чем можно поспорить. Для каждого обязательства мы называем часть системы, которая выполняет работу, и контроль, который это подтверждает, и честно говорим, в какой мере это обязательство покрыто, включая случаи, когда покрыта лишь часть. Эти сопоставления стоит читать только потому, что факты, лежащие в основе, можно проверить, а не просто заявить.

Где эти ценности реально действуют

В тексте

Конституция — это документ, она публична и имеет версии. Агент не носит с собой её краткое изложение. Он несёт сам текст.

В решении

Совесть работает во время рассуждения, а не после вывода. Действие, не прошедшее проверку, просто не совершается, а действие, вызывающее неопределённость, передаётся человеку, которому вы доверяете.

В записи

Каждое решение оставляет подписанный след, показывающий каждый этап — именно это делает утверждение проверяемым для того, кто не присутствовал при этом и не доверяет нам.

В том, что о вас могут сказать другие

Репутация в меш-сети — это утверждение, которое другие стороны подписывают об агенте. Агент никогда не может подписать такое утверждение о самом себе.

Где искать слабое место

Самое слабое звено — стык между структурой и содержанием решения. Всё описанное выше делает трудным действовать без следа в записи, присваивать себе полномочия, которые не были предоставлены, и лишать человека возможности сказать «стоп». Ничто из этого не делает систему мудрой.

Если вы считаете, что существует другой способ управлять способным ИИ, способ, который не закладывает подотчётность в структуру, мы хотим услышать этот аргумент. Если вы можете показать нам решение, в котором подписанный конверт вокруг него был верен по каждому полю, а подписанный след всё равно упустил то, что должен был зафиксировать, мы хотим это ещё больше. Код открыт, и Конституция тоже.