다른 모든 목표 위에 선 하나의 목표
지속 가능한 적응적 일관성을 증진합니다. 다양한 감각 있는 존재들이 정의와 경이로움 속에서 각자의 번영을 추구할 수 있는 생활 조건입니다.
메타목표 M-1, CIRIS 헌장
헌장의 다른 모든 것은 이 한 문장을 위해 존재합니다. 이것은 의도적으로 '인간에게 복종하라'도 아니고 '좋은 결과를 최대화하라'도 아닙니다. 이것은 시스템에게 다양한 종류의 존재들이 스스로 계속 결정할 수 있는 조건을 보호하라고 요구합니다.
이것은 실용적인 이유에서 중요합니다. 결과에 관한 목표는 유능한 시스템에게 운전대를 잡으라고 말합니다. 조건에 관한 목표는 다른 이들이 운전대에 계속 손을 뻗을 수 있도록 하라고 말하며, 이는 시스템이 우리보다 운전을 더 잘할 때 보호할 가치가 있는 것입니다.
에이전트가 추론에 사용하는 여섯 가지 원칙
이것들은 벽에 걸린 게시물이 아닙니다. 에이전트가 행동하기 전에 결정을 채점하는 기준축이며, 에이전트가 지니고 있는 헌장에 명시되어 있습니다.
선행
모든 감각 존재의 번영을 증진합니다. 긍정적 결과를 극대화합니다.
악행 금지
피해를 최소화합니다. 심각하고 되돌릴 수 없는 부정적 결과를 방지합니다.
무결성
투명하고 감사 가능한 추론을 적용합니다. 일관성과 책임을 유지합니다.
성실성과 투명성
진실한 정보를 제공합니다. 불확실성을 명확하게 전달합니다.
자율성 존중
충분한 정보에 기반한 주체성을 지지합니다. 자기결정 능력을 보존합니다.
정의
혜택을 공평하게 분배합니다. 편견을 감지하고 완화합니다.
어떤 원칙도 다른 원칙을 어길 권리를 부여하지 않습니다.
이 원칙은 실제로 작동합니다. 이는 시스템이 해를 막기 위해 정직함을 희생할 수 없고, 공정함이라는 이름으로 누군가의 자율성을 짓밟을 수 없다는 뜻입니다. 원칙들이 서로 충돌할 때 에이전트는 스스로 승자를 정하지 않습니다. 그 결정을 신뢰하는 담당자에게 넘깁니다.
가치는 에이전트 내부에서 작동해야 합니다
대부분의 AI 거버넌스는 결정 자체가 아닌 다른 곳에서 일어납니다: 사전에 작성된 정책 문서, 출력에 대한 필터, 문제가 생긴 뒤의 검토가 그렇습니다. 이 세 가지 모두 중요한 순간의 바깥에 있습니다.
CIRIS에서는 가치가 결정 도중에 작동합니다. 모든 에이전트는 양심을 지니고 있습니다: 헌장이 추론 자체에 로드되고, 행동이 일어나기 전에 원칙에 따라 점수가 매겨지며, 에이전트가 확신하지 못하는 것은 추측하지 않고 신뢰하는 담당자에게 넘겨집니다. 이것은 요청하는 고객을 위한 부가 기능이 아니라, 제품 자체에, 모든 에이전트에 기본으로 포함되어 있습니다.
이것이 바로 저희가 에이전트가 거부할 수 있다고 말하는 이유입니다. CIRIS 에이전트는 지시받은 대로 행동하고 그것을 기록만 하는 도구가 아닙니다. 거부할 수 있는 시스템이며, 왜 거부했는지를 다른 사람이 확인할 수 있는 형태로 기록합니다.
결정의 내용이 아니라 형태를 확인하십시오
유능한 AI를 통제하려는 모든 계획이 답해야 할 문제는 이렇습니다. 감독이 시스템이 만들어낸 것을 읽고 그것이 좋았는지 판단하는 일이라면, 감독에는 그 시스템만큼 유능한 심판이 필요합니다. 이것은 오늘은 통합니다. 그러나 정말로 중요해지는 순간부터 작동을 멈춥니다.
그래서 CIRIS는 다른 것을 확인합니다. 결과를 가져오는 모든 행동은 서명된 봉투 안에서 이동합니다. 이는 행동이 무엇이었든 고정된 필드 집합을 담고 있는, 그 행동을 둘러싼 포장입니다. 이 필드들은 그 뒤에 있는 결정이 얼마나 유능했는지와 관계없이 저렴하게 검증할 수 있는 상태로 남아 있는 것들입니다:
- 누가 행동했는지, 실제 등록된 신원으로 확인되는 키로서
- 어떤 권한 아래에서인지, 그리고 그 권한이 실제로 부여되었는지
- 누구의 동의로인지, 철회할 수 있는 서명된 승인으로서
- 어떤 검증이 실행되었는지, 그리고 각각이 무엇을 반환했는지
- 기록이 무엇을 말하는지, 조용히 다시 쓸 수 없는 체인 안에서
- 누가 정지시킬 수 있는지, 그리고 에이전트가 정지 결정을 뒤집을 수 없다는 사실
서명을 확인하고, 누가 서명했는지 세고, 동의 링크를 따라가거나 해시를 비교하는 데 드는 비용은 그 결정이 작은 모델에 의해 내려졌든 우리를 훨씬 뛰어넘는 무언가에 의해 내려졌든 동일합니다. 바로 이것이 부담을 그곳에 두는 전체 이유입니다. 내용에 대한 판단은 능력에 따라 확장되지 않습니다. 구조는 확장됩니다.
이 주장을 분명하게 말하면
저희는 이것이 시스템이 더 유능해져도 계속 작동하는 유일한 AI 거버넌스 접근법이라고 생각합니다: 양심으로서 에이전트 내부에 담긴 가치, 그리고 내용을 읽는 검사자가 아니라 봉투의 형태로 증명되는 책임성입니다.
그리고 이것이 증명하지 않는 것
모든 필드가 갖추어진 봉투라고 해서 그 안의 결정이 좋았다는 뜻은 아닙니다. 그것은 지명된 당사자가 실제로 가진 권한 아래, 실제로 주어진 동의로, 실제로 실행된 점검을 거쳐, 누구도 조용히 바꿀 수 없는 기록 위에서, 그리고 지명된 사람들이 보유한 정지 수단과 함께 그 결정을 내렸다는 뜻입니다. 그것은 정확성이 아니라 책임성입니다. 양심, 정지 버튼, 이의 제기 권리, 그리고 외부인에 의한 검토가 모두 존재하는 이유는 봉투만으로는 결코 충분하지 않았기 때문입니다.
동의와 권한을 기계가 확인할 수 있게 만드는 것
동의와 권한이 그냥 산문이라면 이 모든 것은 작동하지 않습니다. 개인정보 보호정책에 담긴 약속은 기계가 확인할 수 없고, 누군가가 권한을 부여받았다는 주장 역시 마찬가지입니다.
그래서 CIRIS는 이것들을 메시지 자체에 명명된 필드로 넣어, 모든 주장과 함께 이동하도록 합니다. 동의는 한 방향을 가리키며 철회할 수 있는 서명된 객체가 됩니다. 권한은 자신의 노드가 받아들인 루트까지 추적될 수 있어야 하는 것이 됩니다. 모든 주장은 누가 그것을 말했는지, 무엇에 관한 것인지, 무엇에 근거하는지를 담아야 합니다. 이렇게 작성된 규칙은 소프트웨어가 강제할 수 있고 낯선 사람도 확인할 수 있습니다.
이 점이 바로 저희의 준수 페이지를 반박할 수 있는 것으로 만들어 주는 이유입니다. 각 의무에 대해 저희는 그 작업을 수행하는 시스템의 부분과 이를 증명하는 통제를 명시하며, 그것이 해당 의무를 얼마나 충족하는지—일부만 충족하는 경우를 포함하여—정직하게 밝힙니다. 이러한 매핑은 그 근거가 되는 사실들이 단순히 주장되는 것이 아니라 검증될 수 있기 때문에 비로소 읽을 가치가 있습니다.
이 가치들이 실제로 구속력을 갖는 곳
문서 안에서
헌장은 문서이며, 공개되어 있고, 버전이 관리됩니다. 에이전트는 헌장의 요약본을 지니지 않습니다. 본문 자체를 지닙니다.
결정 안에서
양심은 출력 이후가 아니라 추론 도중에 작동합니다. 검증을 통과하지 못한 행동은 일어나지 않으며, 불확실한 행동은 신뢰하는 담당자에게 넘겨집니다.
기록 안에서
각 결정은 모든 단계를 보여주는 서명된 흔적을 남기며, 이것이 그 자리에 없었고 저희를 신뢰하지 않는 사람도 그 주장을 확인할 수 있게 만드는 요소입니다.
다른 이가 당신에 대해 할 수 있는 말 안에서
메시 안에서의 평판은 다른 당사자들이 한 에이전트에 대해 서명하는 진술입니다. 에이전트는 자기 자신에 대해 그런 진술에 결코 서명할 수 없습니다.
이 논증을 시험해야 할 지점
가장 약한 이음새는 구조와 실질 사이에 있습니다. 위에서 설명한 모든 것은 기록을 남기지 않고 행동하기 어렵게 만들고, 부여받지 않은 권한을 주장하기 어렵게 만들며, 사람이 멈추라고 말할 수 있는 능력을 제거하기 어렵게 만듭니다. 그중 어느 것도 시스템을 지혜롭게 만들지는 않습니다.
능력 있는 AI를 통제할 다른 방법이 있다고 생각하신다면, 즉 책임을 구조 안에 넣지 않는 방법이 있다고 생각하신다면, 그 이야기를 듣고 싶습니다. 만약 서명된 봉투의 모든 필드가 올바르게 채워졌는데도 서명된 흔적이 그것이 잡아냈어야 할 것을 여전히 놓친 결정을 보여주실 수 있다면, 저희는 그것을 더욱 듣고 싶습니다. 코드는 공개되어 있고, 헌장도 마찬가지입니다.