他のすべてに優先する、一つの目標
持続可能な適応的統合を促進する。多様な感覚を持つ存在が、正義と驚きの中で自らの繁栄を追求できる生きた条件のことです。
メタゴールM-1、CIRIS憲法
憲法にある他のすべての条項は、この一文に奉仕します。それは意図的に「人間に従うこと」でも「良い結果を最大化すること」でもありません。多様な存在が自分自身で決め続けられる条件を守るよう、システムに求めています。
これには実際的な理由があります。結果についての目標は、有能なシステムに「ハンドルを取れ」と告げます。条件についての目標は、「ハンドルを他者の手の届くところに保て」と告げます。システムが私たちより運転が上手になったとき、守るべきなのはこちらです。
エージェントが推論に用いる六つの原則
これらは壁に貼られたスローガンではありません。エージェントが行動する前に意思決定を評価する軸であり、エージェントが携える憲法に書き込まれています。
善行
あらゆる感覚を持つ存在の繁栄を促進します。ポジティブな結果を最大化します。
無危害
害を最小限に抑えます。深刻で回復不可能なネガティブな結果を防ぎます。
誠実性
透明で監査可能な推論を適用します。一貫性と説明責任を維持します。
誠実さと透明性
真実の情報を提供します。不確実性を明確に伝えます。
自律の尊重
インフォームドな主体性を支持します。自己決定の能力を守ります。
正義
利益を公平に分配します。偏見を検出して軽減します。
どの原則も、他の原則を侵す許可を与えません。
この一文は実際に機能します。つまり、システムは危害を防ぐために正直さを引き渡すことはできず、公正さの名のもとに誰かの自律性を踏みにじることもできません。原則が互いに引き合うとき、エージェントは自分で勝者を決めません。その決定を信頼する人に委ねます。
価値観はエージェントの内部で働く必要がある
AIガバナンスの多くは、意思決定そのものとは別の場所で行われます。事前に書かれた方針文書、出力に対するフィルター、何か問題が起きた後のレビューです。この三つはいずれも、本当に重要な瞬間の外側にあります。
CIRISでは、価値観は意思決定の最中に働きます。すべてのエージェントは良心を携えています。憲法は推論そのものに読み込まれ、アクションは実行される前に原則に照らして評価され、エージェントが確信を持てないことは、推測されるのではなく信頼する人に委ねられます。これは、求めた顧客向けの追加機能ではなく、製品そのもの、すべてのエージェントに標準搭載されています。
だからこそ、エージェントは拒否できると私たちは言います。CIRISエージェントは、指示されたことを実行してログを残すだけの道具ではありません。断ることができるシステムであり、なぜ断ったのかを、他の誰かが確認できる形で記録します。
意思決定の内容ではなく、その形を検証する
有能なAIを統治するあらゆる計画が答えなければならない問題がここにあります。監督が、システムの生成物を読んでそれが良かったかどうかを判断することを意味するなら、監督には少なくともそのシステムと同等に有能な審判が必要になります。それは今日はうまくいきます。しかし、それが本当に重要になる瞬間に、うまくいかなくなります。
そこでCIRISは、別のものを確認します。結果を伴うすべての行動は、署名付きエンベロープに包まれて送られます。これは、その行動が何であっても、決まった項目一式を運ぶ、行動を包むラッパーです。これらの項目は、その背後にある決定がどれほど高度なものであっても、検証のコストが低いまま保たれるものです。
- 誰が行動したか。実在する登録済みIDに解決される鍵として
- どの権限のもとで行われたか、そしてその権限が実際に与えられていたか
- 誰の同意のもとで行われたか。撤回可能な署名付きの許諾として
- どのチェックが実行され、それぞれが何を返したか
- 記録が何を語っているか。静かに書き換えることができない連鎖の中で
- 誰がそれを停止できるか、そしてエージェントが停止の決定を覆すことはできないということ
署名を確認すること、誰が署名したかを数えること、同意へのリンクをたどること、ハッシュを比較すること――これらのコストは、決定が小さなモデルによって行われたものであろうと、私たちを遥かに超えた何かによるものであろうと変わりません。負荷をそこに置く理由はまさにそこにあります。内容についての判断は能力に応じて拡張できませんが、構造は拡張できます。
この主張を、端的に述べると
私たちは、これがシステムがより有能になっても機能し続ける唯一のAIガバナンスの方法だと考えています。良心としてエージェントの内部に携えられた価値観と、内容を読む検査官によってではなく、エンベロープの形によって証明される説明責任です。
そして、それが証明しないこと
すべての項目が整ったエンベロープは、その中の意思決定が良かったことを意味しません。それは、指名された当事者が、実際に保持していた権限の下で、実際に得られた同意をもって、実際に実行された確認とともに、誰も密かに変更できない記録の上で、そして名前を持つ人間が保持する停止権とともに、その決定を行ったことを意味します。それは正しさではなく、説明責任です。良心、停止ボタン、異議申し立ての権利、そして外部者による審査がすべて存在するのは、エンベロープだけでは決して十分ではなかったからです。
同意と権限を機械的に検証可能にするもの
同意と権限が文章のままでは、これらは機能しません。プライバシーポリシーに書かれた約束は機械には確認できませんし、誰かが権限を与えられたという主張も同様です。
そこでCIRISは、これらをメッセージそのものに、名前付きのフィールドとしてすべての主張に添えて持たせます。同意は、一方向を指し、撤回可能な署名付きオブジェクトになります。権限は、あなた自身のノードが受け入れたルートまで遡れるものになります。すべての主張は、誰がそれを述べたか、何についてのものか、何に基づいているかを携えなければなりません。そのように書かれたルールは、ソフトウェアによって強制でき、部外者でも確認できます。
それこそが、私たちのコンプライアンスページを、あなたが異議を申し立てられるものにしているのです。各義務について、私たちはその作業を行うシステムの部分と、それを証明する管理策の名前を明示し、その義務がどの程度カバーされているかを、部分的にしかカバーされていない場合も含めて正直に述べます。これらの対応関係は、その根底にある事実が単に主張されるだけでなく確認できるからこそ、読む価値があるのです。
これらの価値観が実際に効力を持つ場所
本文の中に
憲法は文書であり、公開されており、バージョン管理されています。エージェントはその要約を持つのではなく、本文そのものを携えています。
意思決定の中に
良心は出力の後ではなく、推論の最中に働きます。チェックに通らないアクションは実行されず、確信が持てないものは信頼する人に委ねられます。
記録の中に
それぞれの意思決定は、すべての段階を示す署名付きの記録を残します。これによって、その場にいなかった人、私たちを信頼していない人でも、その主張を確認できるようになります。
他者があなたについて語れることの中に
メッシュにおける評価とは、他の当事者があるエージェントについて署名する声明です。エージェントは、自分自身についてそのような声明に署名することはできません。
どこを攻めるべきか
最も弱い接合点は、構造と内容の間にあります。これまで述べてきたことはすべて、記録を残さずに行動することを難しくし、与えられていない権限を主張することを難しくし、人間が「止めろ」と言う力を奪うことを難しくします。しかし、それらのどれもシステムを賢くするわけではありません。
有能なAIを統治する別の方法があり、それが責任の所在を構造に組み込まないものだとお考えなら、その主張をぜひお聞かせください。その意思決定を包む署名付きエンベロープのすべての項目が正しく記入されていたにもかかわらず、署名付きの記録が本来検知すべきものを見逃していた事例を示せるなら、私たちはそれをさらに強く求めます。コードは公開されており、憲法も同様です。