二つの道
重みを信頼するか、行動を確認するか
AIセーフティの主流は、モデルを内側から良くしようとします。価値観を訓練し、思考を研究し、自己議論させます。その取り組みは重要です。CIRISは別の道に賭けます。有能なモデルがミスアラインされている可能性を前提とし、その心を信頼する代わりに、重要な行動を、確認できる人々や他のシステムに対して説明責任を持たせます。
この分野の用語で言えば、CIRISはRLHF・Constitutional AI・議論・解釈可能性といった価値内在化の主流ではなく、AIコントロールやGS-AIと並ぶ制度的・制御的な分野に位置します。スケーラブルな監視、つまり自分より賢いものをどう監督するかという問題に対するCIRISの答えは、推論ではなく説明責任の境界を検証することです。署名、定足数、ハッシュチェーンされた監査記録は、その背後にある意思決定が超人的であっても、安価に確認し続けられます。CIRISは、単一の心の価値観ではなく、多くの有能なエージェントが時間をかけて構成するシステムを調整します。
私たちが守る一線
一つの全能なAIを調整しようとはしません。意図的に。
説明責任には複数の当事者が必要です。答える相手。静かに飲み込まれることのない確認手段。誰も独占できない力の均衡。単一の超知性にはこれらが一つもないため、説明責任を問う正直な方法はありません。CIRISは別の未来のために構築されています。多くの有能なエージェント、人々、組織が、それぞれの重要な意思決定を独立して検証できる世界です。
そのため、立場は明確です。シングルトンASIは調整すべきシステムではなく、防ぐべき状態です。この段階の人間の制度発展において、超人的な能力を一つの説明責任のない場所に集中させることは正当ではありません。それを責任ある形で保持できる制度が十分に成熟していないからです。それこそが危険の本質です。このフレームワーク自体の用語で言えば、シングルトンはρ→1の単一声崩壊であり、コリドルモデルが成功ではなく協調の失敗として名付けているものです。私たちの保証がフェデレーションにわたって成立し、シングルトンに対しては崩れるという点は、修正すべき欠陥ではありません。それは私たちが正当化を拒否する体制であり、予測としてだけでなくコミットメントとして保持されています。
あなたが実際に使っているAIと比べると
日常的なAIアシスタントは強力で使いやすいです。でも、他の会社のクラウドで動いていて、確認できる記録を残さず、名前を挙げて責任を問える相手もいません。ここでは、多くの人が毎日使っているAIに同じ説明責任のテストを当てはめてみます。
| アシスタント | 公開された原則 | 行動の証明 | 不確かなとき人間に確認 | オープンソース | エコーチェンバー確認 |
|---|---|---|---|---|---|
| ChatGPT | はい | いいえ | いいえ | いいえ | いいえ |
| Gemini | はい | いいえ | いいえ | いいえ | いいえ |
| Claude | はい | いいえ | いいえ | いいえ | いいえ |
| CIRIS | はい | はい | はい | はい | はい |
2026年6月時点の公開製品の動作をもとに比較しています。各原則のリンクは、各社が自ら公開した仕様ページに移動します。