このページは機械翻訳されています。 おかしな表現があればイシューを開いてください。リポジトリは公開されています。 翻訳の問題を報告

ロビーに戻る

スーパーアライメントの全体像

この分野のほとんどはモデルを調整しようとしています。CIRISはその周りの制度を構築しています。

強力なAIを安全にする正直な方法は二つあります。一つは、信頼できるまでモデルの価値観を訓練することです。もう一つは、モデルが間違っている可能性を前提として、モデルの行動を、誰でも確認できる人々やシステムに対してオープンに説明責任を持たせることです。CIRISは二番目の道を選びます。ここでは全体の状況を公平にマッピングし、私たちがどこに位置するかを示します。

01アラインメント

重みを信頼するか、行動を確認するか

AIセーフティの主流は、モデルを内側から良くしようとします。価値観を訓練し、思考を研究し、自己議論させます。その取り組みは重要です。CIRISは別の道に賭けます。有能なモデルがミスアラインされている可能性を前提とし、その心を信頼する代わりに、重要な行動を、確認できる人々や他のシステムに対して説明責任を持たせます。

この分野の用語で言えば、CIRISはRLHF・Constitutional AI・議論・解釈可能性といった価値内在化の主流ではなく、AIコントロールやGS-AIと並ぶ制度的・制御的な分野に位置します。スケーラブルな監視、つまり自分より賢いものをどう監督するかという問題に対するCIRISの答えは、推論ではなく説明責任の境界を検証することです。署名、定足数、ハッシュチェーンされた監査記録は、その背後にある意思決定が超人的であっても、安価に確認し続けられます。CIRISは、単一の心の価値観ではなく、多くの有能なエージェントが時間をかけて構成するシステムを調整します。

一つの全能なAIを調整しようとはしません。意図的に。

説明責任には複数の当事者が必要です。答える相手。静かに飲み込まれることのない確認手段。誰も独占できない力の均衡。単一の超知性にはこれらが一つもないため、説明責任を問う正直な方法はありません。CIRISは別の未来のために構築されています。多くの有能なエージェント、人々、組織が、それぞれの重要な意思決定を独立して検証できる世界です。

そのため、立場は明確です。シングルトンASIは調整すべきシステムではなく、防ぐべき状態です。この段階の人間の制度発展において、超人的な能力を一つの説明責任のない場所に集中させることは正当ではありません。それを責任ある形で保持できる制度が十分に成熟していないからです。それこそが危険の本質です。このフレームワーク自体の用語で言えば、シングルトンはρ→1の単一声崩壊であり、コリドルモデルが成功ではなく協調の失敗として名付けているものです。私たちの保証がフェデレーションにわたって成立し、シングルトンに対しては崩れるという点は、修正すべき欠陥ではありません。それは私たちが正当化を拒否する体制であり、予測としてだけでなくコミットメントとして保持されています。

02一般向けAI

あなたが実際に使っているAIと比べると

日常的なAIアシスタントは強力で使いやすいです。でも、他の会社のクラウドで動いていて、確認できる記録を残さず、名前を挙げて責任を問える相手もいません。ここでは、多くの人が毎日使っているAIに同じ説明責任のテストを当てはめてみます。

アシスタント公開された原則行動の証明不確かなとき人間に確認オープンソースエコーチェンバー確認
ChatGPTはいいいえいいえいいえいいえ
Geminiはいいいえいいえいいえいいえ
Claudeはいいいえいいえいいえいいえ
CIRISはいはいはいはいはい

2026年6月時点の公開製品の動作をもとに比較しています。各原則のリンクは、各社が自ら公開した仕様ページに移動します。

ご自身で試してみる

CIRISsafe by structure · open by principle · kind by design