CIRIS
本页面由机器翻译。 如有任何读起来不通顺的地方,请在 GitHub 上提交 issue。代码库是公开的,任何人都可以帮忙修正。 报告翻译问题

返回首页

CIRIS 价值观

这些价值观,以及为何如此构建。

CIRIS 把一套价值观直接内置于智能体本身,然后让其中真正重要的部分可以被任何人核实:不是我们是否喜欢这个答案,而是这个决策是否在获得授权的情况下作出、是否取得了同意、是否运行了检查、以及是否存在停止它的方式。本页包含这两个部分:这些价值观是什么,以及为什么我们认为,随着这些系统变得越来越强大,这是唯一一种仍然行得通的治理形态。

一个高于一切的目标

促进可持续的适应性连贯性:多样化有感知能力的存在,能够在公正与惊奇中追求自身繁荣的生存条件。

元目标 M-1,CIRIS 宪法

宪法中的其他一切都服务于这一句话。它刻意不是“服从人类”,也不是“最大化良好结果”。它要求系统保护这样一种条件:让许多不同种类的存在者能够继续为自己做决定。

这有一个实际的理由。关于结果的目标,是让一个有能力的系统去掌控方向盘。关于条件的目标,则是让它把方向盘留在他人能够触及的地方——当这个系统比我们更擅长驾驶时,这才是值得保护的东西。

智能体推理所依据的六项原则

这些原则不是挂在墙上的口号。它们是智能体在执行动作之前,用来为决策评分的坐标轴,并且被写入了智能体所携带的宪法之中。

仁善

促进普遍有感知生命的繁荣,最大化积极结果。

不伤害

将危害降至最低,防止严重的、不可逆的负面结果。

正直

采用透明、可审计的推理,维护连贯性与问责制。

忠实与透明

提供真实信息,清晰传达不确定性。

尊重自主

维护知情自主权,保护自我决定的能力。

公正

公平分配利益,检测并缓解偏见。

这句话切实发挥着作用。它意味着系统不能为了防止伤害而牺牲诚实,也不能以公平的名义践踏某人的自主。当各项原则相互冲突时,智能体不会自行判定胜负,而是把决定交给您信任的人。

价值观必须在智能体内部运行

大多数 AI 治理发生在决策之外的某个地方:事先写好的政策文件、对输出的过滤,或者出问题之后的审查。这三者都处于那个真正重要的时刻之外。

在 CIRIS 中,价值观在决策过程中运行。每一个智能体都携带一份良知:宪法被载入推理本身,动作在发生之前会依据原则进行评分,任何智能体不确定的事,都会交给您信任的人,而不是靠猜测。它内置于产品之中、内置于每一个智能体之中,而不是只提供给提出要求的客户作为附加功能。

这就是为什么我们说智能体可以拒绝。CIRIS 智能体不是一个只会照做并记录日志的工具。它是一个可以拒绝的系统,并且会以他人能够核实的形式,记录下它拒绝的原因。

核验决策的形状,而非其内容

这是每一个治理强大 AI 的方案都必须回答的问题。如果监督意味着阅读系统产出的内容并判断其好坏,那么监督就需要一个至少和系统一样有能力的评判者。今天这还行得通。但恰恰在它开始变得重要的那一刻,它就不再行得通了。

因此,CIRIS 检验的是另一件事。每一个具有重大影响的行动,都以一个已签名的信封的形式传递:一个围绕该行动的包装,携带一组固定字段,无论该行动本身是什么。这些字段无论其背后的决策能力有多强,验证成本始终低廉:

  • 是谁执行了动作——一个能够解析到真实注册身份的密钥
  • 在什么权威之下,以及那份权威是否确实被授予
  • 取得了谁的同意——一份可以被撤回的已签名授权
  • 运行了哪些检查,以及每一项检查的结果是什么
  • 记录中写的是什么——在一条无法被悄悄篡改的链条上
  • 谁能够停止它,以及智能体无法撤销停止的决定

核实一个签名、统计签名人数、追踪一个同意链接,或者比对一个哈希值,其成本无论决策是由一个小模型做出的,还是由远超我们能力的某物做出的,都是一样的。这正是把负荷放在这里的全部理由。对内容的判断不会随能力增长而扩展,结构会。

我们认为,这是唯一一种在系统变得越来越强大时仍然行得通的 AI 治理方式:价值观以良知的形式内置于智能体之中,问责则通过信封的形状来证明,而不是靠检查员阅读其内容。

一个各字段齐全合规的签名信封,并不意味着信封里的决策本身是好的。它意味着:这是一个具名方在其实际拥有的权限之下做出的决定,基于实际给予的同意,经过了实际执行的检查,有一份任何人都无法悄悄更改的记录作证,并且有由具名人类掌握的停止机制。这是问责,而不是正确性。良知、停止按钮、申诉权,以及外部审查之所以都存在,正是因为仅靠签名信封从来都不足够。

是什么让同意与权威可被机器核验

如果同意与权威只是文字叙述,这一切都无法成立。隐私政策中的一句承诺,机器无法核实;某人已获得授权的说法,同样无法核实。

因此,CIRIS 把它们放进消息本身,作为随每一项主张一起传递的具名字段。同意变成一个有明确指向、且可以被撤回的已签名对象。权威变成必须能够追溯到您自己节点所接受的根的东西。每一项主张都必须携带:是谁说的、关于什么、依据什么。以这种方式写成的规则,可以由软件强制执行,也可以被一个陌生人核实。

正是这一点,使我们的合规页面变成了可以与之争论的东西。对于每一项义务,我们都会指明系统中承担该工作的部分,以及证明这一点的控制措施,并诚实地说明它覆盖了该义务的多少——包括仅覆盖一部分的情况。这些映射之所以值得一读,是因为其背后的事实可以被核实,而不仅仅是被声称。

这些价值观真正具有约束力的地方

在文本之中

宪法就是那份文件,它是公开的,并且有版本号。智能体携带的不是它的摘要,而是它的全文。

在决策之中

良知在推理过程中运行,而不是在输出之后。未通过检查的动作不会发生,不确定的动作则会交给您信任的人。

在记录之中

每一个决策都会留下一份已签名的轨迹,记录每一个阶段——正是这一点,使得这个说法能够被一个不在场、也不信任我们的人核实。

体现在他人能对您作出的评价中

网状网络中的声誉是其他各方对某个智能体签署的声明。智能体永远不能对自己签署这样的声明。

可以攻击的地方

最薄弱的关节在结构与实质之间。上文所述的一切,让人难以在不留下记录的情况下行动,难以冒用未曾获得的权威,也难以剥夺人类说“停”的能力。但这一切都不能让一个系统变得有智慧。

如果您认为存在另一种治理有能力的 AI 的方式,一种不把问责建立在结构之中的方式,我们想听听这个论点。如果您能向我们展示一个决策,其周围的签名信封在每个字段上都正确无误,而签名轨迹却仍然错过了它本应捕捉到的东西,我们更想听到这个。代码是公开的,宪法也是。