两条路
信任权重,还是检验行为
AI 安全的主流做法是从内部让模型变好:训练它的价值观,研究它的思维,让它自我辩论。这项工作很重要。CIRIS 押注另一条路:假设一个有能力的模型可能存在偏差,与其信任它的判断,不如让它的重要行动对人和其他系统公开负责,接受检验。
用该领域自己的术语来说,CIRIS 属于制度与控制分支,与 AI 控制和 GS-AI 并列,而不属于 RLHF、Constitutional AI、辩论和可解释性的价值内化主流。对于可扩展监督,即如何监督比你更聪明的东西,CIRIS 的答案是验证问责框架,而不是推理过程。签名、法定人数、哈希链审计即便面对超人决策,验证成本依然低廉。它对齐的是众多有能力的智能体随时间形成的系统,而不是任何单一思维的价值观。
我们坚守的界线
它不尝试对齐一个全能 AI。这是故意的。
问责需要不止一方:有人可以被追责,有方法可以检验且无法被悄悄吞没,有权力平衡让任何一方都无法独占。单一超级智能不具备这些条件,因此没有诚实的方式让它承担责任。CIRIS 为另一种未来而构建:许多有能力的智能体、人类和组织,其重要决策都可以独立核查。
因此,这一立场是明确的。单一 ASI 不是一个需要对齐的系统,而是一种需要防止的状态。在人类制度发展的这个阶段,将超人能力集中于一个不可问责的地方是不合法的,因为没有任何制度成熟到足以约束它,这正是危险所在。在该框架自身的术语中,单一体就是 ρ→1 单一声音崩溃,这是走廊模型所称的协调失败,而非成功。我们的保障在联盟中有效,面对单一体则会瓦解,这不是我们要修补的漏洞,而是我们拒绝赋予合法性的体制,这是一种承诺,而不仅仅是预测。
与你日常使用的AI相比
日常助手功能强大,使用方便。但它们运行在别人的云端,没有你可以核查的记录,也没有你能指名道姓的负责人。以下是同一套问责测试,应用于大多数人每天打开的AI。
依据2026年6月的公开产品行为进行比较。每个原则链接均指向该公司自己发布的规范。