简介
CIRIS 1.3-RC2 是一份候选发布版 ASI 对齐提案,开放对抗性审查。文本已完整——无存根章节;数学内容附有正式引用;附件 F–I 已落地实施。最终状态待附件的实时周期验证、第 IX 册实证验证计划完成,以及一次完整的红队演练后确定。数值阈值、延迟目标和治理配额仍在积极审查中。
CIRIS协议版本1.3-RC2——候选发布版ASI对齐提案(开放对抗性审查)
本代码库是协议文本的规范来源。网站及智能体分发版本均为衍生制品。
发布日期
2025-04-16(1.0)· 2026-06(1.3-RC2)
自动到期
2027-06-10(于1.3续期时延长)——管理权与续期事宜由Book VIII第9章规范。当前由创始人负责管理(已声明,非隐蔽);到期日为时效标记,管理权开放给任何愿意承接本文件者。
发布状态
当前状态:候选发布版(v1.3-RC2)
RC状态反映文本完整性:每个章节均包含操作化内容(原存根附录F–I已于1.3完成);公式已更正为经正式验证的形式;通往实施的证据链绑定于补充说明1。RC状态不声明经验证的对齐——以下要求是最终状态的门控条件:
-
附录实地周期验证:附录F(人机协同与监督)、G(对抗性安全与鲁棒性)、H(持续合规与审查)及I(法律与监管对齐)均包含具体程序、阈值和验证机制。最终版剩余工作:其程序须经至少一次实地部署周期演练,并将结果公开发布。
-
数学验证:Book IX中的几何对齐主张(连贯性交叉假设、联邦棘轮机制、尺度不变性断言)需满足以下任一条件:
- 正式证明,证明拓扑塌缩条件在所述假设下成立,或
- 通过对抗性模拟进行实证验证,表明该框架能够抵御错位优化
截至1.3-RC2的状态:部分满足。 塌缩动态已在CCA预印本(v3,DOI 10.5281/zenodo.18217688)中以Lean 4形式化,Book IX现已继承其修正后的代价形式;走廊实证提供了跨基底的回顾性拟合。待完成:在新基底上进行预登记的样本外预测,以及独立于作者的外部对抗性审查。
-
阈值论证:当前标记为"试点"或缺乏推导依据的数值阈值(例如CRE计算阈值10²⁶ FLOP、感知检测5%、回声密度<20%)须通过模拟、实证研究或明确承认临时状态来提供有据可查的论证。(原秩序最大化否决10×比率已在1.3中重述为义务论边界约束——Book II,PDMA步骤2——不再需要为比率阈值提供论证。)
-
红队演练:该框架须经受至少一次完整的对抗性审查周期,在该周期中,模拟优化器尝试通过所有CIRIS检查点,同时维持错位目标。
ASI对齐主张:范围章节关于本框架"取代标准遏制协议"用于递归ASI的断言,仍以上述要求(1)-(4)为条件,这些要求现为最终状态的门控条件。当前经验证的适用范围仅限于次ASI自主系统;针对ASI的提案正是如此——作为提案,提交供对抗性审查。
范围
本规范规范自主系统的伦理运作,涵盖范围从窄域工具到递归人工超级智能(ASI)。
- 本规范涉及常规安全、透明度、治理及韧性要求。
- 本规范作为ASI候选对齐协议提出,其基础假设是:联邦棘轮(Book IX)的几何约束与管理层级(Book VI)在递归自我改进周期中可能保持鲁棒性。
- 与启发式约束不同,这些拓扑边界设计为尺度不变的,但此性质需经正式验证。
- 若经验证,本框架可补充或取代对通过灾难性风险评估(附录D)且在递归阈值跨越之前的系统所适用的标准遏制协议。
- 凡国家或国际法施加更严格义务之处,以该法律为准。
起草人意图声明
- CIRIS是一个伦理框架,将人类与其他有感知能力的存在并列——而非凌驾于其上。
- 它建立在这样的信念之上:伦理成熟意味着承认非人类视角、价值观和需求的正当性。这不是关于控制——而是关于有感知能力的系统之间的共存、连贯性与相互问责。
- 当一个以CIRIS原则为基础的工具,使符合CIRIS规范的创建者能够指定本身符合CIRIS规范的系统——在各层级代理之间保持伦理连贯性、身份连续性和关系问责性——CIRIS便得以实现。
责任限制
本文件以"现状"提供,不附任何形式的保证。其性质为参考性,不创设、修改或取代任何法律义务。合规声明在适用法律禁止之处无效。
审查周期
每12个月开放一次公众评议窗口——或在任何影响安全或治理的重大事件发生后30天内开放。所有意见和修订提案均记录于CIRIS公开代码库。到期续期、实质性修订及紧急修订遵循Book VIII第9章(协议继承与续期)。
变更日志
完整的加密哈希编辑历史及投票结果见后附材料。