数学推导页
经证明软件核验
核心思想
五个互相抄袭的检查,实质上只是一个检查。
假设五个人核查同一个答案,五个人都同意。这看起来很安全。但如果五个人都从同一个地方学来的,他们的一致不是五个意见,而是一个意见重复了五遍。检查的数量看起来是五,实际上是一。
这对 AI 很重要。一个 AI 系统可以对自己的推理进行多次检查,但如果这些检查共享同一个盲点,仍然会被欺骗。Coherence Collapse Analysis 就是 CIRIS 用来区分真实检查与回响的方法。
唯一的公式
计算你真正拥有的检查数量。
其核心只有一条简短的公式。它来自调查统计学,在那里被称为 Kish 设计效应,同样的形态也出现在投票理论和安全工程中。CIRIS 把它应用于 AI 对齐。
real checks = checks / (1 + copying × (checks − 1))
"Checks"是你进行的检查次数,"copying"是它们的重叠程度,从 0(完全独立)到 1(完全相同)。结果是你真正拥有的检查数量。
无抄袭:十次检查就算十次,每次检查都名副其实。
完全抄袭:十次检查只算一次,无论加多少都没用。
在真实流量上
这是经过测量的,不只是理论推导。
CIRIS 对自身实时智能体流量进行了真实检查数量的测量,横跨数千条记录在案的决策。在健康流量上,真实独立检查数量约在七到九之间。这一测量及其方法就是 Constrained Reasoning Chains 研究。您可以在 研究页面上查看实时数据。
诚实的上限
这套数学做不到什么。
论文证明了一条针对自身的硬性限制。某些伤害并非来自某个不诚实的部件,而是来自诚实部件叠加产生的糟糕结果。论文证明,这类伤害中有一部分,任何只看部件的检查都看不见,无论检查做得多好。CIRIS 直接说明这一点,而非假装这套数学能抓住一切。
系统真正承诺的是记录。每个决策都会留下一张无法悄悄改写的签名收据,所以一个谎言必须与它永远无法抹去的数千张收据保持一致。把这些收据读好仍是一项开放的工作,我们也如实说明。无论如何,账本始终真实。
整体联系
这套数学是更大整体的一部分。
本页是测量层。Coherence Ratchet 是将测量付诸实践的方式。联邦是让它成为多个系统共同参与之物的方式。完整证明——逐行可由计算机核验——在论文和 RATCHET 仓库中。