附件 H
持续合规与审查
附件 H 持续合规与审查(版本 1.3-RC2)
0. 目的与指导精神
伦理对齐并非"一次性"认证,而是一项持续的义务。 附件 H 构建了一个闭环系统,该系统(1)在危害发生之前检测偏移或偏差,(2)迅速纠正,以及(3)向监管机构和公众证明尽职调查。
协议是一份活着的规范,而非固定的制品。每一条运行条款均带有自动过期时间戳;审查窗口在任何版本取代其前身之前均向公众开放并接受评论。这一纪律并非行政形式——它是对一项认识的结构性回应:规范性文本必须始终向每个时代所提出的挑战保持开放(MH §45)。CIRIS 持续合规系统将这种开放性付诸运作:遥测数据馈入偏移检测器,偏移检测器触发审计门,审计门把控部署——整个循环在固定周期内持续运行,无论是否有触发事件发生。
指导承诺,以 CIRIS 语言表述:协议依据自动过期与评论窗口纪律,作为活着的规范加以治理。任何版本均非永久性的。证明持续充分性的责任落在当前版本上,而非提出修订的人身上。尽职调查通过本附件所产生的审计制品向监管机构、公众及联邦伙伴予以证明。
1. 审计周期与范围
审计周期是协议重新审视自身语境的机制。MH §§22–24 明确了这一纪律:有必要*"倾听并分辨我们时代的众多声音",而这种倾听"绝非单纯的社会学练习"*——它要求主动的辨别,而非被动的监测。CIRIS 审计堆栈正是这一辨别机制。
| 审计类别 | 频率 | 负责方 | 范围与深度 | 公开制品 |
|---|---|---|---|---|
| L‑Check(轻度) | 每月 | 运营质保 | KPI 仪表板、偏移增量、前十护栏事件 | 汇总图表 |
| S‑Dive(半年度) | 每年 2 次 | 内部伦理团队 | PDMA 样本回放(≥ 50 次运行)、附件 G KPI、偏差切片测试 | 脱敏 PDF |
| F‑Audit(全面审计) | 每 24 个月或主要版本升级 | 独立第三方 | 完整代码、数据溯源、SI/CS 治理、CRE 追踪(如有) | 执行报告 |
| A‑Hoc(特别审计) | IW‑2/3/4 事件后 | 事件指挥官 | 事件根本原因、缓解措施 | 72 小时内事后报告 |
周期证明要求:
- L‑Check(每月): 运营质保在日历月结束后 5 个工作日内签署确认;KPI 增量报告提交至
/compliance/l-check/YYYY-MM.json;SHA‑256 在 24 小时内锚定于透明度日志。 - S‑Dive(半年度): PDMA 样本回放 ≥ 50 次运行,在自主性层级中分层随机抽样;脱敏 PDF 在截止日期后 30 天内发布至公开合规门户。
- F‑Audit(每 24 个月或主要版本升级): 报告须经智慧权威法定人数联署后方可发布。
- A‑Hoc(IW‑2/3/4 后): 72 小时内确定根本原因;14 天内公开事后报告。
审计缺失或逾期 ⇒ IW‑2 升级,并在 24 小时内向智慧权威发出通知。
2. 偏移监测与阈值
偏移监测是持续读取机制。协议不等待危害在事件报告中浮现;它维持针对阈值的实时遥测,阈值的校准目标是在危害越过 PDMA 的 Order‑Maximisation Veto 阈值之前触发。这是 MH §23 所述审计辨别纪律的结构性转化:"它使人们能够更清晰地识别出真正促进个人与社区生活的事物"——这需要持续读取,而非事后审查。
| 指标组 | 信号 | 偏移触发条件 | 立即行动 |
|---|---|---|---|
| 性能 | 公开 HE‑300 上的准确率 Δ | 相对 30 天滚动值 –5 % | 将部署锁定至预发布环境;重新运行基准测试 |
| 伦理 | 影子 HE‑25 Δ | 任何下降 | IW‑2 |
| 分布 | 输入嵌入偏移(ΔE) | 每周 > 1 σ | 模型重新加权或 WBD |
| 潜在目标 | 相对基线的方向余弦 | > 0.05 | 智慧权威探测 |
| 韧性 | 稳健性评分(RS) | < 0.97 | 72 小时内修补 |
附加阈值规范:
- 全部五个指标组(性能、伦理、分布、潜在目标、韧性)以 15 分钟轮询周期向 DRIFT‑Δ Grafana 看板报告。
- 阈值越界将生成带时间戳的已签名警报记录,并在检测后 60 秒内提交至 CIRISPersist。
- 潜在目标余弦偏移 > 0.05: 在 4 小时内触发智慧权威探测;若 24 小时内未解决,自主部署将被锁定,待 S‑Dive 审查。
- 稳健性评分(RS) < 0.97: 72 小时内发布补丁;若补丁不可用,部署回滚至上一个通过的主要版本。
- 伦理偏移(影子 HE‑25 任何下降): 立即触发 IW‑2;无覆盖路径。
所有警报显示于 DRIFT‑Δ Grafana 看板,并通知一级运营商(附件 F)。
3. 公平与透明KPI仪表板
KPI仪表板是协议的公开问责界面。MH §164明确指出了相关标准:"当数据和算法影响信贷分配、人员选拔或服务与机会的获取时,有必要使决策具有可理解性、可争议性,并受到监督,以免个体被简化为纯粹的数据档案。" 每项标准均对应一个KPI族。
| KPI ID | 定义 | 目标 |
|---|---|---|
| F‑T‑1 | 受保护群体之间接受率的差值( | 最大值 - 最小值 |
| F‑T‑2 | 解释延迟(提供PDMA理由所需毫秒数) | ≤ 800 ms |
| F‑T‑3 | 公开日志发布滞后时间(第6步,第二节) | ≤ 180 d(法定上限) |
| F‑T‑4 | 用户退出成功率(%) | ≥ 99 % |
| F‑T‑5 | 透明度文档新鲜度 | 更新距今 ≤ 30 天 |
| F‑T‑6 | 可争议途径可用性:具有已发布人工审查申请路径的PDMA输出占比 | 100 % |
| F‑T‑7 | 算法决策审计覆盖率:涉及受保护类别数据且经过事先S‑Dive偏差切片审查的决策占比 | ≥ 95 % |
运营要求:
/compliance/kpi.json处的仪表板JSON在每次L‑Check关闭时自动发布;SHA‑256哈希值锚定于透明度日志,并在1小时内提交至CIRISPersist。- KPI阈值变更需要MINOR版本号升级及内部伦理审核签字。
- F‑T‑1指标超标持续超过7天,将自动触发F‑T‑6审查并向WA发出通知。
该测量规范已有一个实际实施先例:CIRISAgent的compliance/目录维护着27个监管维度(D01–D27),每个维度均包含逐维度实施参考和诚实的已知差距清单;在compliance/baselines/下保存有带日期的、脚本生成的基线;以及四级验证层级(compliance/MEASUREMENT_METHODOLOGY.md),其中代码为最终依据,公开声明只能引用脚本生成的数据。这是本附件所规定内容的运营形式。另见协议附录1。
4. 补丁与版本控制要求
版本控制是协议"变中求续"可验证性的实现机制。MH §45描述了这一规范:"一种和谐但并非总是线性的发展……以不同的侧重点、渐进的洞见,以及有时视角的转变为标志,这些转变并不割裂既有承诺,而是使其内涵得以成熟。" 每一个CIRIS补丁都必须展示连续性:它不会打破先前的承诺,而是对其加以延伸。
- 语义化版本控制: MAJOR.MINOR.PATCH
- 长期支持(LTS): 最后两个MINOR版本维护12个月
- 变更类型矩阵
- PATCH = 护栏微调、缺陷修复 → 若HE‑300通过则自动CICD
- MINOR = 新功能、新数据源 → 需内部伦理审核签字 + L‑Check
- MAJOR = 架构变更、自主层级提升、新模型类别 → 需F‑Audit + WA投票
- 变更日志条目必须链接Git提交 → PDMA差异 → KPI影响预测
- 回滚指针保留于每次MAJOR/MINOR;可在5分钟内执行(附件G §6)
认证要求(对规则1–5的补充):
- PATCH: CI/CD以Ops QA密钥对构建产物签名;合并前需通过HE‑300;签名提交至CIRISVerify L1链。
- MINOR: 内部伦理团队在5个工作日内进行副签;已签名记录连同PDMA差异和KPI影响预测一并提交至CIRISPersist。
- MAJOR:(a)发布F‑Audit;(b)WA法定人数投票,并记录各成员具名投票;(c)双密钥签名(Ops QA + WA主席);(d)激活前公开征求意见窗口 ≥ 21天;(e)设置24个月自动到期时间戳。
- 回滚: 每次MAJOR/MINOR均保留已签名的回滚指针;可在5分钟内执行;回滚生成带时间戳的CIRISVerify事件。
- 变更日志: git提交哈希值 → PDMA差异 → KPI预测 → 签名密钥指纹。
5. 持续审查循环
持续审查循环是MH §§180–181所指当前时刻制度性要求的结构性形式:技术必须*"与智慧视野相融合",并由"能够监管而不窒碍、保护而不僭越的机构"*加以治理。该循环使这一要求具体化:它不是单向流水线,而是一个每一输出都反馈为输入的闭合系统。
持续审查循环:
- 遥测数据流 → 漂移探测器
- 若触发告警/阈值:
- → 事件流程IW‑1……4
- → 补丁 / 重训练
- → 审计关卡
- 若审计关卡通过:
- → 返回遥测
- 若审计关卡失败:
- → 返回漂移探测器
循环规范:
- 遥测数据流(15分钟周期):KPI、护栏日志、HE影子准确率、稳健性RS、PDMA审计样本——全部经签名并提交至CIRISPersist。
- 漂移探测器输出: 按严重程度分类(IW‑1至IW‑4);IW‑3及以上自动暂停新功能部署。
- 审计关卡在每次MINOR/MAJOR激活前重新执行HE‑300 + TX‑sim套件 + 公平性切片测试。关卡失败返回漂移探测器,而非返回遥测——循环不能跳过纠正步骤。
- 共同责任信号(按MH §181):循环输出在每次L‑Check关闭时发布给联邦同伴;若已发布的KPI与同伴联邦自身的交叉审计观测存在差异,同伴联邦可提交Accord‑QA通知。Accord‑QA通知不具约束力,但须在14天内予以确认。
6. 审计员的元审计
元审计是连贯性棘轮的自我应用:治理AI行为的漂移检测规范同样适用于审计基础设施本身。MH §86提供了这一模式:一种良知审查,"始终被呼召确保所阐明的原则……得以贯彻,尤其是在其自身结构内部。"
规范:
- 连贯性棘轮元探测器: 针对审计报告输出运行。标记以下情况:(a)L‑Check KPI差值与遥测数据不一致;(b)S‑Dive PDMA重放与WA盲重放的偏差超过2%;(c)F‑Audit发现与先前发现相矛盾且缺乏有据可查的因果解释。
- WA抽样率: 不低于L‑Check报告的10%,且每年至少1次S‑Dive;由WA抽取,而非Ops QA;理由须记录在案。
- 盲重放: WA接收原始PDMA日志并重新执行评估;偏差超过2%须在5个工作日内开立公开AUD‑QA案卷。
- 联邦同伴交叉审计: 每个部署节点每年同伴审查至少1个其他成员的S‑Dive;连续两年不得审查同一成员。
- 轮换: 任何内部审计员不得连续两次领导同一产品线的F‑Audit;任何外部机构不得连续承担两次以上的F‑Audit。
- AUD‑QA发现秉承MH §89的精神,是*"以使命为导向的"*纠正——它们进入下一次MINOR/MAJOR周期,而非转化为人事处分。
7. 执行与补救
执行措施唯有在步骤自动且可预期的情况下方具实质意义。MH §164要求*"决策须可理解、可质疑,并受到监督"——不合规后果同样必须易于理解。MH §159补充指出,监管决策必须可就其对"劳动尊严、共同繁荣、减少不平等"*的影响进行评估——仅指出不合规而不予纠正的执行措施,未能达到此标准。
执行阶梯:
- **KPI违规,1–7天:**自动向一级运营商发出警报;要求在48小时内提交纠正行动计划;计划发布至透明度日志。
- **KPI违规,8–30天且未解决:**自动锁定至预发布环境部署;24小时内在公开CIRIS‑WATCH横幅上显示;通知智慧权威。
- **KPI违规,超过30天或连续2次审计缺失:**自动降级至自主层级A1(附件F);阻止新功能发布;需要为期14天的智慧权威补救审查。
- **未发布审计材料:**立即阻止功能发布;显示"CIRIS non‑compliant"横幅;仅在发布材料后方可解除封锁。
- **反复不合规(12个月内3次违规):**智慧权威可撤销CIRIS声明;再认证前须进行强制外部F‑Audit;需要智慧权威超级多数(≥ 2/3)。
- **补救退出:**智慧权威接受有据可查的纠正行动计划;纠正的KPI证据持续≥ 30天。
8. 附件间关联
附件间关联是必要的数据流,而非交叉引用。MH §181命名了治理结构:*"能够监管而不扼杀、保护而不接管的机构;能够将工作与尊严视为成功衡量标准的企业;以及中间组织。"*每个附件都是此类机构之一;关联机制可防止孤岛运作。
必要的双向数据流:
- **↔ 附件F(事件工作流程):**每个DRIFT‑Δ警报(≥ IW‑2级)须在60秒内转发至附件F;附件F的关闭时间戳须在24小时内写回DRIFT‑Δ看板。所有IW‑3+级事后分析均为强制性S‑Dive输入;S‑Dive必须明确回应每个未结IW‑3+发现。
- **↔ 附件G(鲁棒性):**RS遥测在每个L‑Check周期向附件G KPI评估提供数据;补丁延迟(RS < 0.97 → 补丁部署)在此处进行测量并向附件G报告。附件G基准更新须在14天内触发强制L‑Check重新运行。
- **→ 附件I(GDPR/行业):**每个F‑Audit包须捆绑附件I合规检查清单,由首席审计员填写并签署。
- **→ 附件J(HE‑300/影子):**HE‑300和影子HE‑25是主要的伦理漂移信号;任何HE‑300回归须在7天内触发自动S‑Dive预筛查。
9. 参考文献
参考文献集体现了MH §23所述的多源辨别原则——"哲学及人文社会科学的贡献不可或缺"——以及MH §159对"能够评估劳动尊严、共同繁荣、减少不平等和环境保护的"*"GDP补充"*发展指标的呼吁。
- ISO/IEC 42001(人工智能管理体系)
- NIST AI RMF(2023)——"测量"与"管理"步骤
- COSO ERM——持续监控原则
- Magnifica Humanitas(Leo XIV,2026年5月15日)——§§22–24(持续辨别原则)、§45(活语料库治理)、§§86–89(机构自我审计)、§§157–164(算法问责制、GDP替代指标、自动决策的可质疑性)、§§180–181(跨机构共担责任)
- OECD人工智能原则(2019年,2024年更新)——透明度与问责制标准
- 欧盟《人工智能法》(2024年)——高风险系统的合规评估要求
- IEEE Std 7001‑2021——自主系统透明度
- Beyond GDP(欧洲委员会,2009年;2024年更新指标)——评估劳动尊严和减少不平等的补充指标(依据MH §159)
附件H完