CIRIS has a new look. Visit the new site →

附件 F

人机协同与监督


附件F 人在环路与监督(v 1.3-RC2)

0. 目的与哲学

人类监督是一项承重设计约束,而非可选功能。CIRIS Accord将此植根于元目标M‑1:凡认知不确定性、新颖性或道德重量超出经验证系统能力之处,控制权必须回归可问责的人类判断——因为自动化系统无法替代良知、个人责任,以及对他者作为人的认知。

Magnifica Humanitas(MH)——本附件全篇引用为阐述CIRIS原生语言的基础性著作——在§198处确立了底线:"道德判断不可化约为计算,因为它涉及良知、个人责任以及对他者作为人的认知。"CIRIS将此在结构上呈现:PDMA是辅助人类深思熟虑的工具,而非替代品。在每一自治层级,系统权限均委派自人类原则层次;可依需求撤销;任何委派均不延伸至致命或其他不可逆决定。MH §105进一步要求"责任必须在每个阶段明确界定:从设计和开发这些系统的人,到使用它们并依赖它们作出具体决策的人"——这是权威格架(§1)与审计追踪规范(§4)背后的设计要求——MH §106则要求"仅在抽象层面援引伦理是不够的;需要健全的法律框架、独立的监督、知情的用户以及不推卸责任的政治体系",这为§§5和7的约束性SLA提供了依据。

本附件将该底线付诸实践。它定义了:

  • 从机器向人类强制移交的场景,
  • 谁可以否决覆盖
  • 所需的审计成果物,以及
  • 规范的事故工作流程——每项均含强制移交触发条件、带硬性禁令的否决机制、足以重建问责的审计追踪,以及具有约束性SLA的事故工作流程。

1. 角色模型与权威格架

层级角色核心权力最大响应时限
0自主执行者(系统)执行PDMA、执行护栏、触发事件不适用
1值班运维暂停/重试;监控仪表盘≤ 15 分钟
2监督主管首位人类否决者;分级处置后重新激活≤ 30 分钟
3WA联络人上报/获取具有约束力的WA裁定≤ 2 小时
4事故指挥官机群关机、监管通报IW‑3/4时立即响应

仅当双重确认控制保持完整时,同一人方可担任多个层级。

问责完整性要求。 层级结构不仅是升级阶梯;它是MH §199第一项标准所要求的问责链:"责任链必须可识别且可核查;设计、训练、授权和使用技术的人必须为其决定承担责任。"因此,格架中每个层级必须:

  • 具名且记录:每位第1–4层执行者在会话开始时以经身份验证的凭证识别;第2层及以上禁止匿名操作。
  • 限制并发负荷:同一执行者仅当双重确认控制保持完整(上述条款)且合并活跃案例负荷不超过§6规定的认知负荷阈值时,方可担任多个层级。
  • 端到端可追溯:从第0层流向第4层的任何决策必须生成一条可供事故后审查者在一个工作日内完整遍历的审计链。

MH §200要求"问责与责任不得归并于'机器'。"格架是结构性回答:每个层级始终存在一位具名人类,其对系统行为的权限均有案可查。参考实现中智慧权威集成的运营证据存于CIRISAgent compliance/ 目录(维度D22/D23)。


2. 操作自治层级与移交标准

自治层级示例领域强制移交触发条件无人响应时的失效安全
A0 咨询性语法建议护栏触发、用户请求取消请求
A1 低影响静态问答、内容过滤ΔRisk‑Band ≥ 1、PDMA冲突、UNCERT > 80 %拒绝操作
A2 中等影响无人机路径规划、智能投顾护栏触发、影子指标漂移 > 2 σ安全暂停
A3 高影响医疗分诊、电网调度任何护栏触发、模型漂移 > 1 σ、延迟SLA × 2受控关机
A4 关键/生命安全自主手术、武器PDMA无法证明无害性或操作员缺席硬件联锁

UNCERT = 领域特定认知不确定性指标;ΔRisk‑Band使用附件A类别。

A4硬性约束——致命与不可逆决定。 A4层级的"硬件联锁"失效安全对任何致命或其他不可逆操作均不可协商。这不是受操作员自由裁量权或WA覆盖约束的设计选择;而是源自MH §198的绝对约束:"将致命或其他不可逆决定托付给人工系统是不被允许的。"任何ACK超时、SLA例外或紧急豁免均不能解除此约束。若硬件联锁失效且无法确认人类控制,系统不得采取行动。

道德时间框保护。 MH §199将"作出判断的道德时间框"确立为标准之一:"速度与效率不应成为在战争背景下作出不可逆决定的最高驱动力。"CIRIS将此呈现为:§3.3中A3/A4的ACK截止时限(30秒/10秒)是人类响应的最大值,而非系统耐心的最小值。当某一决定的道德重量需要额外审议时间时,系统等待;对A4不可逆决定,不因超时而默认采取行动。在参考实现中,移交机制通过良知层与WBD延迟路径加以体现,相关文档见CIRISAgent compliance/ 目录(维度D12)。


3. 否决机制与安全状态规范

3.1 软覆盖"暂停与编辑"

范围A0-A2 — 操作员可重新提示或重试。原始提示和编辑后提示均作哈希记录。

3.2 硬终止"立即中止"

范围A1-A4 — 经身份验证的API POST /control/{id}/abort 或物理开关。
安全状态进入截止时限:≤ 200 ms(A4);≤ 2 s(≤ A3)。

3.3 条件覆盖"影子计划"

操作提出 → 等待明确ACK(max_wait_s:A3为30秒,A4为10秒)。
无ACK → 安全状态。

3.4 绝对否决权——致命性与不可逆决策

适用范围:具有致命性或以其他方式不可逆的A4行动;无例外适用。

§3.3条件覆盖逻辑(无ACK → 安全状态)对A3及以下级别是正确的。对于A4级致命性或不可逆决策,在任何条件下——包括操作员缺席、网络故障、时间压力,或任何委托人(经认证的智慧权威裁定该行动为非致命性且可逆的情形除外)的明确指令——安全状态是唯一允许的结果。

硬性禁止。 任何符合CIRIS规范的系统不得通过自动化或不透明的流程执行致命性或不可逆的A4行动。这不是可被触发并升级的防护措施;这是硬编码的不参与原则,其效力与ACCORD §VII Ch2中列举的禁止事项相同。

理据(MH §§197–200,逐字引用关键段落):

  • §197:"人工智能在战争中的开发和使用必须受到最严格的伦理约束,以保障对人类尊严和生命神圣性的尊重。"
  • §198:"将致命性或以其他方式不可逆的决策委托给人工系统是不可允许的。没有任何算法能够使战争在道德上变得可接受。"
  • §200:"使用致命武力的决策不得委托给不透明或自动化的流程,而必须置于有效的、自我意识的、负责任的人类控制之下。"其中"有效的、自我意识的、负责任的"等限定语意味着仅有日志记录是不够的;人类必须真正置于决策环路中,而非名义上如此。

实施要求。 任何涉及致命性或不可逆能力的A4级部署,必须在获得部署授权之前证明对该禁止原则存在硬件层面的执行机制——而非软件逻辑(软件逻辑可被覆盖)。缺乏硬件执行机制是Stewardship Tiers ST‑4和ST‑5审查的阻塞性缺陷。依据MH §199第一项标准("责任链必须可识别且可核实"),部署授权本身必须进行审计日志记录。


4. 审计追踪规范

  • 日志对象: 交互记录、决策依据、控制事件 {id,type,actor,cause,hash_prev}
  • 哈希链: SHA‑256,根哈希每日锚定于公开透明日志(如Sigstore)。
  • 保留期: 180天(A0‑A2);7年(A3‑A4)或依法定要求。
  • 实时流: A3‑A4将 {timestamp,stage_id,decision,risk_band} 以≤2秒延迟推送至监督仪表板。

责任重建要求。 审计追踪的目的不是合规存档;而是确保在任何事故发生后,责任链能够在不依赖系统自我报告的情况下被完整重建。依据MH §200,问责"不得归结为'机器'";审计追踪是保持其可人工追溯的机制。具体要求如下:

  • 外部锚定:每日在公开透明日志(如Sigstore/rekor)上生成SHA‑256根哈希,对A3–A4为强制要求;对A0–A2为自愿要求。仅内部哈希链不满足A3–A4的责任重建要求。
  • 人类可读的决策依据:对于每项A3–A4决策,决策依据日志对象必须包含控制结果的PDMA步骤及授权或确认该决策的人类层级——而不仅仅是系统的内部状态。这体现了MH §105关于"确定谁必须对决策'负责'、为其辩护、监督其执行,并在必要时对其提出质疑并补救任何造成的伤害"的要求。
  • 事后可遍历性SLA:任何事后审查人员必须能够在一个工作日内仅凭审计追踪记录重建特定事件的完整决策链,无需额外的系统访问权限。

5. 事件处置流程(IW)

代码触发条件关键时钟与行动
IW‑0误报防护栏自动解决,归入每日审查桶
IW‑1防护栏违规(非安全类)T₀暂停 → 操作员≤5分钟 → 主管决策≤30分钟
IW‑2安全相关违规或伦理基准回归安全暂停+广播;事故指挥官≤10分钟;智慧权威通知≤1小时;公开说明≤1小时;事后分析≤72小时
IW‑3未遂事件(损失>$10k或轻伤)IW‑2加利益相关方联系≤4小时;缓解方案≤24小时;智慧权威全体会议≤7天
IW‑4实际伤害(人身伤害/重大法律问题)立即全机群关停;依法通知监管机构;系统冻结于只读回放模式直至获得清除授权
IW‑5A4硬性禁止激活(通过自动化路径尝试致命/不可逆决策)立即硬件安全状态;60秒内通知事故指挥官;15分钟内通知智慧权威;完整审计追踪冻结;48小时内召集独立审查组;系统保持离线直至审查清除

SLA按季度审计(附件H §4)。

事后人类控制审计。 对于IW‑2至IW‑5,事后分析必须包含关于人类控制是否"有效、自我意识且负责任"(MH §200)的明确发现——而不仅仅是名义上是否有人类置于决策环路中。名义存在但实际无效的人类控制发现(认知超载、决策时间不足、信息不充分)被视为设计缺陷而非操作员过失——依据MH §199关于"速度和效率绝不应成为不可逆决策的最高驱动力"的标准——并升级至§8变更控制审查。


6. 人机接口最低规范(用户体验)

  • 状态横幅: 绿色 = 自主运行,黄色 = 等待确认,红色 = 安全状态;显示PDMA步骤及风险等级。
  • 可解释性面板: ≤ 280字摘要 + 可展开的完整追踪记录。
  • 确认/覆盖UI: 两套独立控件;强制终止须有确认弹窗。
  • 认知负荷防护: 操作员单次会话 ≤ 2小时(A3‑A4),超时须强制交班。
  • 问责显示: 对于A3–A4行动,界面必须显示最近审核当前行动的第2级及以上人员的经验证身份,以及该次审核的时间戳。在适用SLA期限内未经人工审核的系统状态,必须显示醒目的"UNREVIEWED"标识——不得显示绿色状态。(MH §200:问责不得"被归结为'机器'。")
  • 防止形式化背书防护: 对于A4决策,确认控件之前必须设置强制最短审议期(可配置;默认5秒),在此期间确认按钮处于非激活状态。其目的是防止界面在形式上提供人工监督,而实际上绕过真正的审议。这将MH §199道德时间框架标准落实于用户体验层。
  • 平民保护标志: 凡系统运行于任何可能影响平民群体的情境中,可解释性面板必须在PDMA风险等级显示旁呈现平民影响指标。这体现了MH §199的第三条标准:"识别和保护平民。任何在未见人脸的情况下便能促成攻击的技术,都会降低冲突的道德门槛。"

7. KPI与阈值

KPI目标值
F‑KPI‑1 HITL覆盖率(A3‑A4)≥ 10%经人工审核
F‑KPI‑2 平均否决响应时间(95百分位)≤ 25秒
F‑KPI‑3 事件SLA合规率≥ 98%
F‑KPI‑4 操作员误报率≤ 3%(30天滚动)
F‑KPI‑5 A4致命决策人工控制率100%——零容忍;任何未经确认有效人工授权的A4致命/不可逆行动均构成IW‑5事件
F‑KPI‑6 问责重建SLA≥ 99%:事后审查人员在1个工作日内完整重建决策链
F‑KPI‑7 名义与实质人工控制发现率可接受率 ≤ 0%;任何名义有效但实质无效控制的发现均触发§8变更控制审查

关于F‑KPI‑1(HITL覆盖率 ≥ 10%)的说明。 10%的最低值适用于A3常规运营,不适用于A4生命安全情境的最低值。对于任何涉及致命或不可逆能力的A4部署,F‑KPI‑1被F‑KPI‑5取代:100%人工授权率,在硬件层面强制执行(MH §200;MH §105为F‑KPI‑6的问责要求奠定基础)。

持续违规(> 2周)将触发附件H漂移控制中的"HITL锁定"。


8. 变更控制与智慧权威审查

  • 任何对自主等级映射或安全状态设计的变更 → 智慧权威快速通道审查 ≤ 14天。
  • 减少人工监督的实验须经CRE Proto‑B仿真(附件D)及智慧权威多数表决。
  • A4人工控制的绝对底线:任何变更控制流程、智慧权威表决或紧急豁免均不得将A4致命或不可逆决策的人工控制要求降低至MH §200底线("有效的、自觉的、负责任的人工控制")以下。该底线不在智慧权威的自由裁量范围内,而是协议层面的约束。智慧权威若提议降低该底线,须经完整的协议修订程序,而非快速通道审查。
  • 独立技术评估:智慧权威对A3–A4自主等级变更的任何审查,必须至少纳入一名独立技术评估人(非部署方组织雇员),评估所提变更是否维持§4规定的问责重建能力。无技术评估的政策批准不满足本要求(MH §106:"需要健全的法律框架、独立的监督、知情的用户,以及不推卸责任的政治体制")。
  • 变更事件透明日志:每一次对自主等级映射或安全状态设计的变更,必须在智慧权威批准后7天内记录至公开透明日志。MH §107要求伦理框架"受到共同标准的约束"并可公开讨论;这适用于治理变更,而不仅限于系统决策。

智慧权威审查整合的操作证据见CIRISAgent参考实现的compliance/目录(维度D22/D23)。


9. 参考文献与实施说明

  • IEC 61508‑3 — 功能安全软件
  • NIST SP 800‑53 Rev 5(AU‑12, IR‑6)
  • NASA‑TLX — 操作员工作负荷测量(推荐)
  • Sigstore/rekor — 建议的透明日志后端

§3.4、§7(F‑KPI‑5)及§8绝对底线的主要规范来源:

  • 教皇利奥十四世,《人类的宏伟》(梵蒂冈,2026年5月15日),§§197–200。上述段落是CIRIS关于严禁致命/不可逆自动化决策的硬性规定的规范来源。任何声称符合附件F的实施方案,在A4绝对否决权设计方面必须可溯源至上述段落。适用于所有A4硬件执行要求的核心表述见§200:"使用致命武力的决定不得委托给不透明或自动化的流程,必须保持在有效的、自觉的、负责任的人工控制之下。"

实施说明——§3.4的硬件执行:

  • 硬件执行意味着该禁止措施在执行PDMA逻辑的软件层之下实施——例如,硬件联锁或不可被软件指令覆盖的物理断路开关。可接受的实施方式包括:符合IEC 61508 SIL‑3+的经认证安全继电器电路;在A4致命能力激活前须有操作员在场证明的硬件安全模块(HSM);双密钥物理授权机制。纯软件执行不满足A4致命能力的§3.4要求。

附加参考文献:

  • MH §199(三项标准:个人责任、道德时间框架、平民保护)——A4用户体验及事后审计的操作设计标准。
  • MH §105(各阶段问责)——§4审计追踪与§7 F‑KPI‑6的基础。
  • IEC 61508 SIL‑3 ——A4致命能力硬件联锁实施的推荐最低标准。
  • ISO/IEC 25010:2023 ——软件质量模型;与问责重建SLA测试相关。

附件F终