一项完全覆盖,九项部分覆盖,没有一项是含糊带过的。一个声称十项全部覆盖的页面,恰恰就是我们告诫你不要轻信的那种营销话术。下面的覆盖等级经过了一位专职挑刺的独立质疑者的审查,在防御机制存在于底层系统、但已部署的智能体尚未继承它的地方,我们也在对应行中如实说明。
| 风险 | 覆盖等级 | CIRIS 如何应对 |
|---|---|---|
| ASI01 智能体目标劫持 | 部分覆盖 | 多层防御:对导入的技能和消息进行提示注入扫描,视觉注入隔离(良知评估器永远不会接触原始图像字节),以及在每个最终动作触发前,由良知处理流程重新核对该动作是否符合用户最初的意图。差距:输入扫描基于模式匹配,并未在形式上将检索到的数据与指令严格区分开。 |
| ASI02 工具滥用 | 部分覆盖 | CIRISServer 提供一份能力动词允许/拒绝清单,并配有服务器强制执行的绝不允许清单,在操作执行前进行检查,因此被委派的智能体无法调用未获授权的破坏性操作。注意事项:这目前只保护了基础设施层,尚未对已部署智能体自身的大语言模型工具调用进行门控,智能体层面的继承是规划中的阶段。 |
| ASI03 身份与权限滥用 | 部分覆盖 | 底层系统中的权限是限定范围的、可委派的、可撤销的:约束条件记录在带签名的关系边中,一份绝不允许清单阻止重新委派最高权限以防止权限升级,批准只能收紧而不能放宽,并且可以即时撤销。注意事项:目前只在基础设施的所有者操作层面强制执行,已部署智能体的继承是规划中的阶段。 |
| ASI04 智能体供应链 | 部分覆盖 | 通过 CIRISVerify 的后量子签名模块清单(对完整文件树哈希进行 Ed25519 + ML-DSA-65 签名)来保证构建完整性,并为联邦化组件提供带签名、经认证的身份。差距:覆盖的是 CIRIS 自身的构建和模块链,而非任意的第三方 MCP 服务器。 |
| ASI05 意外代码执行 | 部分覆盖 | 语义层的良知门控(熵值、连贯性、优化否决)会在每个工具动作触发前运行,遇到不确定情况时交由人类裁决。差距:这是语义层面的审查,而不是确定性的代码沙箱。 |
| ASI06 记忆与上下文污染 | 部分覆盖 | 每一次写入图谱记忆的操作都是一个受治理、经过良知检查的动作,写入一个限定范围、有版本控制的图谱中,而不是一个悄然发生的副作用,因此一次污染性写入本身就是一个可审计的决策。差距:对检索内容的信任评分尚不完整。 |
| ASI07 不安全的智能体间通信 | 部分覆盖 | CIRISEdge 通过一套七步流程验证每一条智能体间消息,最后以 Ed25519 + ML-DSA-65 混合签名验证结束(大小上限、类型化反序列化、模式允许清单、目标密钥检查、重放窗口)。差距:联邦传输层仍在建设中。 |
| ASI08 级联故障 | 完全覆盖 | 在三个独立层面加以约束:围绕高风险调用的按服务熔断器(关闭/打开/半开),良知处理流程在不良动作扩散之前将其拦停,以及在 50 至 400 个节点范围内实测为零跨组泄漏的网状隔离。 |
| ASI09 人机信任滥用 | 部分覆盖 | 良知处理流程会在人类审阅者看到之前,对智能体自身的解释性文字(包括呈现给人类审阅者的理由)进行过度自信和操纵性倾向的评分。差距:审查所用的模型与被审查的模型属于同一系列。 |
| ASI10 流氓智能体 | 部分覆盖 | 三层防护:六重良知在每个有实际后果的动作执行前进行门控,哈希链式签名的审计轨迹使事后隐瞒行为可被发现,以及故障安全型紧急停止开关让指定的人能够停止一个偏离对齐的智能体。差距:发现那种细微偏离但表面依然连贯一致的智能体,本质上是有限的。 |
OWASP 智能体应用十大风险,发布于2025年12月。截至2026年7月对应到 CIRIS;如果某个单元格有误,请告诉我们,我们会修正。
来源
- ASI01 智能体目标劫持CIRISAgent skill-import SECURITY.md + conscience pipeline
- ASI02 工具滥用CIRISServer auth/gate.rs + DELEGATION_CONSTRAINTS.md (shipped 0.5.72)
- ASI03 身份与权限滥用CIRISServer auth/gate.rs (never-list, tighten-only) + adoption plan
- ASI04 智能体供应链CIRISVerify Threat Model, §3.4 Supply Chain
- ASI05 意外代码执行CIRISAgent conscience/core.py (semantic action gates)
- ASI06 记忆与上下文污染CIRISAgent ciris_engine (governed graph memory)
- ASI07 不安全的智能体间通信CIRISEdge README (verify-before-dispatch pipeline)
- ASI08 级联故障CIRISAgent circuit_breaker.py + CIRISServer measured mesh isolation
- ASI09 人机信任滥用CIRISAgent epistemic-humility conscience prompt
- ASI10 流氓智能体CIRISVerify HUMANITY_ACCORD kill switch + conscience pipeline
这套分类体系只是一个视角。看看 CIRIS 在人工智能问责的各种方法中处于什么位置,以及紧急停止开关是如何可被独立验证的。