Una completa, nueve parciales, ninguna exagerada. Una página que afirmara cubrir las diez sería exactamente el marketing del que te decimos que desconfíes. Los niveles de cobertura a continuación sobrevivieron a un escéptico independiente cuyo trabajo era derribarlos, y cuando una defensa vive en el sustrato pero el agente desplegado todavía no la ha heredado, lo decimos en la fila.
| Riesgo | Cobertura | Cómo lo aborda CIRIS |
|---|---|---|
| ASI01 Secuestro del objetivo del agente | Parcial | Defensa en profundidad: escaneo de inyección de prompts en habilidades y mensajes importados, aislamiento de inyección visual (los evaluadores de conciencia nunca ven los bytes de imagen sin procesar), y una canalización de conciencia que vuelve a verificar cada acción resultante frente a la intención original del usuario antes de ejecutarla. Brecha: el escaneo de entrada se basa en patrones y no separa formalmente los datos recuperados de las instrucciones. |
| ASI02 Uso indebido de herramientas | Parcial | CIRISServer incluye una lista de permisos y denegaciones de verbos de capacidad con una lista de "nunca" aplicada por el servidor, verificada antes de que se ejecute una operación, de modo que un agente delegado no puede invocar una operación destructiva que no se le otorgó. Advertencia: esto protege hoy la capa de tejido y todavía no controla las propias llamadas a herramientas del LLM del agente desplegado; la herencia del agente es una fase planificada. |
| ASI03 Abuso de identidad y privilegios | Parcial | Autoridad delimitada, delegada y revocable en el sustrato: restricciones transportadas en bordes firmados, una lista de "nunca" que bloquea la redelegación de los poderes más altos para que la autoridad no pueda escalar, aprobación de solo restricción y revocación instantánea. Advertencia: se aplica hoy en la superficie de operaciones del propietario del tejido; la herencia del agente desplegado es una fase planificada. |
| ASI04 Cadena de suministro agéntica | Parcial | Integridad de compilación mediante los manifiestos de módulo firmados poscuánticamente de CIRISVerify (Ed25519 + ML-DSA-65 sobre un hash completo del árbol de archivos), más identidad firmada y certificada para los componentes federados. Brecha: cubre la propia cadena de compilación y módulos de CIRIS, no servidores MCP arbitrarios de terceros. |
| ASI05 Ejecución de código inesperada | Parcial | Las puertas de conciencia semántica (entropía, coherencia, veto de optimización) se ejecutan en cada acción de herramienta antes de que se dispare, y la incertidumbre se remite a una persona. Brecha: esto es una revisión semántica, no un entorno aislado de código determinista. |
| ASI06 Envenenamiento de memoria y contexto | Parcial | Cada escritura en la memoria de grafo es una acción gobernada y verificada por la conciencia dentro de un grafo delimitado y versionado, no un efecto secundario silencioso, de modo que una escritura envenenada es en sí misma una decisión auditable. Brecha: la puntuación de confianza del contenido recuperado es parcial. |
| ASI07 Comunicación insegura entre agentes | Parcial | CIRISEdge verifica cada mensaje entre agentes mediante una canalización de siete pasos que termina en la verificación de firma híbrida Ed25519 + ML-DSA-65 (límite de tamaño, deserialización tipada, lista de permisos de esquema, comprobación de clave de destino, ventana antirreproducción). Brecha: el transporte de la federación todavía se está construyendo. |
| ASI08 Fallos en cascada | Completa | Acotado en tres capas independientes: interruptores de circuito por servicio (cerrado / abierto / semiabierto) alrededor de las llamadas riesgosas, la canalización de conciencia que detiene una acción errónea antes de que se propague, y aislamiento de malla medido en cero fugas entre grupos a lo largo de 50 a 400 nodos. |
| ASI09 Explotación de la confianza humano-agente | Parcial | La canalización de conciencia puntúa el propio texto explicativo del agente, incluida la razón mostrada a un revisor humano, en busca de exceso de confianza y manipulación antes de que un humano lo vea. Brecha: audita con la misma familia de modelos que está revisando. |
| ASI10 Agentes descontrolados | Parcial | Tres capas: seis conciencias controlan cada acción con consecuencias antes de que se ejecute, un registro de auditoría firmado y encadenado por hash hace detectable el encubrimiento a posteriori, y el interruptor de apagado con fallo seguro permite que personas designadas detengan a un agente desalineado. Brecha: detectar a un agente sutilmente desalineado pero coherente tiene límites inherentes. |
OWASP Top 10 para aplicaciones agénticas, publicado en diciembre de 2025. Mapeado a CIRIS a partir de julio de 2026; dinos si una celda está mal y la corregiremos.
Fuentes
- ASI01 Secuestro del objetivo del agenteCIRISAgent skill-import SECURITY.md + conscience pipeline
- ASI02 Uso indebido de herramientasCIRISServer auth/gate.rs + DELEGATION_CONSTRAINTS.md (shipped 0.5.72)
- ASI03 Abuso de identidad y privilegiosCIRISServer auth/gate.rs (never-list, tighten-only) + adoption plan
- ASI04 Cadena de suministro agénticaCIRISVerify Threat Model, §3.4 Supply Chain
- ASI05 Ejecución de código inesperadaCIRISAgent conscience/core.py (semantic action gates)
- ASI06 Envenenamiento de memoria y contextoCIRISAgent ciris_engine (governed graph memory)
- ASI07 Comunicación insegura entre agentesCIRISEdge README (verify-before-dispatch pipeline)
- ASI08 Fallos en cascadaCIRISAgent circuit_breaker.py + CIRISServer measured mesh isolation
- ASI09 Explotación de la confianza humano-agenteCIRISAgent epistemic-humility conscience prompt
- ASI10 Agentes descontroladosCIRISVerify HUMANITY_ACCORD kill switch + conscience pipeline
La taxonomía es una perspectiva. Consulta dónde se sitúa CIRIS entre todos los enfoques de rendición de cuentas en IA, y cómo el interruptor de apagado es verificable de forma independiente.