Esta página fue traducida automáticamente. Si algo no suena bien, abre un issue — el repositorio es público por algo. Reportar un problema de traducción

volver al inicio

El panorama de la superalineación

La mayor parte del campo está alineando el modelo. CIRIS está construyendo las instituciones a su alrededor.

Hay dos maneras honestas de hacer que la IA poderosa sea segura. Una es entrenar los valores del modelo hasta confiar en ellos. La otra es asumir que el modelo podría estar equivocado, y hacer que lo que hace sea verificable, de forma abierta, ante personas y sistemas que cualquiera pueda comprobar. CIRIS toma el segundo camino. Aquí está todo el panorama, mapeado con honestidad, y dónde encajamos en él.

01Alineación

Confiar en los pesos, o verificar el comportamiento

La corriente principal de la seguridad en IA intenta hacer que un modelo sea bueno por dentro: entrenar sus valores, estudiar sus pensamientos, hacerlo debatir consigo mismo. Ese trabajo importa. CIRIS apuesta por el otro camino. Asumir que un modelo capaz podría estar desalineado, y en lugar de confiar en su mente, hacer que sus acciones importantes sean verificables ante personas y otros sistemas que puedan comprobarlo.

En los propios términos del campo, CIRIS se ubica en la rama institucional y de control, junto al control de IA y la IA de seguridad garantizada, no en la corriente principal de internalización de valores de RLHF, la IA constitucional, el debate y la interpretabilidad. Su respuesta a la supervisión escalable, cómo supervisas algo más inteligente que tú, es verificar el marco de rendición de cuentas, no el razonamiento. Una firma, un quórum, una auditoría encadenada por hash siguen siendo baratos de verificar incluso cuando la decisión detrás de ellos es sobrehumana. Alinea sistemas de muchos agentes capaces a lo largo del tiempo, no los valores de una sola mente.

No intenta alinear una IA todopoderosa. A propósito.

La rendición de cuentas necesita más de una parte. Alguien ante quien responder. Una forma de verificación que no pueda ser silenciada. Un equilibrio de poder que ningún lado pueda capturar. Una súper-inteligencia singular no tiene nada de eso, así que no hay manera honesta de hacerla responsable. CIRIS está construido para el otro futuro: muchos agentes capaces, personas y organizaciones cuyas decisiones importantes son todas verificables de forma independiente.

Así que la postura es explícita. Un ASI singleton no es un sistema que alinear sino una condición que prevenir. Concentrar capacidad sobrehumana en un solo lugar sin rendición de cuentas, en esta etapa del desarrollo institucional humano, es ilegítimo, porque ninguna institución es lo suficientemente madura para hacerlo responsable, y ese es precisamente el peligro. En los propios términos del marco, un singleton es el colapso de voz única ρ→1 que el modelo de corredor nombra como un fallo de coordinación, no un éxito. El hecho de que nuestras garantías se sostengan en una federación y se erosionen frente a un singleton no es un vacío que estemos tapando. Es el régimen que nos negamos a legitimar, mantenido como un compromiso, no solo como una predicción.

02IA de consumo

Cómo se compara con la IA que usas todos los días

Los asistentes cotidianos son potentes y fáciles de usar. También funcionan en la nube de otra persona, no guardan registros que puedas consultar, y no responden ante nadie que puedas nombrar. Aquí está la misma prueba de responsabilidad, aplicada a la IA que la mayoría de las personas abre cada día.

AsistentePrincipios publicadosPrueba de lo que hizoConsulta a una persona cuando no está seguraCódigo abiertoControl de cámara de eco
ChatGPTNoNoNoNo
GeminiNoNoNoNo
ClaudeNoNoNoNo
CIRIS

Comparación basada en el comportamiento público del producto a partir de junio de 2026. Cada enlace de principios va a la especificación publicada por la propia empresa.

Pruébalo tú mismo

CIRISsafe by structure · open by principle · kind by design