Esta página foi traduzida por máquina. Se algo parecer errado, abra um issue — o repositório é público por uma razão. Reportar um problema de tradução

voltar ao lobby

O panorama do superalinhamento

A maior parte do campo está alinhando o modelo. CIRIS está construindo as instituições ao redor dele.

Existem dois caminhos honestos para tornar a IA poderosa segura. Um é treinar os valores do modelo até que você confie neles. O outro é assumir que o modelo pode estar errado e tornar o que ele faz responsável, de forma aberta, perante pessoas e sistemas que qualquer um pode verificar. CIRIS segue o segundo caminho. Aqui está todo o panorama, mapeado com honestidade, e onde nos encaixamos nele.

01Alinhamento

Confiar nos pesos ou verificar o comportamento

A linha principal da segurança em IA tenta tornar o modelo bom por dentro: treinar seus valores, estudar seus pensamentos, fazê-lo debater consigo mesmo. Esse trabalho importa. CIRIS aposta no outro caminho. Assume que um modelo capaz pode estar desalinhado e, em vez de confiar na sua mente, torna suas ações consequentes responsáveis perante pessoas e outros sistemas que podem verificá-las.

Nos próprios termos do campo, CIRIS está no ramo institucional e de controle, ao lado do controle de IA e da IA de segurança garantida, não na linha principal de internalização de valores de RLHF, IA Constitucional, debate e interpretabilidade. Sua resposta para a supervisão escalável, como supervisionar algo mais inteligente do que você, é verificar o envelope de responsabilidade, não o raciocínio. Uma assinatura, um quórum, uma auditoria encadeada por hash continuam baratos de verificar mesmo quando a decisão por trás deles é sobre-humana. Alinha sistemas de muitos agentes capazes ao longo do tempo, não os valores de uma única mente.

Não tenta alinhar uma IA todo-poderosa. De propósito.

Responsabilidade precisa de mais de uma parte. Alguém a quem responder. Uma forma de verificação que não pode ser silenciosamente absorvida. Um equilíbrio de poder que nenhum lado pode capturar. Uma super-inteligência única não tem nada disso, então não há forma honesta de responsabilizá-la. CIRIS foi construído para o outro futuro: muitos agentes capazes, pessoas e organizações cujas decisões consequentes são todas verificáveis de forma independente.

Então a posição é explícita. Um ASI singular não é um sistema a ser alinhado, mas uma condição a ser prevenida. Concentrar capacidade sobre-humana em um único lugar sem responsabilização, neste estágio do desenvolvimento institucional humano, é ilegítimo, porque nenhuma instituição está madura o suficiente para responsabilizá-lo, o que é precisamente o perigo. Nos próprios termos do framework, um singleton é o colapso de voz única ρ→1 que o modelo de corredor nomeia como uma falha de coordenação, não um sucesso. Que nossas garantias se mantenham em uma federação e se enfraqueçam contra um singleton não é uma lacuna que estamos corrigindo. É o regime que nos recusamos a legitimar, mantido como um compromisso, não apenas uma previsão.

02IA do Consumidor

Como se compara à IA que você usa de verdade

Os assistentes do dia a dia são poderosos e fáceis de usar. Eles também rodam na nuvem de outra pessoa, não guardam nenhum registro que você possa verificar, e não respondem a ninguém que você possa nomear. Aqui está o mesmo teste de responsabilidade, aplicado à IA que a maioria das pessoas abre todo dia.

AssistentePrincípios publicadosProva do que fezPergunta a um humano quando tem dúvidaCódigo abertoVerificação de câmara de eco
ChatGPTSimNãoNãoNãoNão
GeminiSimNãoNãoNãoNão
ClaudeSimNãoNãoNãoNão
CIRISSimSimSimSimSim

Comparado com base no comportamento público do produto em junho de 2026. Cada link de princípios leva à especificação publicada pela própria empresa.

Experimente Você Mesmo

CIRISsafe by structure · open by principle · kind by design