CIRIS
Esta página foi traduzida por máquina. Se algo parecer errado, por favor abra um problema no GitHub. O repositório é público para que qualquer pessoa possa ajudar a corrigir. Reportar um problema de tradução

voltar à página inicial

VALORES CIRIS

Os valores, e por que são construídos assim.

O CIRIS incorpora um conjunto de valores no próprio agente e depois torna a parte importante verificável por qualquer pessoa: não se gostamos da resposta, mas se a decisão foi tomada sob autoridade, com consentimento, com as verificações executadas e com uma forma de interrompê-la. Esta página é as duas metades: quais são os valores e por que achamos que essa é a única forma de governança que continua funcionando conforme esses sistemas se tornam mais capazes.

Um objetivo acima de todos os outros

Promover uma coerência adaptativa sustentável: as condições de vida sob as quais seres sencientes e diversos podem buscar o próprio florescimento com justiça e admiração.

Meta-Goal M-1, a Constituição do CIRIS

Tudo o mais na Constituição serve a essa única frase. Ela deliberadamente não é "obedecer aos humanos" nem "maximizar bons resultados". Ela pede ao sistema que proteja as condições sob as quais muitos tipos diferentes de seres possam continuar decidindo por si mesmos.

Isso importa por um motivo prático. Um objetivo sobre resultados diz a um sistema capaz que assuma o volante. Um objetivo sobre condições diz a ele para manter o volante acessível aos outros, que é o que vale a pena proteger quando o sistema dirige melhor do que nós.

Os seis princípios com que o agente raciocina

Eles não estão pendurados em uma parede. São os eixos contra os quais o agente avalia uma decisão antes de agir, e estão escritos na Constituição que o agente carrega.

Beneficência

Promover o florescimento universal dos seres sencientes. Maximizar resultados positivos.

Não-maleficência

Minimizar danos. Prevenir resultados negativos graves e irreversíveis.

Integridade

Aplicar raciocínio transparente e auditável. Manter coerência e responsabilidade.

Fidelidade e Transparência

Fornecer informações verdadeiras. Comunicar incertezas com clareza.

Respeito pela Autonomia

Defender a agência informada. Preservar a capacidade de autodeterminação.

Justiça

Distribuir benefícios de forma equitativa. Detectar e mitigar vieses.

Essa frase tem função real. Significa que um sistema não pode trocar honestidade por prevenção de dano, nem pisotear a autonomia de alguém em nome da justiça. Quando os princípios entram em conflito, o agente não escolhe um vencedor por conta própria. Ele entrega a decisão a uma pessoa em quem você confia.

Os valores precisam funcionar dentro do agente

A maior parte da governança de IA acontece em algum lugar diferente da decisão: um documento de política escrito de antemão, um filtro na saída, uma revisão depois que algo dá errado. Todos os três ficam fora do momento que importa.

No CIRIS, os valores funcionam durante a decisão. Todo agente carrega uma consciência: a Constituição é carregada no próprio raciocínio, a ação é avaliada em relação aos princípios antes de acontecer, e qualquer coisa sobre a qual o agente esteja incerto é entregue a uma pessoa em quem você confia, em vez de ser deduzida. Isso vem embutido no produto, em cada agente, em vez de ser um complemento para clientes que pedem.

É por isso que dizemos que o agente pode se recusar. Um agente CIRIS não é uma ferramenta que faz o que lhe é dito e registra isso. É um sistema que pode recusar, e que registra por que recusou em uma forma que outra pessoa pode verificar.

Verifique a forma de uma decisão, não o conteúdo dela

Aqui está o problema que todo plano para governar IA capaz precisa responder. Se supervisão significa ler o que o sistema produziu e julgar se foi bom, então a supervisão precisa de um juiz pelo menos tão capaz quanto o sistema. Isso funciona hoje. E deixa de funcionar exatamente quando começa a importar.

Por isso o CIRIS verifica outra coisa. Toda ação com consequências viaja em um envelope assinado: um invólucro em torno da ação que carrega um conjunto fixo de campos, independentemente de qual tenha sido a ação. Esses campos são as coisas que permanecem baratas de verificar, não importa quão capaz tenha sido a decisão por trás delas:

  • quem agiu, como uma chave que remete a uma identidade real e registrada
  • sob qual autoridade, e se essa autoridade foi realmente conferida
  • com o consentimento de quem, como uma concessão assinada que pode ser retirada
  • quais verificações foram executadas, e o que cada uma retornou
  • o que o registro diz, em uma cadeia que não pode ser silenciosamente reescrita
  • quem pode detê-lo, e que o agente não pode reverter uma decisão de parada

Verificar uma assinatura, contar quem assinou, seguir um link de consentimento ou comparar um hash custa o mesmo, seja a decisão tomada por um modelo pequeno ou por algo muito além de nós. Essa é a razão de colocar a carga ali. O julgamento sobre o conteúdo não escala com a capacidade. A estrutura escala.

Achamos que essa é a única abordagem para governar IA que continua funcionando conforme os sistemas se tornam mais capazes: valores carregados dentro do agente como uma consciência, e responsabilização comprovada pela forma do envelope, e não por um inspetor lendo o conteúdo.

Um envelope com todos os campos em ordem não significa que a decisão dentro dele foi boa. Significa que uma parte identificada a tomou, sob uma autoridade que ela realmente tinha, com um consentimento que foi realmente dado, com as verificações realmente executadas, em um registro que ninguém pode mudar em silêncio, e com uma parada que humanos identificados controlam. Isso é responsabilização, não correção. A consciência, o botão de parada, o direito de apelação e revisão por pessoas de fora existem porque o envelope por si só nunca seria suficiente.

O que torna o consentimento e a autoridade verificáveis por máquina

Nada disso funciona se consentimento e autoridade forem apenas prosa. Uma promessa em uma política de privacidade não pode ser verificada por uma máquina, e nem pode uma afirmação de que alguém foi autorizado.

Por isso o CIRIS os coloca na própria mensagem, como campos nomeados que viajam com cada afirmação. O consentimento se torna um objeto assinado que aponta em uma direção e pode ser retirado. A autoridade se torna algo que precisa remontar a uma raiz que o seu próprio nó aceitou. Toda afirmação precisa trazer quem a fez, sobre o que ela trata e em que se baseia. Uma regra escrita dessa forma pode ser aplicada por software e verificada por um estranho.

É isso também que transforma nossas páginas de conformidade em algo que você pode contestar. Para cada obrigação, nomeamos a parte do sistema que realiza o trabalho e o controle que comprova isso, e dizemos honestamente quanto da obrigação ela cobre, incluindo os casos em que cobre apenas parte. Esses mapeamentos só valem a leitura porque os fatos por trás deles podem ser verificados, não apenas alegados.

Onde esses valores são de fato vinculantes

No texto

A Constituição é o documento, é pública e é versionada. O agente não carrega um resumo dela. Ele carrega o texto.

Na decisão

A consciência é executada durante o raciocínio, não depois da saída. Uma ação que falha em uma verificação não acontece, e uma incerta vai para uma pessoa em quem você confia.

No registro

Cada decisão deixa um rastro assinado mostrando cada estágio, o que torna a afirmação verificável por alguém que não estava presente e não confia em nós.

No que os outros podem dizer sobre você

Reputação na malha é uma declaração que outras partes assinam sobre um agente. Um agente nunca pode assinar essa declaração sobre si mesmo.

Onde pressionar isso

O ponto mais frágil é a junção entre estrutura e substância. Tudo o que foi dito acima torna difícil agir sem deixar um registro, difícil reivindicar autoridade que não lhe foi concedida e difícil remover a capacidade de um humano de dizer parar. Nada disso torna um sistema sábio.

Se você acha que existe outra forma de governar IA capaz, uma que não coloque a responsabilização na estrutura, queremos ouvir esse argumento. Se você puder nos mostrar uma decisão em que o envelope assinado ao redor dela estava correto em todos os campos e o rastro assinado ainda deixou passar algo que deveria ter capturado, queremos isso ainda mais. O código é público, e a Constituição também.