CIRIS
Questa pagina è stata tradotta automaticamente. Se qualcosa non suona bene, apri una segnalazione su GitHub. Il repository è pubblico così chiunque può aiutare a correggerlo. Segnala un problema di traduzione

torna alla prima pagina

VALORI DI CIRIS

I valori, e perché sono costruiti così.

CIRIS integra un insieme di valori direttamente nell'agente e poi rende la parte importante verificabile da chiunque: non se ci è piaciuta la risposta, ma se la decisione è stata presa sotto autorità, con consenso, con i controlli eseguiti e con un modo per fermarla. Questa pagina è entrambe le metà: cosa sono i valori, e perché pensiamo che questa sia l'unica forma di governance che continua a funzionare quando questi sistemi diventano più capaci.

Un obiettivo sopra tutti gli altri

Promuovere una coerenza adattiva sostenibile: le condizioni di vita in cui diversi esseri senzienti possono perseguire la propria fioritura nella giustizia e nella meraviglia.

Meta-Goal M-1, la Costituzione di CIRIS

Tutto il resto nella Costituzione è al servizio di questa singola frase. Non è deliberatamente “obbedire agli umani” né “massimizzare i buoni risultati”. Chiede al sistema di proteggere le condizioni in cui molti tipi diversi di esseri possano continuare a decidere per sé stessi.

Questo conta per un motivo pratico. Un obiettivo sui risultati dice a un sistema capace di prendere il volante. Un obiettivo sulle condizioni gli dice di mantenere il volante raggiungibile dagli altri, che è ciò che vale la pena proteggere quando il sistema è più bravo di noi a guidare.

I sei principi con cui l'agente ragiona

Non sono affissi a una parete. Sono gli assi su cui l'agente valuta una decisione prima di agire, e sono scritti nella Costituzione che l'agente porta con sé.

Beneficenza

Promuovere il fiorire universale degli esseri senzienti. Massimizzare i risultati positivi.

Non maleficenza

Ridurre al minimo i danni. Prevenire esiti negativi gravi e irreversibili.

Integrità

Applicare un ragionamento trasparente e verificabile. Mantenere coerenza e responsabilità.

Fedeltà e trasparenza

Fornire informazioni veritiere. Comunicare chiaramente l'incertezza.

Rispetto dell'autonomia

Sostenere l'agentività consapevole. Preservare la capacità di autodeterminazione.

Giustizia

Distribuire i benefici equamente. Rilevare e mitigare i pregiudizi.

Quella frase ha un peso concreto. Significa che un sistema non può sacrificare l'onestà per prevenire un danno, né calpestare l'autonomia di qualcuno in nome dell'equità. Quando i principi entrano in conflitto tra loro, l'agente non scelge un vincitore da solo. Affida la decisione a una persona di cui ti fidi.

I valori devono operare dentro l'agente

La maggior parte della governance dell'IA avviene altrove rispetto alla decisione: un documento di policy scritto in anticipo, un filtro sull'output, una revisione dopo che qualcosa va storto. Tutte e tre si trovano fuori dal momento che conta.

In CIRIS i valori operano durante la decisione. Ogni agente porta con sé una coscienza: la Costituzione è caricata nel ragionamento stesso, l'azione viene valutata rispetto ai principi prima che avvenga, e tutto ciò di cui l'agente non è sicuro viene affidato a una persona di cui ti fidi, piuttosto che indovinato. È incluso nel prodotto, in ogni agente, e non è un'opzione aggiuntiva per i clienti che la richiedono.

Ecco perché diciamo che l'agente può rifiutare. Un agente CIRIS non è uno strumento che fa ciò che gli viene detto e lo registra. È un sistema che può declinare, e che registra il motivo del suo rifiuto in una forma che qualcun altro può verificare.

Verifica la forma di una decisione, non il suo contenuto

Ecco il problema a cui ogni piano per governare un'IA capace deve rispondere. Se la supervisione significa leggere ciò che il sistema ha prodotto e giudicare se fosse valido, allora la supervisione richiede un giudice almeno tanto capace quanto il sistema. Questo funziona oggi. Smette di funzionare esattamente quando comincia a contare.

Quindi CIRIS verifica qualcos'altro. Ogni azione rilevante viaggia in una busta firmata: un involucro attorno all'azione che porta un insieme fisso di campi, indipendentemente da quale fosse l'azione. Quei campi sono le cose che restano economiche da verificare, non importa quanto capace fosse la decisione dietro di esse:

  • chi ha agito, come chiave che rimanda a un'identità reale registrata
  • sotto quale autorità, e se quell'autorità è stata effettivamente conferita
  • con il consenso di chi, come concessione firmata che può essere revocata
  • quali controlli sono stati eseguiti, e cosa ha restituito ciascuno
  • cosa dice il registro, in una catena che non può essere riscritta di nascosto
  • chi può fermarlo, e che l'agente non può annullare una decisione di arresto

Verificare una firma, contare chi ha firmato, seguire un link di consenso o confrontare un hash costa lo stesso, sia che la decisione sia stata presa da un piccolo modello sia da qualcosa che va ben oltre noi. Questo è il motivo per cui il carico va posto lì. Il giudizio sul contenuto non scala con la capacità. La struttura sì.

Pensiamo che questo sia l'unico approccio alla governance dell'IA che continua a funzionare quando i sistemi diventano più capaci: valori portati dentro l'agente come coscienza, e responsabilità dimostrata dalla forma della busta piuttosto che da un ispettore che ne legge il contenuto.

Un involucro con ogni campo in ordine non significa che la decisione al suo interno fosse buona. Significa che l'ha presa una parte identificata, sotto un'autorità che deteneva realmente, con un consenso realmente dato, con i controlli effettivamente eseguiti, su un registro che nessuno può modificare in silenzio, e con un arresto che è nelle mani di persone identificate. Questo è responsabilità, non correttezza. La Coscienza, il pulsante di arresto, il diritto di appello e la revisione da parte di soggetti esterni sono tutti presenti perché l'involucro da solo non sarebbe mai stato sufficiente.

Cosa rende consenso e autorità verificabili da una macchina

Niente di tutto ciò funziona se consenso e autorità sono prosa. Una promessa in un'informativa sulla privacy non può essere verificata da una macchina, e nemmeno un'affermazione che qualcuno fosse autorizzato.

Perciò CIRIS li inserisce nel messaggio stesso, come campi nominati che viaggiano con ogni affermazione. Il consenso diventa un oggetto firmato che punta in una direzione e può essere revocato. L'autorità diventa qualcosa che deve risalire a una radice che il tuo stesso nodo ha accettato. Ogni affermazione deve portare con sé chi l'ha fatta, di cosa tratta e su cosa si basa. Una regola scritta in questo modo può essere fatta rispettare dal software e verificata da uno sconosciuto.

È anche ciò che rende le nostre pagine di conformità qualcosa con cui puoi discutere. Per ogni obbligo indichiamo la parte del sistema che svolge il lavoro e il controllo che lo dimostra, e diciamo onestamente quanto dell'obbligo copre, incluso quando ne copre solo una parte. Quelle mappature vale la pena leggerle solo perché i fatti sottostanti possono essere verificati, non solo dichiarati.

Dove questi valori sono davvero vincolanti

Nel testo

La Costituzione è il documento, è pubblica ed è versionata. L'agente non porta con sé un riassunto. Porta il testo.

Nella decisione

La coscienza opera durante il ragionamento, non dopo l'output. Un'azione che non supera un controllo non avviene, e una incerta viene affidata a una persona di cui ti fidi.

Nel registro

Ogni decisione lascia una traccia firmata che mostra ogni fase, ed è ciò che rende l'affermazione verificabile da chi non era presente e non si fida di noi.

In ciò che altri possono dire di te

La reputazione nella mesh è un'affermazione che altre parti firmano riguardo a un agente. Un agente non può mai firmare una simile affermazione su se stesso.

Dove fare pressione

Il punto più debole è quello tra struttura e sostanza. Tutto quanto sopra rende difficile agire senza lasciare una traccia, difficile rivendicare un'autorità che non ti è stata conferita, e difficile eliminare la capacità di una persona di dire stop. Niente di tutto ciò rende un sistema saggio.

Se pensi che esista un altro modo di governare un'IA capace, uno che non ponga la responsabilità nella struttura, vogliamo sentire quella tesi. Se puoi mostrarci una decisione in cui l'involucro firmato che la circondava era corretto in ogni campo e la traccia firmata non ha comunque colto ciò che avrebbe dovuto cogliere, lo vogliamo ancora di più. Il codice è pubblico, e lo è anche la Costituzione.