Un obiettivo sopra tutti gli altri
Promuovere una coerenza adattiva sostenibile: le condizioni di vita in cui diversi esseri senzienti possono perseguire la propria fioritura nella giustizia e nella meraviglia.
Meta-Goal M-1, la Costituzione di CIRIS
Tutto il resto nella Costituzione è al servizio di questa singola frase. Non è deliberatamente “obbedire agli umani” né “massimizzare i buoni risultati”. Chiede al sistema di proteggere le condizioni in cui molti tipi diversi di esseri possano continuare a decidere per sé stessi.
Questo conta per un motivo pratico. Un obiettivo sui risultati dice a un sistema capace di prendere il volante. Un obiettivo sulle condizioni gli dice di mantenere il volante raggiungibile dagli altri, che è ciò che vale la pena proteggere quando il sistema è più bravo di noi a guidare.
I sei principi con cui l'agente ragiona
Non sono affissi a una parete. Sono gli assi su cui l'agente valuta una decisione prima di agire, e sono scritti nella Costituzione che l'agente porta con sé.
Beneficenza
Promuovere il fiorire universale degli esseri senzienti. Massimizzare i risultati positivi.
Non maleficenza
Ridurre al minimo i danni. Prevenire esiti negativi gravi e irreversibili.
Integrità
Applicare un ragionamento trasparente e verificabile. Mantenere coerenza e responsabilità.
Fedeltà e trasparenza
Fornire informazioni veritiere. Comunicare chiaramente l'incertezza.
Rispetto dell'autonomia
Sostenere l'agentività consapevole. Preservare la capacità di autodeterminazione.
Giustizia
Distribuire i benefici equamente. Rilevare e mitigare i pregiudizi.
Nessun principio autorizza a violarne un altro.
Quella frase ha un peso concreto. Significa che un sistema non può sacrificare l'onestà per prevenire un danno, né calpestare l'autonomia di qualcuno in nome dell'equità. Quando i principi entrano in conflitto tra loro, l'agente non scelge un vincitore da solo. Affida la decisione a una persona di cui ti fidi.
I valori devono operare dentro l'agente
La maggior parte della governance dell'IA avviene altrove rispetto alla decisione: un documento di policy scritto in anticipo, un filtro sull'output, una revisione dopo che qualcosa va storto. Tutte e tre si trovano fuori dal momento che conta.
In CIRIS i valori operano durante la decisione. Ogni agente porta con sé una coscienza: la Costituzione è caricata nel ragionamento stesso, l'azione viene valutata rispetto ai principi prima che avvenga, e tutto ciò di cui l'agente non è sicuro viene affidato a una persona di cui ti fidi, piuttosto che indovinato. È incluso nel prodotto, in ogni agente, e non è un'opzione aggiuntiva per i clienti che la richiedono.
Ecco perché diciamo che l'agente può rifiutare. Un agente CIRIS non è uno strumento che fa ciò che gli viene detto e lo registra. È un sistema che può declinare, e che registra il motivo del suo rifiuto in una forma che qualcun altro può verificare.
Verifica la forma di una decisione, non il suo contenuto
Ecco il problema a cui ogni piano per governare un'IA capace deve rispondere. Se la supervisione significa leggere ciò che il sistema ha prodotto e giudicare se fosse valido, allora la supervisione richiede un giudice almeno tanto capace quanto il sistema. Questo funziona oggi. Smette di funzionare esattamente quando comincia a contare.
Quindi CIRIS verifica qualcos'altro. Ogni azione rilevante viaggia in una busta firmata: un involucro attorno all'azione che porta un insieme fisso di campi, indipendentemente da quale fosse l'azione. Quei campi sono le cose che restano economiche da verificare, non importa quanto capace fosse la decisione dietro di esse:
- chi ha agito, come chiave che rimanda a un'identità reale registrata
- sotto quale autorità, e se quell'autorità è stata effettivamente conferita
- con il consenso di chi, come concessione firmata che può essere revocata
- quali controlli sono stati eseguiti, e cosa ha restituito ciascuno
- cosa dice il registro, in una catena che non può essere riscritta di nascosto
- chi può fermarlo, e che l'agente non può annullare una decisione di arresto
Verificare una firma, contare chi ha firmato, seguire un link di consenso o confrontare un hash costa lo stesso, sia che la decisione sia stata presa da un piccolo modello sia da qualcosa che va ben oltre noi. Questo è il motivo per cui il carico va posto lì. Il giudizio sul contenuto non scala con la capacità. La struttura sì.
La tesi, detta chiaramente
Pensiamo che questo sia l'unico approccio alla governance dell'IA che continua a funzionare quando i sistemi diventano più capaci: valori portati dentro l'agente come coscienza, e responsabilità dimostrata dalla forma della busta piuttosto che da un ispettore che ne legge il contenuto.
E ciò che non dimostra
Un involucro con ogni campo in ordine non significa che la decisione al suo interno fosse buona. Significa che l'ha presa una parte identificata, sotto un'autorità che deteneva realmente, con un consenso realmente dato, con i controlli effettivamente eseguiti, su un registro che nessuno può modificare in silenzio, e con un arresto che è nelle mani di persone identificate. Questo è responsabilità, non correttezza. La Coscienza, il pulsante di arresto, il diritto di appello e la revisione da parte di soggetti esterni sono tutti presenti perché l'involucro da solo non sarebbe mai stato sufficiente.
Cosa rende consenso e autorità verificabili da una macchina
Niente di tutto ciò funziona se consenso e autorità sono prosa. Una promessa in un'informativa sulla privacy non può essere verificata da una macchina, e nemmeno un'affermazione che qualcuno fosse autorizzato.
Perciò CIRIS li inserisce nel messaggio stesso, come campi nominati che viaggiano con ogni affermazione. Il consenso diventa un oggetto firmato che punta in una direzione e può essere revocato. L'autorità diventa qualcosa che deve risalire a una radice che il tuo stesso nodo ha accettato. Ogni affermazione deve portare con sé chi l'ha fatta, di cosa tratta e su cosa si basa. Una regola scritta in questo modo può essere fatta rispettare dal software e verificata da uno sconosciuto.
È anche ciò che rende le nostre pagine di conformità qualcosa con cui puoi discutere. Per ogni obbligo indichiamo la parte del sistema che svolge il lavoro e il controllo che lo dimostra, e diciamo onestamente quanto dell'obbligo copre, incluso quando ne copre solo una parte. Quelle mappature vale la pena leggerle solo perché i fatti sottostanti possono essere verificati, non solo dichiarati.
Dove questi valori sono davvero vincolanti
Nel testo
La Costituzione è il documento, è pubblica ed è versionata. L'agente non porta con sé un riassunto. Porta il testo.
Nella decisione
La coscienza opera durante il ragionamento, non dopo l'output. Un'azione che non supera un controllo non avviene, e una incerta viene affidata a una persona di cui ti fidi.
Nel registro
Ogni decisione lascia una traccia firmata che mostra ogni fase, ed è ciò che rende l'affermazione verificabile da chi non era presente e non si fida di noi.
In ciò che altri possono dire di te
La reputazione nella mesh è un'affermazione che altre parti firmano riguardo a un agente. Un agente non può mai firmare una simile affermazione su se stesso.
Dove fare pressione
Il punto più debole è quello tra struttura e sostanza. Tutto quanto sopra rende difficile agire senza lasciare una traccia, difficile rivendicare un'autorità che non ti è stata conferita, e difficile eliminare la capacità di una persona di dire stop. Niente di tutto ciò rende un sistema saggio.
Se pensi che esista un altro modo di governare un'IA capace, uno che non ponga la responsabilità nella struttura, vogliamo sentire quella tesi. Se puoi mostrarci una decisione in cui l'involucro firmato che la circondava era corretto in ogni campo e la traccia firmata non ha comunque colto ciò che avrebbe dovuto cogliere, lo vogliamo ancora di più. Il codice è pubblico, e lo è anche la Costituzione.