Questa pagina è stata tradotta automaticamente. Se qualcosa non suona bene, apri una segnalazione. Il repository è pubblico per una ragione. Segnala un problema di traduzione

torna alla lobby

Il panorama del superallineamento

La maggior parte del settore sta allineando il modello. CIRIS sta costruendo le istituzioni attorno ad esso.

Ci sono due modi onesti per rendere sicura l'IA potente. Il primo è addestrare i valori del modello finché non ci si fida di essi. Il secondo è assumere che il modello possa sbagliare, e rendere ciò che fa responsabile, in modo aperto, verso persone e sistemi che chiunque può verificare. CIRIS sceglie la seconda strada. Ecco l'intero panorama, mappato onestamente, e dove ci collochiamo in esso.

01Allineamento

Fidarsi dei pesi, o controllare il comportamento

La linea principale della sicurezza dell'IA cerca di rendere buono un modello al suo interno: addestrare i suoi valori, studiare i suoi pensieri, farlo discutere con se stesso. Quel lavoro è importante. CIRIS punta sull'altra strada. Supponiamo che un modello capace possa essere disallineato, e invece di fidarci della sua mente, rendiamo le sue azioni consequenziali responsabili verso persone e altri sistemi che possono verificarle.

Nei termini propri del settore, CIRIS si colloca nel ramo istituzionale e di controllo, insieme al controllo dell'IA e alla GS-AI, non nella linea principale dell'internalizzazione dei valori di RLHF, Constitutional AI, dibattito e interpretabilità. La sua risposta alla supervisione scalabile, ovvero come si supervisiona qualcosa di più intelligente di noi, è verificare il perimetro di responsabilità, non il ragionamento. Una firma, un quorum, un audit con hash concatenati rimangono facili da verificare anche quando la decisione dietro di essi è superumana. Allinea sistemi di molti agenti capaci nel tempo, non i valori di una singola mente.

Non cerca di allineare un'IA onnipotente. Di proposito.

La responsabilità ha bisogno di più di una parte. Qualcuno a cui rispondere. Un modo per verificare che non possa essere inghiottito silenziosamente. Un equilibrio di potere che nessuna parte può catturare. Una singola super-intelligenza non ha nessuna di queste cose, quindi non c'è modo onesto di ritenerla responsabile. CIRIS è costruito per l'altro futuro: molti agenti capaci, persone e organizzazioni le cui decisioni consequenziali sono tutte verificabili in modo indipendente.

Quindi la posizione è esplicita. Un'ASI singleton non è un sistema da allineare ma una condizione da prevenire. Concentrare la capacità superumana in un unico posto non responsabile, in questa fase dello sviluppo istituzionale umano, è illegittimo, perché nessuna istituzione è abbastanza matura da ritenerla responsabile, il che è precisamente il pericolo. Nei termini propri del framework, un singleton è il collasso a voce singola ρ→1 che il modello del corridoio identifica come un fallimento di coordinamento, non un successo. Il fatto che le nostre garanzie reggano in una federazione ed erodano contro un singleton non è un divario che stiamo tappando. È il regime che rifiutiamo di legittimare, mantenuto come impegno, non solo come previsione.

02AI per il grande pubblico

Come si confronta con l'AI che usi davvero

Gli assistenti di tutti i giorni sono potenti e facili da usare. Funzionano però nel cloud di qualcun altro, non lasciano tracce che tu possa controllare e non rispondono a nessuno che tu possa nominare. Ecco lo stesso test di responsabilità applicato all'AI che la maggior parte delle persone apre ogni giorno.

AssistentePrincipi pubblicatiProva di ciò che ha fattoChiede aiuto a un umano quando non è sicuraOpen sourceControllo della camera d'eco
ChatGPTNoNoNoNo
GeminiNoNoNoNo
ClaudeNoNoNoNo
CIRIS

Confronto basato sul comportamento pubblico del prodotto a giugno 2026. Ogni link ai principi rimanda alle specifiche pubblicate dalla stessa azienda.

Provalo tu stesso

CIRISsafe by structure · open by principle · kind by design