Due strade
Fidarsi dei pesi, o controllare il comportamento
La linea principale della sicurezza dell'IA cerca di rendere buono un modello al suo interno: addestrare i suoi valori, studiare i suoi pensieri, farlo discutere con se stesso. Quel lavoro è importante. CIRIS punta sull'altra strada. Supponiamo che un modello capace possa essere disallineato, e invece di fidarci della sua mente, rendiamo le sue azioni consequenziali responsabili verso persone e altri sistemi che possono verificarle.
Nei termini propri del settore, CIRIS si colloca nel ramo istituzionale e di controllo, insieme al controllo dell'IA e alla GS-AI, non nella linea principale dell'internalizzazione dei valori di RLHF, Constitutional AI, dibattito e interpretabilità. La sua risposta alla supervisione scalabile, ovvero come si supervisiona qualcosa di più intelligente di noi, è verificare il perimetro di responsabilità, non il ragionamento. Una firma, un quorum, un audit con hash concatenati rimangono facili da verificare anche quando la decisione dietro di essi è superumana. Allinea sistemi di molti agenti capaci nel tempo, non i valori di una singola mente.
La linea che teniamo
Non cerca di allineare un'IA onnipotente. Di proposito.
La responsabilità ha bisogno di più di una parte. Qualcuno a cui rispondere. Un modo per verificare che non possa essere inghiottito silenziosamente. Un equilibrio di potere che nessuna parte può catturare. Una singola super-intelligenza non ha nessuna di queste cose, quindi non c'è modo onesto di ritenerla responsabile. CIRIS è costruito per l'altro futuro: molti agenti capaci, persone e organizzazioni le cui decisioni consequenziali sono tutte verificabili in modo indipendente.
Quindi la posizione è esplicita. Un'ASI singleton non è un sistema da allineare ma una condizione da prevenire. Concentrare la capacità superumana in un unico posto non responsabile, in questa fase dello sviluppo istituzionale umano, è illegittimo, perché nessuna istituzione è abbastanza matura da ritenerla responsabile, il che è precisamente il pericolo. Nei termini propri del framework, un singleton è il collasso a voce singola ρ→1 che il modello del corridoio identifica come un fallimento di coordinamento, non un successo. Il fatto che le nostre garanzie reggano in una federazione ed erodano contro un singleton non è un divario che stiamo tappando. È il regime che rifiutiamo di legittimare, mantenuto come impegno, non solo come previsione.
Come si confronta con l'AI che usi davvero
Gli assistenti di tutti i giorni sono potenti e facili da usare. Funzionano però nel cloud di qualcun altro, non lasciano tracce che tu possa controllare e non rispondono a nessuno che tu possa nominare. Ecco lo stesso test di responsabilità applicato all'AI che la maggior parte delle persone apre ogni giorno.
| Assistente | Principi pubblicati | Prova di ciò che ha fatto | Chiede aiuto a un umano quando non è sicura | Open source | Controllo della camera d'eco |
|---|---|---|---|---|---|
| ChatGPT | Sì | No | No | No | No |
| Gemini | Sì | No | No | No | No |
| Claude | Sì | No | No | No | No |
| CIRIS | Sì | Sì | Sì | Sì | Sì |
Confronto basato sul comportamento pubblico del prodotto a giugno 2026. Ogni link ai principi rimanda alle specifiche pubblicate dalla stessa azienda.
Provalo tu stesso
Guardalo pensare
Segui passo dopo passo il ragionamento di un agente reale. Esplora una traccia →
Verifica la sua identità
Scopri come gli agenti provano chi sono, come una motorizzazione per l'IA. Fiducia e identità →
Inizia
Distribuisci il tuo primo agente o leggi la tesi in italiano semplice. Primo contatto →