Cette page a été traduite par machine. Si quelque chose semble mal traduit, veuillez ouvrir un ticket, le dépôt est public pour une bonne raison. Signaler un problème de traduction

retour au lobby

Le paysage du superalignement

La plupart du domaine aligne le modèle. CIRIS construit les institutions autour de lui.

Il existe deux façons honnêtes de rendre l'IA puissante sûre. La première consiste à entraîner les valeurs du modèle jusqu'à leur faire confiance. La seconde consiste à supposer que le modèle pourrait se tromper, et à rendre ses actions responsables, de manière transparente, devant des personnes et des systèmes que tout le monde peut vérifier. CIRIS emprunte la deuxième voie. Voici l'ensemble du paysage, cartographié honnêtement, et notre place dans celui-ci.

01Alignement

Faire confiance aux poids, ou vérifier le comportement

L'axe principal de la sécurité de l'IA cherche à rendre un modèle bon de l'intérieur: entraîner ses valeurs, étudier ses pensées, le faire débattre avec lui-même. Ce travail est important. CIRIS mise sur l'autre voie. Supposer qu'un modèle capable pourrait être mal aligné, et plutôt que de lui faire confiance, rendre ses actions importantes responsables devant des personnes et d'autres systèmes capables de les vérifier.

Dans les termes propres au domaine, CIRIS se situe dans la branche institutionnelle et de contrôle, aux côtés du contrôle de l'IA et de l'IA à sécurité garantie, et non dans l'axe principal de l'internalisation des valeurs que sont RLHF, l'IA constitutionnelle, le débat et l'interprétabilité. Sa réponse à la supervision évolutive, c'est-à-dire comment superviser quelque chose de plus intelligent que soi, est de vérifier l'enveloppe de responsabilité, pas le raisonnement. Une signature, un quorum, un audit enchaîné par hachage restent faciles à vérifier même quand la décision derrière eux est surhumaine. Le système aligne des ensembles de nombreux agents capables dans le temps, pas les valeurs d'un seul esprit.

Il ne cherche pas à aligner une IA toute-puissante. C'est voulu.

La responsabilité nécessite plus d'une partie. Quelqu'un à qui répondre. Un moyen de vérification qui ne peut pas être discrètement absorbé. Un équilibre des pouvoirs qu'aucun camp ne peut capturer. Une super-intelligence unique n'a aucun de ces éléments, il n'existe donc pas de moyen honnête de lui demander des comptes. CIRIS est conçu pour l'autre avenir: de nombreux agents capables, des personnes et des organisations dont toutes les décisions importantes sont indépendamment vérifiables.

La position est donc explicite. Un ASI singleton n'est pas un système à aligner mais une condition à prévenir. Concentrer une capacité surhumaine en un seul endroit non responsable, à ce stade du développement institutionnel humain, est illégitime, car aucune institution n'est assez mûre pour lui demander des comptes, ce qui est précisément le danger. Dans les termes propres au cadre, un singleton est l'effondrement en voix unique ρ→1 que le modèle de corridor nomme comme un échec de coordination, et non un succès. Que nos garanties tiennent dans une fédération et s'érodent face à un singleton n'est pas une lacune que nous corrigeons. C'est le régime que nous refusons de légitimer, tenu comme un engagement, pas seulement une prédiction.

02IA grand public

Comment CIRIS se compare à l'IA que vous utilisez vraiment

Les assistants du quotidien sont puissants et faciles à utiliser. Ils fonctionnent aussi dans le cloud de quelqu'un d'autre, ne gardent aucune trace que vous pouvez vérifier, et ne répondent à personne que vous pouvez nommer. Voici le même test de responsabilité, appliqué à l'IA que la plupart des gens ouvrent chaque jour.

AssistantPrincipes publiésPreuve de ce qu'il a faitDemande à un humain en cas de douteCode source ouvertContrôle anti-chambre d'écho
ChatGPTOuiNonNonNonNon
GeminiOuiNonNonNonNon
ClaudeOuiNonNonNonNon
CIRISOuiOuiOuiOuiOui

Comparé sur le comportement public des produits en juin 2026. Chaque lien vers les principes renvoie à la spécification publiée par l'entreprise elle-même.

Essayez par vous-même

CIRISsafe by structure · open by principle · kind by design