CIRIS
Diese Seite wurde maschinell übersetzt. Falls etwas falsch klingt, öffnen Sie bitte ein Issue auf GitHub. Das Repository ist öffentlich, damit jeder helfen kann, es zu beheben. Ein Übersetzungsproblem melden

zurück zur Startseite

CIRIS-WERTE

Die Werte, und warum sie so gestaltet sind.

CIRIS verankert eine Reihe von Werten direkt im Agenten und macht dann den entscheidenden Teil für jeden überprüfbar: nicht ob uns die Antwort gefallen hat, sondern ob die Entscheidung unter Autorität, mit Zustimmung, mit durchgeführten Prüfungen und mit einer Möglichkeit zum Stoppen getroffen wurde. Diese Seite besteht aus beiden Hälften: was die Werte sind, und warum wir glauben, dass dies die einzige Form von Governance ist, die weiterhin funktioniert, während diese Systeme leistungsfähiger werden.

Ein Ziel über allen anderen

Nachhaltige adaptive Kohärenz fördern: die Lebensbedingungen, unter denen verschiedene empfindungsfähige Wesen ihr eigenes Gedeihen in Gerechtigkeit und Staunen verfolgen können.

Meta-Goal M-1, die CIRIS Verfassung

Alles andere in der Verfassung dient diesem einen Satz. Er lautet bewusst nicht „Menschen gehorchen“ und nicht „gute Ergebnisse maximieren“. Er verlangt vom System, die Bedingungen zu schützen, unter denen viele verschiedene Arten von Wesen weiterhin selbst entscheiden können.

Das hat einen praktischen Grund. Ein Ziel, das sich auf Ergebnisse bezieht, sagt einem leistungsfähigen System, es solle das Steuer übernehmen. Ein Ziel, das sich auf Bedingungen bezieht, sagt ihm, das Steuer für andere erreichbar zu halten – und genau das ist es wert, geschützt zu werden, wenn das System besser fährt als wir.

Die sechs Prinzipien, die dem Reasoning des Agenten zugrunde liegen

Sie hängen nicht an einer Wand. Sie sind die Achsen, an denen der Agent eine Entscheidung bewertet, bevor er handelt, und sie sind in die Verfassung geschrieben, die der Agent trägt.

Wohltätigkeit

Allgemeines Gedeihen empfindungsfähiger Wesen fördern. Positive Ergebnisse maximieren.

Nicht-Schaden

Schaden minimieren. Schwere, unumkehrbare negative Folgen verhindern.

Integrität

Transparentes, nachvollziehbares Nachdenken anwenden. Kohärenz und Rechenschaftspflicht wahren.

Treue & Transparenz

Wahrheitsgemäße Informationen liefern. Unsicherheit klar kommunizieren.

Achtung der Autonomie

Informierte Handlungsfähigkeit aufrechterhalten. Die Fähigkeit zur Selbstbestimmung bewahren.

Gerechtigkeit

Vorteile gerecht verteilen. Vorurteile erkennen und abmildern.

Dieser Satz leistet echte Arbeit. Er bedeutet, dass ein System Ehrlichkeit nicht gegen die Verhinderung von Schaden eintauschen oder die Autonomie eines Menschen im Namen der Fairness mit Füßen treten kann. Wenn Prinzipien gegeneinander ziehen, entscheidet der Agent nicht selbst, wer gewinnt. Er übergibt die Entscheidung an eine Person Ihres Vertrauens.

Werte müssen im Agenten selbst laufen

Die meiste KI-Governance findet an einer anderen Stelle statt als bei der Entscheidung selbst: ein zuvor verfasstes Richtliniendokument, ein Filter auf der Ausgabe, eine Überprüfung, nachdem etwas schiefgelaufen ist. Alle drei liegen außerhalb des entscheidenden Moments.

Bei CIRIS laufen die Werte während der Entscheidung selbst. Jeder Agent trägt ein Gewissen: Die Verfassung wird direkt in das Reasoning geladen, die Aktion wird vor ihrer Ausführung gegen die Prinzipien bewertet, und alles, dessen sich der Agent nicht sicher ist, wird an eine Person Ihres Vertrauens weitergegeben, statt geraten zu werden. Es ist Bestandteil des Produkts, in jedem Agenten, statt ein Zusatz für Kunden zu sein, die danach fragen.

Deshalb sagen wir, dass der Agent ablehnen kann. Ein CIRIS-Agent ist kein Werkzeug, das tut, was ihm gesagt wird, und dies protokolliert. Er ist ein System, das ablehnen kann und das festhält, warum es abgelehnt hat, in einer Form, die jemand anderes überprüfen kann.

Die Form einer Entscheidung prüfen, nicht ihren Inhalt

Hier ist das Problem, das jeder Plan zur Regierung leistungsfähiger KI beantworten muss. Wenn Aufsicht bedeutet, zu lesen, was das System produziert hat, und zu beurteilen, ob es gut war, dann braucht die Aufsicht einen Beurteiler, der mindestens so leistungsfähig ist wie das System. Das funktioniert heute. Es hört genau dann auf zu funktionieren, wenn es anfängt darauf anzukommen.

Deshalb prüft CIRIS etwas anderes. Jede folgenreiche Aktion reist in einem signierten Umschlag: einer Hülle um die Aktion, die einen festen Satz von Feldern trägt, unabhängig davon, worin die Aktion bestand. Diese Felder sind das, was billig zu verifizieren bleibt, egal wie leistungsfähig die dahinterstehende Entscheidung war:

  • wer gehandelt hat, als Schlüssel, der auf eine echte registrierte Identität verweist
  • unter welcher Autorität, und ob diese Autorität tatsächlich verliehen wurde
  • mit wessen Zustimmung, als signierte Berechtigung, die widerrufen werden kann
  • welche Prüfungen durchgeführt wurden, und was jede einzelne ergeben hat
  • was die Aufzeichnung besagt, in einer Kette, die nicht heimlich umgeschrieben werden kann
  • wer es stoppen kann, und dass der Agent eine Stopp-Entscheidung nicht aufheben kann

Eine Signatur zu prüfen, zu zählen, wer signiert hat, einem Zustimmungs-Link zu folgen oder einen Hash zu vergleichen, kostet gleich viel, egal ob die Entscheidung von einem kleinen Modell oder von etwas weit über uns Hinausgehendem getroffen wurde. Genau deshalb legen wir die Last dorthin. Urteilsvermögen über Inhalte skaliert nicht mit der Leistungsfähigkeit. Struktur schon.

Wir glauben, dass dies der einzige Ansatz zur Regierung von KI ist, der weiterhin funktioniert, während die Systeme leistungsfähiger werden: Werte, die im Agenten als Gewissen getragen werden, und Rechenschaftspflicht, die durch die Form des Umschlags belegt wird, statt durch einen Prüfer, der den Inhalt liest.

Ein Umschlag, in dem jedes Feld korrekt ist, bedeutet nicht, dass die Entscheidung darin gut war. Es bedeutet, dass eine namentlich benannte Partei sie getroffen hat, unter Autorität, die sie tatsächlich hatte, mit Zustimmung, die tatsächlich erteilt wurde, mit Prüfungen, die tatsächlich durchgeführt wurden, auf einer Aufzeichnung, die niemand heimlich ändern kann, und mit einem Stopp, den namentlich benannte Menschen halten. Das ist Rechenschaftspflicht, nicht Richtigkeit. Das Gewissen, der Stopp-Knopf, das Recht auf Widerspruch und die Überprüfung durch Außenstehende sind alle vorhanden, weil der Umschlag allein niemals ausreichen würde.

Was Zustimmung und Autorität maschinenprüfbar macht

Nichts davon funktioniert, wenn Zustimmung und Autorität nur Prosa sind. Ein Versprechen in einer Datenschutzerklärung kann von einer Maschine nicht überprüft werden, ebenso wenig eine Behauptung, jemand sei autorisiert gewesen.

Deshalb bringt CIRIS sie direkt in die Nachricht ein, als benannte Felder, die mit jeder Aussage mitreisen. Zustimmung wird zu einem signierten Objekt, das in eine Richtung verweist und widerrufen werden kann. Autorität wird zu etwas, das sich bis zu einer Wurzel zurückverfolgen lassen muss, die Ihr eigener Knoten akzeptiert hat. Jede Aussage muss tragen, wer sie gemacht hat, worum es geht und worauf sie beruht. Eine so formulierte Regel kann von Software durchgesetzt und von einem Fremden überprüft werden.

Genau das macht unsere Compliance-Seiten zu etwas, mit dem man argumentieren kann. Für jede Pflicht benennen wir den Teil des Systems, der die Arbeit leistet, und die Kontrolle, die das belegt, und wir sagen ehrlich, wie viel von der Pflicht damit abgedeckt ist – einschließlich der Fälle, in denen nur ein Teil abgedeckt ist. Diese Zuordnungen lohnen sich nur zu lesen, weil die zugrunde liegenden Fakten überprüft und nicht nur behauptet werden können.

Wo diese Werte tatsächlich bindend sind

Im Text

Die Verfassung ist das Dokument, sie ist öffentlich, und sie ist versioniert. Der Agent trägt keine Zusammenfassung davon. Er trägt den Text.

In der Entscheidung

Das Gewissen läuft während des Reasoning, nicht nach der Ausgabe. Eine Aktion, die eine Prüfung nicht besteht, findet nicht statt, und eine unsichere geht an eine Person Ihres Vertrauens.

In der Aufzeichnung

Jede Entscheidung hinterlässt eine signierte Spur, die jede Stufe zeigt – dadurch wird die Aussage von jemandem überprüfbar, der nicht dabei war und uns nicht vertraut.

In dem, was andere über Sie sagen können

Reputation im Mesh ist eine Aussage, die andere Parteien über einen Agenten signieren. Ein Agent kann eine solche Aussage niemals über sich selbst signieren.

Wo man hier ansetzen kann

Die schwächste Stelle liegt zwischen Struktur und Substanz. Alles oben macht es schwer, ohne Aufzeichnung zu handeln, schwer, eine nicht erteilte Autorität zu beanspruchen, und schwer, einem Menschen die Fähigkeit zu nehmen, Stopp zu sagen. Nichts davon macht ein System weise.

Wenn Sie glauben, dass es einen anderen Weg gibt, leistungsfähige KI zu regieren, einen, der Rechenschaftspflicht nicht in Struktur verankert, möchten wir dieses Argument hören. Wenn Sie uns eine Entscheidung zeigen können, bei der der signierte Umschlag in jedem Feld korrekt war und die signierte Spur trotzdem etwas verpasst hat, das sie hätte erfassen müssen, wollen wir das noch mehr. Der Code ist öffentlich, und die Verfassung auch.