Diese Seite wurde maschinell übersetzt. Falls etwas falsch klingt, öffnen Sie bitte einen Issue, das Repository ist aus gutem Grund öffentlich. Ein Übersetzungsproblem melden

zurück zur Lobby

Die Superalignment-Landschaft

Der größte Teil des Feldes richtet das Modell aus. CIRIS baut die Institutionen darum herum.

Es gibt zwei ehrliche Wege, um leistungsfähige KI sicher zu machen. Der eine besteht darin, die Werte des Modells so lange zu trainieren, bis man ihnen vertrauen kann. Der andere geht davon aus, dass das Modell falsch liegen könnte, und macht das, was es tut, offen und für Menschen und Systeme nachvollziehbar, die jeder prüfen kann. CIRIS wählt den zweiten Weg. Hier ist die gesamte Landschaft, fair abgebildet, und wo wir darin stehen.

01Ausrichtung

Den Gewichten vertrauen oder das Verhalten prüfen

Der Mainstream der KI-Sicherheit versucht, ein Modell von innen heraus gut zu machen: seine Werte trainieren, seine Gedanken untersuchen, es mit sich selbst debattieren lassen. Diese Arbeit ist wichtig. CIRIS setzt auf den anderen Weg. Es wird angenommen, dass ein fähiges Modell möglicherweise falsch ausgerichtet ist. Statt seinem Verstand zu vertrauen, werden seine folgenreichen Handlungen gegenüber Menschen und anderen Systemen verantwortlich gemacht, die sie prüfen können.

In den eigenen Begriffen des Feldes gehört CIRIS zum institutionellen und kontrollorientierten Zweig, gemeinsam mit KI-Kontrolle und garantiert sicherer KI, nicht zur werteinternen Hauptlinie von RLHF, Constitutional AI, Debatte und Interpretierbarkeit. Seine Antwort auf skalierbare Aufsicht, also wie man etwas überwacht, das klüger ist als man selbst, besteht darin, den Verantwortlichkeitsrahmen zu überprüfen, nicht das Denken. Eine Signatur, ein Quorum, ein hash-verkettetes Audit bleiben günstig zu prüfen, auch wenn die dahinterstehende Entscheidung übermenschlich ist. Es richtet Systeme vieler fähiger Agenten über die Zeit aus, nicht die Werte eines einzelnen Geistes.

Es versucht nicht, eine einzige allmächtige KI auszurichten. Absichtlich.

Verantwortlichkeit braucht mehr als eine Partei. Jemanden, dem man Rechenschaft schuldet. Eine Möglichkeit zur Überprüfung, die nicht stillschweigend beseitigt werden kann. Ein Machtgleichgewicht, das keine Seite allein übernehmen kann. Eine einzelne Superintelligenz hat nichts davon, daher gibt es keinen ehrlichen Weg, sie zur Verantwortung zu ziehen. CIRIS ist für die andere Zukunft gebaut: viele fähige Agenten, Menschen und Organisationen, deren folgenreiche Entscheidungen alle unabhängig überprüfbar sind.

Die Haltung ist daher klar formuliert. Eine Singleton-ASI ist kein System, das ausgerichtet werden soll, sondern ein Zustand, der verhindert werden muss. Übermenschliche Fähigkeiten an einem einzigen, nicht rechenschaftspflichtigen Ort zu konzentrieren, auf diesem Stand der menschlichen institutionellen Entwicklung, ist illegitim, weil keine Institution reif genug ist, sie zur Verantwortung zu ziehen, was genau die Gefahr ist. In den eigenen Begriffen des Rahmens ist ein Singleton der ρ→1 Einzelstimmen-Kollaps, den das Korridormodell als Koordinationsversagen bezeichnet, nicht als Erfolg. Dass unsere Garantien in einem Verbund gelten und gegenüber einem Singleton nachlassen, ist keine Lücke, die wir schließen. Es ist das Regime, das wir ablehnen zu legitimieren, gehalten als Verpflichtung, nicht nur als Vorhersage.

02Verbraucher-KI

So schneidet CIRIS im Vergleich zur KI ab, die du wirklich nutzt

Die alltäglichen Assistenten sind leistungsstark und einfach zu bedienen. Sie laufen auch in der Cloud von jemand anderem, führen keine Aufzeichnungen, die du prüfen kannst, und antworten niemandem, den du benennen kannst. Hier ist derselbe Rechenschaftstest, angewendet auf die KI, die die meisten Menschen täglich öffnen.

AssistentVeröffentlichte GrundsätzeNachweis der HandlungenFragt einen Menschen bei UnsicherheitOpen SourceEchokammer-Prüfung
ChatGPTJaNeinNeinNeinNein
GeminiJaNeinNeinNeinNein
ClaudeJaNeinNeinNeinNein
CIRISJaJaJaJaJa

Verglichen am öffentlichen Produktverhalten vom Juni 2026. Jeder Link zu Grundsätzen führt zur eigenen veröffentlichten Spezifikation des jeweiligen Unternehmens.

Selbst ausprobieren

CIRISsafe by structure · open by principle · kind by design