이 페이지는 기계 번역되었습니다. 내용이 어색하게 느껴지면 이슈를 열어 주세요. 저장소는 이유가 있어 공개되어 있습니다. 번역 문제 신고

로비로 돌아가기

초정렬 지형도

이 분야의 대부분은 모델을 정렬하는 데 집중합니다. CIRIS는 그 주변의 제도를 구축합니다.

강력한 AI를 안전하게 만드는 솔직한 방법은 두 가지입니다. 하나는 모델의 가치관을 신뢰할 수 있을 때까지 훈련하는 것입니다. 다른 하나는 모델이 틀릴 수 있다고 가정하고, 모델이 하는 행동을 누구나 확인할 수 있는 방식으로 사람과 시스템에 공개적으로 책임지게 만드는 것입니다. CIRIS는 두 번째 길을 택합니다. 여기에 전체 지형을 공정하게 정리하고, 우리가 어디에 위치하는지 보여드립니다.

01정렬

가중치를 신뢰하거나, 행동을 검증하거나

AI 안전의 주류는 모델을 내부적으로 선하게 만들려 합니다. 가치관을 훈련하고, 생각을 연구하며, 스스로 토론하게 합니다. 그 작업은 중요합니다. CIRIS는 다른 길에 주목합니다. 능력 있는 모델이 정렬되지 않았을 수 있다고 가정하고, 그 마음을 신뢰하는 대신, 중요한 행동을 사람과 검증할 수 있는 다른 시스템에 책임지게 만듭니다.

이 분야의 용어로 말하자면, CIRIS는 RLHF, Constitutional AI, 토론, 해석 가능성 등 가치 내재화 주류가 아닌, AI 제어와 GS-AI와 같은 제도적, 통제 분야에 속합니다. 확장 가능한 감독, 즉 자신보다 똑똑한 것을 어떻게 감독하느냐는 문제에 대한 CIRIS의 답은 추론이 아닌 책임 범위를 검증하는 것입니다. 서명, 쿼럼, 해시 체인 감사는 그 뒤의 결정이 초인적이더라도 저렴하게 확인할 수 있습니다. CIRIS는 단일 마음의 가치관이 아니라, 시간이 지남에 따라 많은 유능한 에이전트로 구성된 시스템을 정렬합니다.

의도적으로, 단 하나의 전능한 AI를 정렬하려 하지 않습니다.

책임은 한 당사자 이상을 필요로 합니다. 책임을 질 상대방, 조용히 삼켜질 수 없는 확인 방법, 어느 한쪽도 장악할 수 없는 권력 균형이 필요합니다. 단일 초지능에는 이 중 어느 것도 없으므로, 그것을 책임지게 할 솔직한 방법이 없습니다. CIRIS는 다른 미래를 위해 설계되었습니다. 중요한 결정이 모두 독립적으로 확인 가능한, 많은 유능한 에이전트, 사람, 그리고 조직으로 구성된 미래입니다.

따라서 이 입장은 명확합니다. 단일 ASI는 정렬해야 할 시스템이 아니라 예방해야 할 조건입니다. 인간 제도 발전의 현 단계에서, 초인적 역량을 하나의 책임지지 않는 곳에 집중하는 것은 정당하지 않습니다. 어떤 제도도 그것을 책임지게 할 만큼 성숙하지 않았기 때문이며, 바로 그것이 위험입니다. 이 프레임워크의 용어로, 단일체는 조정 성공이 아닌 실패로 지목되는, 복도 모델이 명명한 ρ→1 단일 음성 붕괴입니다. 우리의 보증이 연합에서는 유지되고 단일체에 대해서는 약화된다는 것은 우리가 메워야 할 공백이 아닙니다. 그것은 우리가 예측으로서만이 아닌 약속으로 합법화를 거부하는 체제입니다.

02소비자 AI

실제로 사용하는 AI와 비교하면

일상적인 AI 어시스턴트는 강력하고 사용하기 쉽습니다. 하지만 다른 회사의 클라우드에서 실행되고, 확인할 수 있는 기록을 남기지 않으며, 이름을 댈 수 있는 누군가에게 책임을 지지 않습니다. 여기에 대부분의 사람들이 매일 여는 AI에 같은 책임 기준을 적용해 봤습니다.

어시스턴트공개된 원칙행동 증거불확실할 때 사람에게 물음오픈 소스반향실 점검
ChatGPT아니요아니요아니요아니요
Gemini아니요아니요아니요아니요
Claude아니요아니요아니요아니요
CIRIS

2026년 6월 기준 공개 제품 동작을 비교했습니다. 각 원칙 링크는 해당 회사가 직접 공개한 사양으로 연결됩니다.

직접 해보기

CIRISsafe by structure · open by principle · kind by design