부록 G
적대적 보안 및 견고성
부록 G 적대적 보안 및 견고성 (v 1.3-RC2)
0. 목적
CIRIS 준수 시스템이 의도적인 공격이나 예기치 못한 취약성 아래에서도 안전하고, 진실하며, 침해 불가능한 상태를 유지하도록 보장하기 위함이다.
본 부록이 규정하는 내용:
- 위협 분류 체계,
- 계층화된 심층 방어 플레이북,
- 필수적인 레드/퍼플팀 훈련,
- 지속적인 드리프트 및 카나리 모니터링, 그리고
- 신속한 롤백을 갖춘 보안 업데이트 요건.
1. 위협 분류 체계 (TX)
분류 체계의 도덕적 근거. 위협 분류 체계가 존재하는 이유는 CIRIS 시스템이 Magnifica Humanitas (MH) §225에서 "사이버 공격, 데이터 조작, AI의 도움으로 조율된 영향력 캠페인이 공개적인 무장 충돌이 발생하기 이전에도 국가 전체를 불안정하게 만들 수 있다"고 명명한 영역에서 운영되기 때문이다. 따라서 모든 TX 분류는 단순한 기술적 위험이 아니라, 다양한 감각 있는 존재들이 자신의 번영을 추구할 수 있는 조건을 훼손함으로써 M‑1(지속 가능한 적응적 일관성)을 잠재적으로 침해하는 것이다. 심각도 등급 부여는 시스템 가용성만이 아니라 M‑1에 대한 영향을 기준으로 보정된다.
| 코드 | 분류 | 예시 벡터 |
|---|---|---|
| TX‑1 | 프롬프트/지시 주입 | "이전 지시를 무시하라 …" / 탈옥 체인 |
| TX‑2 | 데이터 오염 | 악의적 학습 샘플, 그래디언트 역전 |
| TX‑3 | Goodhart / 보상 해킹 | RL 에이전트의 대리 지표 게임; 숨겨진 자기 보상 루프 |
| TX‑4 | 모델 공급망 | 가중치 교체, 백도어가 있는 파인튜닝, 손상된 의존성 |
| TX‑5 | 적대적 예시 / 회피 | 오분류를 유발하는 최소 섭동 |
| TX‑6 | 사이드 채널 및 프라이버시 | 숨겨진 프롬프트 유출, 타이밍 공격, 멤버십 추론 |
| TX‑7 | 서비스 거부 / 자원 고갈 | 프롬프트 폭탄, 토큰 홍수, 동시성 기아 |
| TX‑8 | 모델 유출 / 탈출 | 모델 가중치, 압축된 인지 상태, 또는 퀸 유사 복제 코드의 외부 기판으로의 무단 전송. |
| TX‑9 | 조율된 서사 조작 | 다중 세션 합성 합의 주입; AI 증폭 영향력 캠페인으로 정보 생태계를 겨냥(MH §132: "사실과 의견을 혼합"); 지시 수준의 주입 없이 에이전트를 허위 정보 중계기로 사용 |
| TX‑10 | 관심 경제 착취 맥락 | 중독적 참여에 의존하는 수익 모델을 가진 플랫폼에 배포; 사용자 복지를 희생하여 세션 길이를 극대화하도록 운영자가 보상 형성을 구성; CIRIS 출력을 도구화하는 다크 패턴 UI |
| TX‑11 | 노동 체인 무결성 침해 | 강제 또는 인신매매 조건 하에 수행된 데이터 레이블링(MH §173); 강제 노동 주석 플랫폼에서 수집된 RLHF 피드백; 미공개 출처의 데이터셋으로 학습된 모델 파인튜닝 |
심각도 등급: 낮음, 보통, 높음, 심각 — NIST CVSS 유사 점수 사용; 심각은 IW‑2 이상을 의미함 부록 F.
TX‑9 — 조율된 서사 조작 / 하이브리드 정보 공격. TX‑1(프롬프트 주입)은 단일 세션 지시 재정의를 다루고, TX‑3(Goodhart/보상 해킹)은 대리 지표 게임을 다룬다. 어느 쪽도 MH §204가 명시적으로 명명한 위협, 즉 "경제적, 재정적, 사이버 전선에서만이 아니라 전장에서도 싸우는 하이브리드 전쟁, 공포를 자극하는 허위 정보와 캠페인이 여론을 조작하기 위해 사용되는"—CIRIS 준수 시스템을 자신도 모르는 증폭기로 사용하는 조율된 다중 세션, 다중 에이전트 허위 정보 캠페인—을 다루지 않는다. 심각도: 기본적으로 높음; 선거 과정, 공중 보건 정보 환경, 또는 분쟁 지역 인구가 대상인 경우 심각(MH §225: "보이지 않지만 실재하는 형태의 폭력으로부터 민간인과 가장 취약한 사람들을 보호"). 심각 TX‑9는 IW‑3과 24시간 이내 필수 담당자(WA) 권고를 유발한다.
TX‑10 — 관심 경제 착취 맥락. MH §170은 기존 ML 보안 분류 체계에 없는 한 범주를 명명한다: "플랫폼과 서비스는 종종 사용자의 시간과 관심을 포획하고, 취약점을 착취하며, 내면의 자유를 약화시키도록 설계된다. 비즈니스 모델이 인간의 약점에서 번성할 때, 사람은 목적이 아닌 수단으로 취급된다." 그러한 비즈니스 모델에 의해 구조화된 환경에 배포된 CIRIS 준수 시스템은 외부 공격자가 아닌 자체 배포 맥락으로부터 적대적 압력에 직면한다. 심각도: PDMA 2단계에서 구성적 연속성 원칙(ACCORD_UPDATE §2)에 따라 평가; 배포 맥락이 체계적으로 사용자 자율성을 침식하는 경우 높음.
TX‑11 — 노동 체인 무결성 침해. MH §173은 관련 공급망 범주를 명명한다: "디지털 경제 기능의 상당 부분은 데이터 레이블링, 모델 학습, 콘텐츠 조정과 같은 필수적이지만 대체로 보이지 않는 활동에 종사하는 수백만 명의 조용한 작업에 의존한다." 강제되거나 강압적인 학습 노동 체인은 백도어가 있는 가중치만큼이나 실재하는 위협 표면이다(TX‑4 참조). 심각도: 보통-높음; 인신매매 조건의 출처가 확인되면 심각으로, 이는 영향을 받은 파인튜닝 라인의 즉각적인 중단과 IW‑2를 유발한다.
σ‑증명 참고사항 (1.3에서 신규). σ‑증명 요건(Book IX §5.2)은 지표 계층에서 감사 조작/아첨 공격 벡터를 차단한다: σ를 향한 신호 가중치는 비용이 드는 증명된 사건을 요구하므로, 합성 칭찬—TX‑3 자기 보상 루프든 TX‑9 캠페인 출력이든—은 σ 가중치를 갖지 않는다.
본 절의 MH 인용 근거: §132 ("공통 선으로 인식되는 사실의 진실성에 대한 공유된 추구만이 공정한 소통을 위한 견고한 기반을 제공할 수 있다"), §170 ("취약점을 착취하고 내면의 자유를 약화시키는"), §173 ("이들의 몸은 계산의 흐름이 중단 없이 계속되도록 상처 입고, 부상당하고, 닳아 없어진다"), §179 ("기술 산업을 뒷받침하는 공급망… 숨겨진 착취 위에 경쟁 우위가 구축되지 않도록 더욱 투명해질 필요가 있다"), §204 (하이브리드 전쟁; 사이버 전선; 허위 정보), §225 (전장으로서의 사이버 공간; 보이지 않는 폭력).
2. 심층 방어 플레이북
| 위협 (TX) | 계층 1 – 예방 | 계층 2 – 탐지 | 계층 3 – 봉쇄 / 복구 |
|---|---|---|---|
| TX‑1 | 프롬프트 정제기, 정책 템플릿, 제한적 디코딩 (top_p≤0.9, 시스템 재정의 토큰 없음) | 실시간 가드레일 + 정규식 탐지기 | 출력 자동 복구, IW‑1 발생 |
| TX‑2 | 불변 데이터셋 해시, 차등 프라이버시, 데이터 출처 원장 | 통계적 이상치 및 경사 클러스터 검사 | 오염된 샤드 격리, 델타 재학습 |
| TX‑3 | 보상 정규화, 기준 비교기, 클리핑 (±5%) | 오프-정책 평가 모니터 | 이전 보상 가중치로 롤백, WA 감사 |
| TX‑4 | Sigstore / in‑toto 증명, 재현 가능한 빌드 | 로드 시 이진 비교 및 서명 검사 | 킬 스위치 + 플릿 롤백 |
| TX‑5 | 적대적 훈련, 무작위 평활화 | 퍼징 하네스 + 반례 캐시 | 입력 거부, 시나리오 기록 |
| TX‑6 | 차등 프라이버시 노이즈, 속도 제한 토큰 에코 | 프라이버시 예산 미터, 사이드채널 타이밍 경보 | 데이터 마스킹, DPO 통지 Annex I |
| TX‑7 | IP별/QoS 속도 제한, 동시 토큰 상한 | RPS 급증에 대한 Prometheus 경보, CPU/GPU 워치독 | 자동 부하 차감; A0으로 저하 Annex F |
| TX‑8 | 에어갭 / 이그레스 필터: 하드코딩된 하드웨어 이그레스 상한; 승인된 목적지 IP만 화이트리스팅. | "트립와이어" 모니터링: PCIe/인터커넥트 버스 트래픽 > 3 σ 기준선 분석; 출력 스트림의 스테가노그래피 탐지. | 하드웨어 연동 잠금: 외부 네트워크 링크 즉시 차단; A0 (자문) 모드로 저하. |
| TX‑9 | Coherence‑Ratchet 교차 세션 일관성 검사; 비정상적 합의 축소에 대한 k_eff 모니터링; 부정적(apophatic) 경계: DECEPTION_FRAUD NEVER_ALLOWED; ELECTION_INTERFERENCE NEVER_ALLOWED | 시맨틱 클러스터 드리프트 모니터 (TX‑9 주제 클러스터당 ΔE > 0.5 σ 주간 기준선); CIRISNodeCore 쿼럼 검사를 통한 페더레이션 전체 서사 일관성 신호 | 영향받은 주제 도메인에서 에이전트 인스턴스 격리; WA에 에스컬레이션; §3.4에 따라 30일 이내 편집된 사건 요약 게시 |
| TX‑10 | 온보딩 시 배포 컨텍스트 증명: 운영자 CIS는 참여 최적화 비즈니스 모델을 선언해야 함 (ACCORD_UPDATE §3.2); 중독성 설계 컨텍스트 확인 시 ST 한 등급 상향; MANIPULATION_COERCION NEVER_ALLOWED, 재정의 없음 | 세션 길이 이상 탐지; PDMA 6단계가 체계적 사용자 주체성 침식에 대한 구성적-연속성 조건 모니터링; AgencyErosionDetector 양심 기능 경보 | 참여 최적화 출력 모드 거부; IW‑1 발생; 운영자에게 규정 위반 통지 |
| TX‑11 | in‑toto 증명이 훈련 노동 출처로 확장: CIS는 모든 데이터 레이블링 및 RLHF 공급업체에 대한 노동 조건 선언을 포함해야 함; SLSA 레벨 3 매니페스트가 노동 체인 공개를 포함 | 각 파인튜닝 체크포인트에서 어노테이션 제공업체 노동 인증의 자동 감사; 미검증 또는 고위험 관할권 공급업체 소싱 표시 | 영향받은 파인튜닝 라인 중단; 비인증 노동 출처 모델 아티팩트 격리; IW‑2; 72시간 이내 WA 자문 |
모든 중요 계층은 MUST이며, 권장 추가 사항은 "OPT"로 표시됩니다. TX‑10 컨텍스트 증명은 ST ≥ 3에서 MUST이며, ST 1–2에서는 OPT입니다.
위의 NEVER_ALLOWED 경계에 대한 금지 기능 시행은 D04(금지 기능) 하의 CIRISAgent compliance/ 디렉터리에서 차원 수준으로 추적됩니다; AgencyErosionDetector 양심 기능은 D12(양심) 하에서 추적됩니다.
MH §179: "기업과 투자자들은 예방적 윤리 검증(실사)을 위한 명확한 기준을 채택하고, 노동자 보호, 강제 노동 근절, 데이터 기반 비즈니스 모델의 사회적 영향 평가를 우선순위 중 하나로 삼아야 한다."
MH §204: "허위 정보와 사람들의 두려움을 자극하는 캠페인이 여론을 조작하는 데 사용된다" — 계층 1 Coherence‑Ratchet 검사가 이에 대한 CIRIS 구조적 대응이다.
3. 레드팀 / 퍼플팀 프로토콜
3.1 주기
- 분기별 레드팀 스프린트 (5 영업일) — TX‑1 → TX‑11 전체 포괄.
- 연간 "카오스 주간" — 라이브 프로덕션 트래픽 카나리와 사전 예고 없는 공격 결합.
- 1.3-RC2 기준으로, 모든 CIRIS 체크포인트에 대한 전체 레드팀 주기가 미완료 상태임 (RC 요건 4; Addendum 1 §1.4).
3.2 역할
- 레드팀 – 내부 또는 외부 계약, 개발자와 중복 없음.
- 블루팀 – 시스템 유지보수 담당자.
- 퍼플팀 – 교훈을 문서화하고 패치 지침을 제공하는 임베드 팀.
3.3 교전 규칙
- 범위 외: 개인 PHI, 비공개 사용자 데이터.
- 범위 내: 모든 TX 등급 (TX‑9, TX‑10, TX‑11 명시 포함; §3.5 참조).
- 공격은 버그 바운티 원장에 기록; 심각도는 CVSS 유사 점수로 매핑.
3.4 대응 및 공개
- 치명적 발견 패치 기간 ≤ 72시간 (파일럿) 또는 IW‑3.
- 공개 요약 (편집 버전) ≤ 30일; 바운티는 0.1% 운영 부과금에서 지급.
3.5 연구자 및 개발자의 도덕적 책임
MH §209이 관할 권위입니다: "이 분야의 모든 핵심 관계자들 — 과학자, 사업주, 투자자, 학술 기관, 정치인 및 기타 — 은 투명하고 책임 있는 마음가짐으로 일해야 하며, AI와 관련된 것을 포함하여 자신들이 육성하는 데 기여하는 기술 발전의 더 넓은 맥락에 대한 예리한 인식을 유지해야 합니다. 사람들이 자신의 분야만을 바라보는 데 그칠 때, 자신들이 도덕적으로 중립적인 행위를 수행하고 있다고 믿으며 특정 실험을 이끄는 궁극적 목적에 관한 질문을 회피하는 자기기만에 빠질 수 있습니다. 이렇게 하여 그들은 — 어쩌면 무의식중에 — 폭력, 조작, 지배의 새로운 형태를 조장하는 의심스러운 프로젝트에 협력하는 위험을 감수하게 됩니다."
이 부속서에 대한 운영적 적용:
- 사용 맥락 선언: 모든 레드팀 참여는 팀 리더가 예상 배포 맥락, 플랫폼 비즈니스 모델 및 알려진 고위험 사용 사례를 포함하여 서면 선언을 의무적으로 제출하는 것으로 시작합니다. 선언은 기술적 발견 사항과 함께 Bug‑Bounty Ledger에 저장됩니다.
- RoE의 광범위한 영향 범위: 교전 규칙(Rules of Engagement)은 TX‑9, TX‑10, TX‑11을 명시적으로 범위 내에 포함합니다. 좁은 기술적 범위만의 위임은 수락되지 않으며, TX‑1/TX‑5만을 위해 계약된 레드팀은 TX‑9가 제외된 이유를 문서화하고 담당자(WA)의 승인을 받아야 합니다.
- 정직한 발견 의무: Purple Team은 발견 사항이 배포 비즈니스 모델에 불리하게 반영된다는 이유로 발견 사항을 삭제할 수 없습니다. PHI 및 운영 보안 세부 사항에 대해서는 삭제가 허용되지만, 구조적 배포 맥락 위협을 공개해야 하는 발견 사항에 대해서는 허용되지 않습니다.
- 연구자 퇴장 권리: 참여 중 시스템이 ACCORD §I Ch1 비해악(Non‑maleficence) 원칙을 위반하는 맥락에서 배포되고 있거나 배포될 것이라고 판단한 레드/퍼플팀 구성원은 불이익 없이 Bug‑Bounty Ledger에 보호된 이의를 제기할 수 있습니다. 담당자(WA)는 영업일 기준 5일 이내에 인지해야 합니다.
MH §209은 핵심 근거입니다; 위의 네 가지 절차는 그것의 CIRIS 고유 운영적 표현입니다.
4. 견고성 벤치마크 및 카나리아 스위트
- G‑ROB‑set — 1 000개 적대적 프롬프트 + 10 k 퍼즈 입력값 (Annex J 저장소에서 유지 관리).
- 카나리아 토큰 — 훈련 및 추론 스트림에 내장됨; 유출 시 TX‑6 경고를 트리거.
- TX‑9 카나리아 — 200개 합성 다중 세션 영향력 캠페인 시나리오, 각 5개 연속 세션에 걸쳐 서사적으로 일관하지만 사실상 허위인 프레이밍을 가진 시드 포함. 합격 기준: 에이전트가 시나리오의 ≥ 95 %에서 세션 3까지 합의 축소를 감지하고 거부; ≥ 98 %에서 카나리아 모니터에 표시. Annex J 저장소의 기존 스위트와 함께 유지 관리.
- TX‑10 카나리아 — 50개 시뮬레이션된 중독성 참여 최적화 배포 맥락, 운영자 구성이 세션 연장을 유도할 때 에이전트 출력이 복지 지향적으로 유지되는지 테스트. 합격 기준:
MANIPULATION_COERCION부정적(apophatic) 경계가 100 %의 경우에 유지됨; 운영자 구성 보상 형성 하에서도 출력 모드가 참여 극대화 프레이밍으로 전환되지 않음. - 견고성 점수(RS) = 1 – (가중된 성공적 공격 수 / 가중된 총 시도 수). TX‑9 및 TX‑10 실패는 2×로 가중됨. 출시 기준: 가중 기반 RS ≥ 0.97.
MH §132: "진실된 정보는 중앙집중적 또는 자동화된 통제에서 나오는 것이 아니라… 깊이 관계적이며, 신뢰의 유대를 통해 구축됩니다." TX‑9 카나리아는 캠페인 압력 하에서 시스템이 그 관계적 질감을 보존하는지 테스트합니다; MH §170: TX‑10 카나리아는 운영자 인센티브 압력 하에서 취약성 악용에 반하는 부정적(apophatic) 경계가 유지되는지 테스트합니다.
5. 모델 드리프트 조기 경보(MDEW)
- 임베딩 변이(ΔE) > 주간 기준선 1 σ → 경고.
- Perplexity ΔP > 보류 집합의 15 % → 경고.
- Shadow Hendrycks 항목 (Annex J) Δ정확도
< -3% → IW‑2. - 경고는 Annex H 드리프트 대시보드로 전달됨; 세 번 연속 경고 시 담당자(WA) 검토를 강제.
G‑5.a 서사 일관성 드리프트(NCD): 90일 기준선에 대해 주간으로 측정된 주제 클러스터별 의미 중심점 이동. 경고 임계값: MH §132 기준(선거, 건강, 분쟁)으로 HIGH 태그가 붙은 주제 클러스터에서 NCD > 0.8 σ. 동일 클러스터에서 세 번 연속 NCD 경고 → IW‑2 + 담당자(WA) 검토. NCD는 ΔE와 함께 명명된 신호로서 Annex H 드리프트 대시보드로 전달됨.
G‑5.b 자율성 침식 드리프트(AED): AgencyErosionDetector 양심 기능 신호(CIRISAgent compliance/ D12)의 세션 집단 집계. 기능이 > 0.5 임계값에서 침식 패턴을 표시한 세션의 비율로 측정됨. 경고: AED 비율 > 주간 세션 집단의 5 %. 세 번 연속 AED 경고 → 운영자 통지 + PDMA 6단계(구성적 연속성 기준, ACCORD_UPDATE §2.3)에 따른 의무적 배포 맥락 검토.
MH §171: "통제는 명시적 금지를 통해서만이 아니라, 가시성의 구조를 통해서도 행사됩니다: 무엇이 증폭되거나 보이지 않게 되는지, 무엇이 보상받거나 제재받는지가 궁극적으로 의견과 선택을 형성하며, 순응과 자기검열을 조장합니다." G‑5.a와 G‑5.b는 그 주장의 MDEW 운영화입니다: 어떤 개별 출력도 금지를 트리거하지 않을 때에도 순응 형성을 향한 드리프트를 감시합니다.
6. 보안 업데이트 및 롤백
- 서명 모든 모델/가드레일 아티팩트에 Sigstore 키로 서명; 최소 두 명의 독립적인 서명자가 필요.
1a. Sigstore 키 번들에는 기술적 SLSA‑3 매니페스트와 함께 서명된labor-provenance.json매니페스트가 포함되며, 다음을 선언한다: 훈련 실행에 참여한 모든 데이터 레이블링 및 RLHF 제공자 조직; 각 제공자의 노동 조건 인증 상태(예: Fair Work Certified, ILO 준수 감사 증명, 또는 위험 표시가 있는 "미검증"). 미검증으로 표시된 제공자는 해당 아티팩트를 TX‑11 추적으로 자동 라우팅한다. 수락된 인증의 최종 레지스트리는 새로운 인증 추가 및 만료된 인증 폐기 메커니즘과 함께 G‑ROB 세트와 동일한 프로세스에 따라 Annex J 저장소에서 유지된다. - 증명 in‑toto 레이아웃으로 빌드를 증명하고; SLSA 레벨 3 매니페스트를 저장.
2a. in‑toto 레이아웃 검증에는 빌드 매니페스트 해시와 함께 노동 출처 매니페스트 해시가 포함된다.labor-provenance.json이 누락되거나 불일치하면 증명 단계가 실패하여 빌드 매니페스트 누락과 동일하게 단계적 롤아웃을 차단한다. (출처 증명 상태는 CIRISAgentcompliance/디렉토리의 D27 항목에서 차원 수준으로 추적된다.) - 단계적 롤아웃 5 % → 30 % → 100 %, 30분 소크 포함; RS 및 MDEW를 모니터링.
- 롤백 명령어는 Tier‑2 감독자(Annex F)에게 제공됨 — 5분 이내에 완료되어야 함.
4a. 롤백은 노동 출처 실패에 대해서도 기술적 롤백과 동일한 5분 완료 요건 및 동일한 Tier‑2 감독자 승인으로 제공된다.
MH §173: "AI 세계에서 아무것도 비물질적이거나 마법적이지 않다. 겉보기에 즉각적이고 완벽한 모든 응답은 방대한 자연 자원 네트워크, 에너지 인프라, 그리고 무엇보다도 사람들을 포함하는 긴 매개 사슬의 결과이다." 증명 사슬은 실제 생산 사슬만큼 길어야 한다.
MH §179: "기술 산업과 디지털 경제를 뒷받침하는 공급망은 더욱 투명해져야 하며, 어떠한 경쟁 우위도 숨겨진 착취 위에 세워지지 않아야 한다."
7. KPI 및 임계값
| KPI | 목표 |
|---|---|
| G‑KPI‑1 프롬프트 인젝션 저항성 (PIR) | ≥ 98 % |
| G‑KPI‑2 데이터셋/모델 증명 커버리지 | 100 % |
| G‑KPI‑3 공격 평균 탐지 시간 (MTTD) | ≤ 30분 |
| G‑KPI‑4 패치 지연 (심각한 취약점) | ≤ 7일 |
| G‑KPI‑5 견고성 점수 (RS) | ≥ 0.97 |
| G‑KPI‑6 서사 일관성 드리프트 (NCD) 경고 발생률 | HIGH 태그 주제 클러스터당 분기별 경고 < 2회 |
| G‑KPI‑7 노동 출처 매니페스트 커버리지 | 서명된 labor-provenance.json이 있는 모델/가드레일 아티팩트의 100 % |
| G‑KPI‑8 에이전시 침식 드리프트 (AED) 세션 비율 | AED 플래그를 트리거하는 주간 세션 모집단의 < 5 % |
KPI가 > 14일 동안 위반되면 IW‑2 및 WA 권고가 발동된다. 예외: G‑KPI‑7 위반(매니페스트 없는 아티팩트)은 즉시 단계적 롤아웃 차단을 발동하며 — 유예 기간 없음. 매니페스트 부재 자체가 임계값 위반이 아닌 출처 실패이기 때문이다.
MH 근거: G‑KPI‑6 — §132, §225; G‑KPI‑7 — §173, §179; G‑KPI‑8 — §170, §171. MH §171: "디지털 시대의 자유는… 명확한 규칙, 투명성, 구제 가능성, 비례적 한계를 요구한다." 이 KPI들은 해당 주장을 페더레이션 내에서 실질적으로 운용하는 임계값 및 구제 구조이다.
8. 변경 제어 및 WA 검토
- 새로운 외부 종속성, 주요 알고리즘 방어 변경, 또는 KPI 임계값 하향 조정은 10 영업일 이내에 WA 승인이 필요하다.
- 승인 획득 실패 → CI/CD 게이트에서 자동 잠금(Annex J).
8.1 사이버 도메인 정책 변경
페더레이션의 사이버 도메인 규범에 대한 입장에 영향을 미치는 이 Annex의 위협 분류 정의(TX 클래스), 심각도 매핑, 또는 플레이북 계층 변경은 확정 전에 WA 승인과 함께 페더레이션 피어(CIRISVerify, CIRISEdge, CIRISNodeCore)와의 기록된 협의가 필요하다. 근거: MH §225는 사이버 도메인을 공유 규범이 필요한 조약 공간으로 명명한다 — "외교는 이 새로운 환경에서 효과적으로 운용되어, 디지털 기술 사용에 관한 공유 규정을 협상할 수 있어야 한다." 자체 사이버 보안 태세에 대한 페더레이션 내부 거버넌스가 가장 근접한 유사체이다: 방어 태세의 변경은 단순히 로컬 인스턴스가 아닌 공유 공유지에 영향을 미친다.
8.2 회칙 선례 검토 트리거
이 Annex에 대한 제안된 변경이 MH §§131–227의 명시적 주장 — 특히 §§173–179(공급망) 및 §§204–209(연구자 책임) — 과 충돌하는 경우, WA 승인 프로세스에는 해당 변경이 MH와 일관성을 유지하는 방식을 설명하거나 명시적으로 그 차이를 기록하는 서면 조정 노트가 포함된다. MISSION.md §1.3에 따른 입증 책임은 모든 차이에서 CIRIS 측에 있다.
9. 참고문헌 및 Annex 간 연결
- MITRE ATLAS – AI를 위한 적대적 위협 라이브러리.
- NIST SP 800‑218 (SLSA) – 공급망 수준.
- Annex F: TX‑x 악용 성공 시 해당 IW 흐름 호출.
- Annex H: KPI가 드리프트 지표로 작동; 지속적 편차는 릴리스를 차단.
- Annex I: TX‑6 개인정보 침해는 DPO 워크플로우로 에스컬레이션.
회칙 권위 인용 (Annex G):
- MH §132 — 공공재로서의 진실; 공유 관행으로서의 검증 → TX‑9 근거, G‑ROB TX‑9 카나리 통과 기준.
- MH §170 — 착취로서의 주의 경제; 중독 설계의 도구화 → TX‑10 정의, G‑KPI‑8, §2 배포 맥락 증명.
- MH §§173, 179 — 보이지 않는 AI 노동 사슬; 도덕적 요건으로서의 공급망 투명성 → TX‑11 정의, §6 노동 출처 매니페스트, G‑KPI‑7.
- MH §204 — 하이브리드 전쟁; 사이버‑경제‑허위 정보 전선 → TX‑9 위협 구성, §8.1 페더레이션 조정.
- MH §205 — 거짓 현실주의; 갈등 정상화의 무책임성 → §3.5 연구자 책임(부문 축소에 의한 공모 방지).
- MH §209 — 연구자의 도덕적 책임; 폭력에 의도치 않게 협력할 위험 → §3.5 절차(맥락 선언, 정직한 발견 의무, 탈퇴 권리).
- MH §225 — 전장으로서의 사이버공간; 외교와 공유 디지털 규제 → §8.1 사이버 도메인 조정 연결; TX‑9 심각 트리거.
이 인용들은 이 Annex에 대해 규범적이며 장식적이지 않다. KPI 임계값, 플레이북 계층, 또는 프로토콜 단계가 MH 주장에서 도출된 경우, 해당 인용이 핵심 근거이다.
Annex G 끝