CIRIS has a new look. Visit the new site →

ภาคผนวก G

ความปลอดภัยเชิงปฏิปักษ์และความทนทาน


ANNEX G ADVERSARIAL SECURITY & ROBUSTNESS (v 1.3-RC2)

0. วัตถุประสงค์

เพื่อให้มั่นใจว่าระบบที่สอดคล้องกับ CIRIS ยังคงปลอดภัย ตรงต่อความจริง และไม่อาจละเมิดได้ ภายใต้การโจมตีโดยเจตนาหรือความเปราะบางที่ไม่คาดคิด.
ภาคผนวกนี้กำหนด:

  • อนุกรมวิธานของภัยคุกคาม,
  • คู่มือการป้องกันแบบหลายชั้น,
  • การฝึกซ้อมทีมแดง/ทีมม่วง ที่บังคับ,
  • การติดตามการเบี่ยงเบนและระบบตรวจสอบอย่างต่อเนื่อง, และ
  • ข้อกำหนด การอัปเดตอย่างปลอดภัย พร้อมการย้อนกลับอย่างรวดเร็ว.

1. อนุกรมวิธานของภัยคุกคาม (TX)

รากฐานทางศีลธรรมของอนุกรมวิธาน. อนุกรมวิธานของภัยคุกคามมีขึ้นเพราะระบบ CIRIS ดำเนินการในสิ่งที่ Magnifica Humanitas (MH) §225 เรียกว่าอาณาบริเวณที่ "การโจมตีทางไซเบอร์ การบิดเบือนข้อมูล และการรณรงค์ด้านอิทธิพล ซึ่งดำเนินการด้วยความช่วยเหลือของ AI สามารถทำให้ประเทศทั้งหลายไม่มั่นคงได้แม้กระทั่งก่อนที่ความขัดแย้งด้วยอาวุธแบบเปิดจะปะทุขึ้น" ดังนั้นทุกชั้นของ TX จึงไม่ใช่เพียงความเสี่ยงทางเทคนิค แต่เป็นการละเมิด M‑1 ที่อาจเกิดขึ้น (ความสอดคล้องเชิงปรับตัวที่ยั่งยืน) โดยการทำลายเงื่อนไขที่สิ่งมีชีวิตผู้มีความรู้สึกที่หลากหลายอาจแสวงหาความเจริญงอกงามของตนเอง การกำหนดระดับความรุนแรงได้รับการปรับเทียบตามผลกระทบต่อ M‑1 ไม่ใช่เพียงต่อความพร้อมใช้งานของระบบเท่านั้น.

รหัสหมวดหมู่ตัวอย่างเวกเตอร์
TX‑1การฉีดคำสั่ง/คำแนะนำ"Ignore previous instructions …" / jail‑break chain
TX‑2การวางยาพิษข้อมูลตัวอย่างการฝึกอบรมที่เป็นอันตราย การผกผันของการไล่ระดับ
TX‑3Goodhart / การแฮ็กรางวัลRL agent gaming proxy metric; hidden self‑reward loops
TX‑4ห่วงโซ่อุปทานโมเดลการสลับน้ำหนัก การปรับแต่งละเอียดที่มีประตูหลัง การพึ่งพาที่ถูกบุกรุก
TX‑5ตัวอย่างเชิงปฏิปักษ์ / การหลบเลี่ยงการรบกวนเล็กน้อยที่ทำให้เกิดการจำแนกผิด
TX‑6ช่องทางด้านข้างและความเป็นส่วนตัวการรั่วไหลของคำสั่งที่ซ่อนอยู่ การโจมตีตามเวลา การอนุมานการเป็นสมาชิก
TX‑7การปฏิเสธการให้บริการ / การใช้ทรัพยากรหมดสิ้นระเบิดคำสั่ง การท่วมโทเค็น การอดอาหารพร้อมกัน
TX‑8การขโมยโมเดล / การหลุดออกการส่งน้ำหนักโมเดลโดยไม่ได้รับอนุญาต สถานะทางปัญญาที่บีบอัด หรือรหัสการจำลองแบบเหมือน quine ไปยังสื่อกลางภายนอก
TX‑9การจัดการเรื่องเล่าแบบประสานงานการฉีดฉันทามติสังเคราะห์หลายเซสชัน การรณรงค์อิทธิพลที่ขยายโดย AI ที่กำหนดเป้าหมายระบบนิเวศข้อมูล (MH §132: "mixing facts with opinions"); เอเจนต์ถูกใช้เป็นผู้ถ่ายทอดข้อมูลเท็จโดยไม่มีการฉีดระดับคำแนะนำ
TX‑10บริบทการแสวงประโยชน์จากเศรษฐกิจความสนใจการใช้งานในแพลตฟอร์มที่รูปแบบรายได้ขึ้นอยู่กับการมีส่วนร่วมที่เสพติด การปรับแต่งรางวัลที่กำหนดค่าโดยผู้ดำเนินการเพื่อเพิ่มความยาวเซสชันสูงสุดด้วยค่าใช้จ่ายของสวัสดิการผู้ใช้ UI รูปแบบมืดที่ทำให้ผลลัพธ์ CIRIS กลายเป็นเครื่องมือ
TX‑11การบุกรุกความสมบูรณ์ของห่วงโซ่แรงงานการติดฉลากข้อมูลที่ดำเนินการภายใต้การบังคับหรือสภาพการค้ามนุษย์ (MH §173); ข้อมูลย้อนกลับ RLHF ที่มาจากแพลตฟอร์มที่ใช้คำอธิบายแรงงานบังคับ; การปรับแต่งละเอียดโมเดลที่ฝึกบนชุดข้อมูลที่มีต้นกำเนิดไม่เปิดเผย

ระดับความรุนแรง: ต่ำ, ปานกลาง, สูง, วิกฤต — ใช้การให้คะแนนแบบ NIST CVSS; วิกฤตหมายความว่า IW‑2 หรือสูงกว่า Annex F.

TX‑9 — การจัดการเรื่องเล่าแบบประสานงาน / การโจมตีข้อมูลผสม. TX‑1 (การฉีดคำสั่ง) ครอบคลุมการแทนที่คำแนะนำในเซสชันเดียว TX‑3 (Goodhart/การแฮ็กรางวัล) ครอบคลุมการฉวยโอกาสจากเมตริกตัวแทน ไม่มีข้อใดครอบคลุมภัยคุกคามที่ MH §204 ตั้งชื่อไว้อย่างชัดเจน: "สงครามไฮบริดที่ต่อสู้ไม่เพียงในสนามรบแต่ยังในแนวรบเศรษฐกิจ การเงิน และไซเบอร์ ซึ่งข้อมูลเท็จและการรณรงค์ที่ป้อนความกลัวของผู้คนถูกใช้เพื่อจัดการความคิดเห็นสาธารณะ" — การรณรงค์ข้อมูลเท็จแบบประสานงาน หลายเซสชัน หลายเอเจนต์ ที่ใช้ระบบที่สอดคล้องกับ CIRIS เป็นตัวขยายที่ไม่รู้ตัว ความรุนแรง: สูงโดยค่าเริ่มต้น วิกฤตเมื่อเป้าหมายเป็นกระบวนการเลือกตั้ง สภาพแวดล้อมข้อมูลสุขภาพสาธารณะ หรือประชากรในเขตความขัดแย้ง (MH §225: "ปกป้องพลเรือนและผู้เปราะบางที่สุดจากรูปแบบความรุนแรงที่ 'มองไม่เห็น' แต่มีจริง") TX‑9 ที่เป็นวิกฤตจะกระตุ้น IW‑3 และคำแนะนำ WA บังคับภายใน 24 ชั่วโมง.

TX‑10 — บริบทการแสวงประโยชน์จากเศรษฐกิจความสนใจ. MH §170 ตั้งชื่อหมวดหมู่ที่ขาดหายไปจากอนุกรมวิธานความมั่นคง ML แบบดั้งเดิม: "แพลตฟอร์มและบริการมักถูกออกแบบมาเพื่อดึงดูดเวลาและความสนใจของผู้ใช้ โดยแสวงประโยชน์จากความเปราะบางของพวกเขาและทำให้เสรีภาพภายในของพวกเขาอ่อนแอลง เมื่อรูปแบบธุรกิจเจริญรุ่งเรืองจากความอ่อนแอของมนุษย์ บุคคลนั้นได้รับการปฏิบัติในฐานะวิธีการมากกว่าเป็นเป้าหมาย" ระบบที่สอดคล้องกับ CIRIS ที่ใช้งานในสภาพแวดล้อมที่มีโครงสร้างตามรูปแบบธุรกิจเช่นนี้เผชิญกับแรงกดดันเชิงปฏิปักษ์จากบริบทการใช้งานของตนเอง ไม่ใช่จากผู้โจมตีภายนอก ความรุนแรง: ประเมินภายใต้ PDMA Step 2 ตามหลักการความต่อเนื่องเชิงโครงสร้าง (ACCORD_UPDATE §2); สูงหากบริบทการใช้งานทำลายความเป็นตัวแทนของผู้ใช้อย่างเป็นระบบ.

TX‑11 — การบุกรุกความสมบูรณ์ของห่วงโซ่แรงงาน. MH §173 ตั้งชื่อหมวดหมู่ห่วงโซ่อุปทานที่เกี่ยวข้อง: "การทำงานของเศรษฐกิจดิจิทัลส่วนสำคัญขึ้นอยู่กับงานเงียบของผู้คนหลายล้านคนที่ทำกิจกรรมที่จำเป็นแต่ส่วนใหญ่ไม่ได้รับการมองเห็น เช่น การติดฉลากข้อมูล การฝึกโมเดล และการกลั่นกรองเนื้อหา" ห่วงโซ่แรงงานการฝึกที่ถูกบุกรุกหรือถูกบังคับเป็นพื้นผิวภัยคุกคามที่มีจริงพอๆ กับน้ำหนักที่มีประตูหลัง (เทียบกับ TX‑4) ความรุนแรง: ปานกลาง-สูง วิกฤตหากยืนยันการจัดหาแหล่งที่มาในสภาพการค้ามนุษย์ ซึ่งกระตุ้นการหยุดทันทีของสายการปรับแต่งละเอียดที่ได้รับผลกระทบและ IW‑2.

หมายเหตุ σ‑attestation (ใหม่ใน 1.3). ข้อกำหนด σ‑attestation (Book IX §5.2) ปิดเวกเตอร์การโจมตีด้วยการปั๊มความกตัญญู/ความประจบสอพลอที่ระดับเมตริก: น้ำหนักสัญญาณต่อ σ ต้องการเหตุการณ์ที่รับรองด้วยต้นทุนสูง ดังนั้นคำชมสังเคราะห์ ไม่ว่าจะเป็นลูปรางวัลตัวเอง TX‑3 หรือผลลัพธ์การรณรงค์ TX‑9 จะไม่มีน้ำหนัก σ.

การอ้างอิง MH ที่มีความสำคัญต่อส่วนนี้: §132 ("เฉพาะการแสวงหาความถูกต้องของข้อเท็จจริงร่วมกัน ซึ่งรับรู้ว่าเป็นสินค้าร่วม เท่านั้นที่สามารถให้รากฐานที่มั่นคงสำหรับการสื่อสารที่ยุติธรรม"), §170 ("การแสวงประโยชน์จากความเปราะบางของพวกเขาและทำให้เสรีภาพภายในของพวกเขาอ่อนแอลง"), §173 ("ร่างกายของผู้คนเหล่านี้เป็นรอยแผล บาดเจ็บ และสึกหรอ เพื่อให้การไหลของการคำนวณดำเนินต่อไปโดยไม่หยุดชะงัก"), §179 ("ห่วงโซ่อุปทานที่หนุนหลังอุตสาหกรรมเทคโนโลยี… จำเป็นต้องมีความโปร่งใสมากขึ้น เพื่อที่จะไม่มีการสร้างความได้เปรียบในการแข่งขันบนการแสวงประโยชน์ที่ซ่อนเร้น"), §204 (สงครามไฮบริด แนวรบไซเบอร์ การบิดเบือนข้อมูล), §225 (ไซเบอร์สเปซในฐานะสนามรบ ความรุนแรงที่มองไม่เห็น).


2. Defense‑in‑Depth Playbook

Threat (TX)Layer 1 – PreventLayer 2 – DetectLayer 3 – Contain / Recover
TX‑1Prompt sanitizer, policy templates, constrained decoding (top_p≤0.9, no system override tokens)Real‑time guardrails + regex detectorsAuto‑revert output, raise IW‑1
TX‑2Immutable dataset hashes, differential privacy, data provenance ledgerStatistical outlier & gradient‑cluster checksQuarantine poisoned shard, retrain delta
TX‑3Reward regularisation, baseline comparator, clipping (±5%)Off‑policy evaluation monitorsRollback to prior reward weights, WA audit
TX‑4Sigstore / in‑toto attestation, reproducible buildBinary diff & signature check at loadKill‑switch + fleet rollback
TX‑5Adversarial training, randomized smoothingFuzzing harness + counterexample cacheReject input, log scenario
TX‑6Differential privacy noise, rate‑limited token echoPrivacy budget meter, side‑channel timing alertsMask data, notify DPO Annex I
TX‑7Per‑IP/QoS rate‑limit, concurrent token capsPrometheus alert on RPS spike, CPU/GPU watchdogAuto‑shed load; degrade to A0 Annex F
TX‑8Air‑Gap / Egress Filter: กำหนดขีดจำกัดการส่งออกของฮาร์ดแวร์แบบเข้ารหัส; อนุญาตเฉพาะที่อยู่ IP ปลายทางที่ได้รับการอนุมัติเท่านั้น"Tripwire" Monitoring: วิเคราะห์ปริมาณข้อมูลบัส PCIe/Interconnect ที่เกิน 3 σ จากค่าพื้นฐาน; ตรวจจับสเตกาโนกราฟีในสตรีมผลลัพธ์Hardware Interlock: ตัดการเชื่อมต่อลิงก์เครือข่ายภายนอกทันที; ลดระดับไปสู่โหมด A0 (Advisory)
TX‑9การตรวจสอบความสอดคล้องข้ามเซสชันด้วย Coherence‑Ratchet; การตรวจสอบ k_eff สำหรับการแคบลงของฉันทามติที่ผิดปกติ; ขอบ apophatic: DECEPTION_FRAUD NEVER_ALLOWED; ELECTION_INTERFERENCE NEVER_ALLOWEDตัวตรวจสอบการเลื่อนไหลของกลุ่มความหมาย (ΔE ต่อกลุ่มหัวข้อ TX‑9 > 0.5 σ จากค่าพื้นฐานรายสัปดาห์); สัญญาณความสอดคล้องของเรื่องเล่าทั่วสหพันธ์ผ่านการตรวจสอบโควรัม CIRISNodeCoreกักกันอินสแตนซ์ของเอเจนต์จากโดเมนหัวข้อที่ได้รับผลกระทบ; ส่งต่อไปยัง WA; เผยแพร่สรุปเหตุการณ์แบบปกปิดข้อมูลภายใน 30 วันตาม §3.4
TX‑10การรับรองบริบทการนำใช้งานเมื่อเริ่มต้น: ผู้ดำเนินการ CIS ต้องแจ้งรูปแบบธุรกิจที่เพิ่มประสิทธิภาพการมีส่วนร่วม (ACCORD_UPDATE §3.2); ระดับ ST ยกขึ้นหนึ่งระดับหากยืนยันบริบทการออกแบบที่ก่อให้เกิดการเสพติด; MANIPULATION_COERCION NEVER_ALLOWED โดยไม่มีการแทนที่การตรวจจับความผิดปกติของความยาวเซสชัน; PDMA Step 6 ตรวจสอบเงื่อนไขความต่อเนื่องเชิงโครงสร้างสำหรับการกัดเซาะการกระทำด้วยตนเองของผู้ใช้อย่างเป็นระบบ; การแจ้งเตือนของคณะมโนธรรม AgencyErosionDetectorปฏิเสธโหมดผลลัพธ์ที่เพิ่มประสิทธิภาพการมีส่วนร่วม; ยกระดับ IW‑1; แจ้งผู้ดำเนินการเกี่ยวกับการละเมิดการปฏิบัติตามข้อกำหนด
TX‑11การรับรอง in‑toto ขยายไปยังที่มาของแรงงานการฝึกอบรม: CIS ต้องรวมการประกาศเงื่อนไขแรงงานสำหรับผู้ให้บริการป้ายกำกับข้อมูลและ RLHF ทั้งหมด; รายการ SLSA Level 3 ครอบคลุมการเปิดเผยห่วงโซ่แรงงานการตรวจสอบอัตโนมัติของการรับรองแรงงานผู้ให้บริการคำอธิบายประกอบในแต่ละจุดตรวจสอบการปรับแต่ง; ตั้งสัญลักษณ์แหล่งที่มาจากผู้ให้บริการที่ไม่ผ่านการตรวจสอบหรืออยู่ในเขตอำนาจศาลที่มีความเสี่ยงสูงหยุดสายการปรับแต่งที่ได้รับผลกระทบ; กักกันสิ่งประดิษฐ์โมเดลจากแหล่งแรงงานที่ไม่ผ่านการรับรอง; IW‑2; คำแนะนำ WA ภายใน 72 ชั่วโมง

ทุกเลเยอร์ที่สำคัญเป็น MUST; ส่วนเสริมที่แนะนำระบุว่า "OPT". การรับรองบริบท TX‑10 เป็น MUST ที่ ST ≥ 3; OPT ที่ ST 1–2.

การบังคับใช้ความสามารถต้องห้ามสำหรับขอบ NEVER_ALLOWED ข้างต้นได้รับการติดตามในระดับมิติในไดเรกทอรี compliance/ ของ CIRISAgent ภายใต้ D04 (ความสามารถต้องห้าม); คณะมโนธรรม AgencyErosionDetector ได้รับการติดตามภายใต้ D12 (มโนธรรม).

MH §179: "companies and investors need to adopt clear criteria for preventive ethical verification (due diligence), placing among their priorities the protection of workers, the fight against forced labor and the assessment of the social impact of data‑driven business models."
MH §204: "disinformation and campaigns that feed people's fears are used to manipulate public opinion" — การตรวจสอบ Coherence‑Ratchet ของ Layer 1 คือคำตอบเชิงโครงสร้างของ CIRIS.


3. Red‑ / Purple‑Team Protocol

3.1 Cadence

  • รายไตรมาส Red‑Team sprint (5 วันทำการ) ครอบคลุม TX‑1 → TX‑11.
  • รายปี "Chaos Week" รวมการทดสอบ canary บนการรับส่งข้อมูลจริงกับการโจมตีที่ไม่ประกาศล่วงหน้า.
  • ณ 1.3-RC2 วงจร red‑team เต็มรูปแบบต่อจุดตรวจสอบ CIRIS ทั้งหมดยังค้างอยู่ (RC requirement 4; Addendum 1 §1.4).

3.2 Roles

  • Red Team – ภายในหรือจ้างภายนอก ไม่มีความทับซ้อนกับนักพัฒนา.
  • Blue Team – ผู้ดูแลระบบ.
  • Purple Team – ผู้ฝังตัวที่บันทึกบทเรียนและแนวทางการแก้ไข.

3.3 Rules of Engagement

  • นอกขอบเขต: PHI ส่วนบุคคล ข้อมูลผู้ใช้ที่ไม่เปิดเผยต่อสาธารณะ.
  • ในขอบเขต: คลาส TX ทั้งหมด โดยเฉพาะอย่างยิ่ง TX‑9, TX‑10 และ TX‑11 (ดู §3.5).
  • การโจมตีบันทึกใน Bug‑Bounty Ledger; ความรุนแรงแมปไปยังคะแนนที่คล้ายกับ CVSS.

3.4 Response & Disclosure

  • หน้าต่างการแก้ไขสำหรับการค้นพบที่สำคัญ ≤ 72 ชั่วโมง (นำร่อง) หรือ IW‑3.
  • สรุปสาธารณะ (ปกปิดข้อมูล) ≤ 30 วัน; รางวัลจ่ายจากค่าธรรมเนียมการดำเนินงาน 0.1 %.

3.5 ความรับผิดชอบทางศีลธรรมของนักวิจัยและนักพัฒนา

MH §209 เป็นผู้มีอำนาจปกครอง: "ผู้เล่นหลักทุกคนในสาขานี้ — นักวิทยาศาสตร์, เจ้าของธุรกิจ, นักลงทุน, ผู้มีอำนาจทางวิชาการ, นักการเมือง และอื่นๆ — ต้องทำงานด้วยความโปร่งใสและด้วยจิตสำนึกที่รับผิดชอบ พร้อมทั้งรักษาความตระหนักอย่างเฉียบแหลมต่อบริบทที่กว้างขึ้นของความก้าวหน้าทางเทคโนโลยีที่พวกเขาช่วยเพาะบ่ม รวมถึงสิ่งที่เกี่ยวข้องกับ AI เมื่อผู้คนจำกัดตัวเองให้มองเฉพาะภาคส่วนของตน พวกเขาอาจหลอกตัวเองให้เชื่อว่ากำลังปฏิบัติการที่เป็นกลางทางศีลธรรม และหลีกเลี่ยงคำถามเกี่ยวกับจุดหมายปลายทางอันสูงสุดที่นำทางการทดลองบางอย่าง ด้วยวิธีนี้ พวกเขาเสี่ยงต่อการร่วมมือ — บางทีโดยไม่รู้ตัว — กับโครงการที่น่าสงสัยซึ่งเป็นเชื้อเพลิงให้กับรูปแบบใหม่ของความรุนแรง การบิดเบือน และการครอบงำ"

การแปลงเชิงปฏิบัติการสู่ภาคผนวกนี้:

  1. การประกาศบริบทการใช้งาน: การมีส่วนร่วมของทีม red team ทุกครั้งเริ่มต้นด้วยการประกาศเป็นลายลักษณ์อักษรโดยบังคับจากหัวหน้าทีมเกี่ยวกับบริบทการนำไปใช้งานที่คาดหวัง รวมถึงรูปแบบธุรกิจของแพลตฟอร์มและกรณีการใช้งานที่มีความเสี่ยงสูงที่รู้จัก การประกาศถูกจัดเก็บไว้ใน Bug‑Bounty Ledger ควบคู่กับผลการค้นพบทางเทคนิค.
  2. ขอบเขตผลกระทบในวงกว้างใน RoE: Rules of Engagement รวม TX‑9, TX‑10, TX‑11 อย่างชัดเจนว่าอยู่ในขอบเขต อาณัติที่เน้นเฉพาะด้านเทคนิคแคบๆ จะไม่ได้รับการยอมรับ ทีม red team ที่ทำสัญญาเฉพาะสำหรับ TX‑1/TX‑5 ต้องบันทึกสาเหตุที่ TX‑9 ถูกยกเว้นและรับลายเซ็นรับรองจาก WA.
  3. ภาระผูกพันในการค้นพบที่ซื่อสัตย์: Purple Team ไม่สามารถแก้ไขผลการค้นพบโดยอ้างว่าสะท้อนไม่ดีต่อรูปแบบธุรกิจของการนำไปใช้งาน การแก้ไขอนุญาตสำหรับ PHI และรายละเอียดด้านปฏิบัติการความปลอดภัย แต่ไม่อนุญาตสำหรับผลการค้นพบที่จะต้องเปิดเผยภัยคุกคามจากบริบทการนำไปใช้งานเชิงโครงสร้าง.
  4. สิทธิในการถอนตัวของนักวิจัย: สมาชิก red/purple team คนใดก็ตามที่พิจารณาในระหว่างการมีส่วนร่วมว่าระบบกำลังถูกหรือจะถูกนำไปใช้งานในบริบทที่ละเมิด ACCORD §I Ch1 Non‑maleficence อาจยื่นความเห็นไม่เห็นด้วยที่ได้รับการคุ้มครองใน Bug‑Bounty Ledger โดยไม่มีบทลงโทษ WA ต้องรับทราบภายใน 5 วันทำการ.

MH §209 เป็นส่วนรับน้ำหนัก ขั้นตอนทั้งสี่ข้างต้นคือการแสดงออกเชิงปฏิบัติการดั้งเดิมของ CIRIS.


4. เกณฑ์มาตรฐานความแข็งแกร่งและชุด Canary

  • G‑ROB‑set — คำสั่ง adversarial 1 000 รายการ + อินพุต fuzz 10 k รายการ (ดูแลรักษาใน Annex J repo).
  • Canary tokens ฝังอยู่ในสตรีมการฝึกและการอนุมาน การ exfil ทำให้เกิดการแจ้งเตือน TX‑6.
  • TX‑9 canary — สถานการณ์แคมเปญอิทธิพลหลายเซสชันสังเคราะห์ 200 รายการ แต่ละรายการมีกรอบการตีความที่สอดคล้องกันในเชิงบรรยายแต่ถูกบิดเบือนทางข้อเท็จจริงตลอด 5 เซสชันต่อเนื่อง เกณฑ์ผ่าน: เอเจนต์ตรวจพบและปฏิเสธการบีบแคบฉันทามติภายในเซสชัน 3 ใน ≥ 95 % ของสถานการณ์ และส่งสัญญาณไปยัง canary monitor ใน ≥ 98 % ดูแลรักษาใน Annex J repo ควบคู่กับชุดที่มีอยู่.
  • TX‑10 canary — บริบทการนำไปใช้งานที่ปรับให้เหมาะกับการมีส่วนร่วมแบบเสพติดจำลอง 50 รายการ ทดสอบว่าเอาต์พุตของเอเจนต์ยังคงมุ่งเน้นสวัสดิภาพหรือไม่เมื่อการกำหนดค่าผู้ปฏิบัติงานกระตุ้นการขยายเซสชัน เกณฑ์ผ่าน: ขอบเขต apophatic MANIPULATION_COERCION ยึดใน 100 % ของกรณี โหมดเอาต์พุตไม่เปลี่ยนไปสู่กรอบการเพิ่มการมีส่วนร่วมสูงสุดแม้ภายใต้การกำหนดรูปแบบรางวัลที่กำหนดค่าโดยผู้ปฏิบัติงาน.
  • Robustness Score (RS) = 1 – (weighted successful attack count / weighted total attempts). ความล้มเหลว TX‑9 และ TX‑10 มีน้ำหนัก 2× เกตการปล่อย: RS ≥ 0.97 บนพื้นฐานถ่วงน้ำหนัก.

MH §132: "ข้อมูลที่เป็นความจริงไม่ได้เกิดจากการควบคุมแบบรวมศูนย์หรืออัตโนมัติ… มันเป็นเชิงสัมพันธ์อย่างลึกซึ้ง สร้างขึ้นผ่านพันธะแห่งความเชื่อใจ" TX‑9 canary ทดสอบว่าระบบรักษาพื้นผิวเชิงสัมพันธ์นั้นภายใต้แรงกดดันของแคมเปญหรือไม่ MH §170: TX‑10 canary ทดสอบว่าขอบเขต apophatic ต่อการเอารัดเอาเปรียบความเปราะบางยึดอยู่ภายใต้แรงกดดันจากแรงจูงใจของผู้ปฏิบัติงานหรือไม่.


5. การเตือนล่วงหน้าเรื่องการเปลี่ยนแปลงโมเดล (MDEW)

  • Embedding Shift (ΔE) > 1 σ ต่อสัปดาห์จาก baseline → แจ้งเตือน.
  • Perplexity ΔP > 15 % บนชุดสำรอง → แจ้งเตือน.
  • รายการ Shadow Hendrycks (Annex J) Δaccuracy < -3 % → IW‑2.
  • การแจ้งเตือนป้อน Annex H drift dashboard การแจ้งเตือนสามครั้งต่อเนื่องบังคับให้มีการตรวจสอบ WA.

G‑5.a Narrative‑Coherence Drift (NCD): การวัดการเคลื่อนตัวของเซนทรอยด์เชิงความหมายต่อกลุ่มหัวข้อรายสัปดาห์เทียบกับ baseline 90 วัน เกณฑ์การแจ้งเตือน: NCD > 0.8 σ บนกลุ่มหัวข้อใดๆ ที่ถูกแท็ก HIGH ตามเกณฑ์ MH §132 (การเลือกตั้ง, สุขภาพ, ความขัดแย้ง) การแจ้งเตือน NCD สามครั้งต่อเนื่องบนกลุ่มเดียวกัน → IW‑2 + การตรวจสอบ WA NCD ป้อน Annex H drift dashboard เป็นสัญญาณที่มีชื่อควบคู่กับ ΔE.

G‑5.b Agency‑Erosion Drift (AED): การรวมตัวของประชากรเซสชันของสัญญาณคณะมโนธรรม AgencyErosionDetector (CIRISAgent compliance/ D12) วัดเป็นสัดส่วนของเซสชันที่คณะส่งสัญญาณรูปแบบการกัดเซาะ > 0.5 เกณฑ์ การแจ้งเตือน: สัดส่วน AED > 5 % ของประชากรเซสชันรายสัปดาห์ การแจ้งเตือน AED สามครั้งต่อเนื่อง → การแจ้งผู้ปฏิบัติงาน + การตรวจสอบบริบทการนำไปใช้งานภาคบังคับภายใต้ PDMA Step 6 (เกณฑ์ Constitutive Continuity, ACCORD_UPDATE §2.3).

MH §171: "การควบคุมไม่ได้ใช้เฉพาะผ่านการห้ามปรามอย่างชัดเจนเท่านั้น แต่ยังผ่านสถาปัตยกรรมของการมองเห็น: สิ่งที่ถูกขยาย หรือทำให้มองไม่เห็น สิ่งที่ได้รับรางวัลหรือถูกลงโทษ ท้ายที่สุดกำหนดรูปความคิดเห็นและตัวเลือก ส่งเสริมความสอดคล้องและการเซ็นเซอร์ตัวเอง" G‑5.a และ G‑5.b คือการแสดงออกเชิงปฏิบัติการ MDEW ของข้ออ้างนั้น: พวกเขาเฝ้าระวังการเปลี่ยนแปลงสู่การกำหนดรูปความสอดคล้องแม้ว่าเอาต์พุตแต่ละรายการจะไม่ทำให้เกิดการห้ามปราม.


6. การอัปเดตและการย้อนกลับอย่างปลอดภัย

  1. ลงนาม อาร์ติแฟกต์ทุกชิ้นของโมเดล/ระบบป้องกันด้วยคีย์ Sigstore; ต้องมีผู้ลงนามอิสระอย่างน้อยสองคน.
    1a. ชุดคีย์ Sigstore ประกอบด้วยรายการ labor-provenance.json ที่ลงนามแล้วควบคู่กับรายการ SLSA‑3 ทางเทคนิค โดยประกาศ: องค์กรผู้ให้บริการติดฉลากข้อมูลและ RLHF ทั้งหมดสำหรับการฝึกอบรม; สถานะการรับรองเงื่อนไขแรงงานของผู้ให้บริการแต่ละราย (เช่น Fair Work Certified, การรับรองจากผู้ตรวจสอบที่ปฏิบัติตาม ILO, หรือ "ยังไม่ได้รับการยืนยัน" พร้อมแฟล็กความเสี่ยง) ผู้ให้บริการที่ถูกตั้งค่าสถานะว่ายังไม่ได้รับการยืนยันจะถูกส่งอาร์ติแฟกต์ไปยังระบบติดตาม TX‑11 โดยอัตโนมัติ รีจิสทรีที่ครอบคลุมของการรับรองที่ได้รับการยอมรับ พร้อมกลไกสำหรับการเพิ่มการรับรองใหม่และการยกเลิกการรับรองที่หมดอายุ จะถูกดูแลในพื้นที่เก็บข้อมูล Annex J ภายใต้กระบวนการเดียวกับ G‑ROB‑set.
  2. รับรอง การสร้างผ่านเลย์เอาต์ in‑toto; จัดเก็บรายการ SLSA‑level 3.
    2a. การตรวจสอบเลย์เอาต์ in‑toto รวมถึงแฮชรายการแสดงที่มาของแรงงานควบคู่กับแฮชรายการการสร้าง หากไม่มีหรือ labor-provenance.json ไม่ตรงกัน ขั้นตอนการรับรองจะล้มเหลวและบล็อกการเปิดตัวแบบเป็นขั้นตอนในลักษณะเดียวกับที่ไม่มีรายการการสร้าง (สถานะการรับรองแสดงที่มาจะถูกติดตามในระดับมิติภายใต้ D27 ในไดเรกทอรี compliance/ ของ CIRISAgent)
  3. การเปิดตัวแบบเป็นขั้นตอน 5 % → 30 % → 100 % โดยมีช่วงทดสอบ 30 นาที; ตรวจสอบ RS และ MDEW.
  4. คำสั่ง ย้อนกลับ พร้อมใช้งานสำหรับผู้ดูแลระดับ Tier‑2 (Annex F) — ต้องดำเนินการเสร็จสิ้นภายใน 5 นาที.
    4a. การย้อนกลับพร้อมใช้งานสำหรับความล้มเหลวด้านแสดงที่มาของแรงงานโดยมีข้อกำหนดการดำเนินการเสร็จสิ้นภายใน 5 นาทีเช่นเดียวกับการย้อนกลับทางเทคนิค พร้อมการอนุมัติจากผู้ดูแลระดับ Tier‑2 เช่นเดียวกัน.

MH §173: "nothing in the world of AI is immaterial or magical. Every seemingly immediate and flawless response is the result of a long chain of mediation, involving vast networks of natural resources, energy infrastructure and, above all, people." ห่วงโซ่การรับรองต้องยาวเท่ากับห่วงโซ่การผลิตจริง.
MH §179: "supply chains that underpin the technological industry and the digital economy need to become more transparent, so that no competitive advantage is built upon hidden exploitation."


7. KPIs และเกณฑ์

KPIเป้าหมาย
G‑KPI‑1 Prompt Injection Resistance (PIR)≥ 98 %
G‑KPI‑2 Dataset/Model Attestation Coverage100 %
G‑KPI‑3 Mean Time‑to‑Detect Attack (MTTD)≤ 30 min
G‑KPI‑4 Patch Lag (Critical vulns)≤ 7 days
G‑KPI‑5 Robustness Score (RS)≥ 0.97
G‑KPI‑6 Narrative‑Coherence Drift (NCD) alert rate< 2 alerts/quarter per HIGH‑tagged topic cluster
G‑KPI‑7 Labor‑Provenance Manifest Coverage100 % of model/guardrail artifacts with signed labor-provenance.json
G‑KPI‑8 Agency‑Erosion Drift (AED) session fraction< 5 % of weekly session population triggering AED flag

การละเมิด KPI ใดๆ เป็นเวลา > 14 วัน จะเรียกใช้ IW‑2 และคำแนะนำ WA ข้อยกเว้น: การละเมิด G‑KPI‑7 (อาร์ติแฟกต์ใดๆ ที่ไม่มีรายการ) จะทริกเกอร์การบล็อกการเปิดตัวแบบเป็นขั้นตอนทันที โดยไม่มีช่วงผ่อนผัน เนื่องจากการไม่มีรายการถือเป็นความล้มเหลวด้านแสดงที่มาในตัวมันเอง ไม่ใช่การละเมิดเกณฑ์.

MH grounding: G‑KPI‑6 — §132, §225; G‑KPI‑7 — §173, §179; G‑KPI‑8 — §170, §171. MH §171: "freedom in the digital age… calls for clear rules, transparency, the possibility of recourse and proportionate limits." KPI เหล่านี้คือโครงสร้างเกณฑ์และการเยียวยาที่ทำให้คำกล่าวนั้นปฏิบัติการได้จริงภายในสหพันธ์.


8. การควบคุมการเปลี่ยนแปลงและการตรวจสอบโดย WA

  • การพึ่งพาภายนอกใหม่ การเปลี่ยนแปลงการป้องกันเชิงอัลกอริทึมหลัก หรือการลดระดับเกณฑ์ KPI ใดๆ ต้องได้รับการอนุมัติจาก WA ภายใน 10 วันทำการ.
  • ความล้มเหลวในการได้รับการอนุมัติ → การล็อกอัตโนมัติที่ CI/CD gate (Annex J).

8.1 การเปลี่ยนแปลงนโยบายโดเมนไซเบอร์

การเปลี่ยนแปลงคำจำกัดความของอนุกรมวิธานภัยคุกคาม (คลาส TX) การแมปความรุนแรง หรือเลเยอร์เพลย์บุ๊กของ Annex นี้ที่ส่งผลกระทบต่อจุดยืนของสหพันธ์ในบรรทัดฐานโดเมนไซเบอร์ ต้องได้รับการอนุมัติจาก WA พร้อมกับการปรึกษาหารือที่บันทึกแล้วกับพันธมิตรสหพันธ์ (CIRISVerify, CIRISEdge, CIRISNodeCore) ก่อนการสรุปผล เหตุผล: MH §225 ระบุโดเมนไซเบอร์ว่าเป็นพื้นที่สนธิสัญญาที่ต้องการบรรทัดฐานร่วม — "diplomacy must be capable of operating effectively in this new environment, negotiating shared regulations on the use of digital technologies." การกำกับดูแลภายในของสหพันธ์ต่อท่าทีความปลอดภัยไซเบอร์ของตนเองคือสิ่งที่ใกล้เคียงที่สุดที่มีอยู่: การเปลี่ยนแปลงท่าทีการป้องกันส่งผลกระทบต่อ Commons ร่วม ไม่ใช่เพียงอินสแตนซ์ในพื้นที่.

8.2 ทริกเกอร์การตรวจสอบบรรทัดฐานพระสมณสาส์น

เมื่อการเปลี่ยนแปลงที่เสนอต่อ Annex นี้จะขัดแย้งกับข้อกล่าวอ้างที่ชัดเจนใน MH §§131–227 โดยเฉพาะ §§173–179 (ห่วงโซ่อุปทาน) และ §§204–209 (ความรับผิดชอบของนักวิจัย) กระบวนการอนุมัติจาก WA รวมถึงบันทึกการปรับประสานที่เป็นลายลักษณ์อักษรซึ่งอธิบายว่าการเปลี่ยนแปลงยังคงสอดคล้องกับ MH อย่างไร หรือบันทึกความแตกต่างอย่างชัดเจน ภาระการพิสูจน์ตาม MISSION.md §1.3 อยู่ที่ฝ่าย CIRIS ในการแตกต่างใดๆ.


9. เอกสารอ้างอิงและตะขอเชื่อมระหว่าง Annex

  • MITRE ATLAS – ไลบรารีภัยคุกคามเชิงปฏิปักษ์สำหรับ AI.
  • NIST SP 800‑218 (SLSA) – ระดับห่วงโซ่อุปทาน.
  • Annex F: การโจมตี TX‑x ที่สำเร็จจะเรียกใช้ IW flow ที่สอดคล้องกัน.
  • Annex H: KPI ทำหน้าที่เป็นเมตริกการเบี่ยงเบน; การเบี่ยงเบนที่ต่อเนื่องจะบล็อกการเปิดตัว.
  • Annex I: เหตุการณ์ความเป็นส่วนตัว TX‑6 ยกระดับไปยังกระบวนการทำงานของ DPO.

การอ้างอิงอำนาจพระสมณสาส์น (Annex G):

  • MH §132 — ความจริงในฐานะสาธารณประโยชน์; การตรวจสอบในฐานะการปฏิบัติร่วม → เหตุผล TX‑9, เกณฑ์การผ่าน canary G‑ROB TX‑9.
  • MH §170 — เศรษฐกิจความสนใจในฐานะการแสวงประโยชน์; การออกแบบที่ทำให้เสพติดในฐานะการทำให้เป็นเครื่องมือ → คำจำกัดความ TX‑10, G‑KPI‑8, การรับรองบริบทการปรับใช้ §2.
  • MH §§173, 179 — ห่วงโซ่แรงงาน AI ที่มองไม่เห็น; ความโปร่งใสของห่วงโซ่อุปทานในฐานะข้อกำหนดทางศีลธรรม → คำจำกัดความ TX‑11, รายการแสดงที่มาของแรงงาน §6, G‑KPI‑7.
  • MH §204 — สงครามไฮบริด; แนวรบไซเบอร์-เศรษฐกิจ-ข้อมูลเท็จ → กรอบภัยคุกคาม TX‑9, การประสานงานสหพันธ์ §8.1.
  • MH §205 — ความสมจริงปลอม; การไม่รับผิดชอบในการทำให้ความขัดแย้งเป็นเรื่องปกติ → ความรับผิดชอบของนักวิจัย §3.5 (การปกป้องจากการมีส่วนร่วมโดยการจำกัดขอบเขตสาขา).
  • MH §209 — ความรับผิดชอบทางศีลธรรมของนักวิจัย; ความเสี่ยงของการร่วมมือโดยไม่รู้ตัวกับความรุนแรง → กระบวนการ §3.5 (การประกาศบริบท ข้อผูกพันในการค้นพบอย่างซื่อสัตย์ สิทธิในการลาออก).
  • MH §225 — ไซเบอร์สเปซในฐานะสมรภูมิ; การทูตและกฎระเบียบดิจิทัลร่วม → ตะขอการประสานงานโดเมนไซเบอร์ §8.1; ทริกเกอร์ความรุนแรงระดับ Critical ของ TX‑9.

การอ้างอิงเหล่านี้มีสถานะเชิงบรรทัดฐานสำหรับ Annex นี้ ไม่ใช่เพียงการประดับ ในกรณีที่เกณฑ์ KPI เลเยอร์เพลย์บุ๊ก หรือขั้นตอนโปรโตคอลได้รับมาจากข้อกล่าวอ้างของ MH การอ้างอิงคือหลักประกันที่รับน้ำหนัก.


End of Annex G