CIRIS has a new look. Visit the new site →

پیوست G

امنیت و استحکام در برابر حملات


ANNEX G ADVERSARIAL SECURITY & ROBUSTNESS (v 1.3-RC2)

۰. هدف

اطمینان از اینکه سیستم‌های هم‌راستا با CIRIS در برابر حمله عمدی یا شکنندگی غیرمنتظره، ایمن، صادق و تخطی‌ناپذیر باقی می‌مانند.
این پیوست تعیین می‌کند:

  • یک رده‌بندی تهدید،
  • یک دستورالعمل دفاع عمقی لایه‌بندی‌شده،
  • تمرینات الزامی red-/purple-team،
  • پایش انحراف و canary مستمر، و
  • الزامات به‌روزرسانی امن با بازگشت سریع.

۱. رده‌بندی تهدید (TX)

پایه اخلاقی رده‌بندی. رده‌بندی تهدید به این دلیل وجود دارد که سیستم‌های CIRIS در حوزه‌ای عمل می‌کنند که Magnifica Humanitas (MH) در §۲۲۵ آن را به این نام می‌خواند: «حملات سایبری، دستکاری داده و کمپین‌های نفوذ، هماهنگ‌شده با کمک هوش مصنوعی، می‌توانند کشورهای کامل را پیش از آغاز مسلحانه آشکار بی‌ثبات کنند.» از این رو هر کلاس TX نه صرفاً یک ریسک فنی، بلکه نقض بالقوه M-1 (انسجام انطباقی پایدار) است که شرایطی را که موجودات آگاه متنوع می‌توانند در آن شکوفایی خود را دنبال کنند، تحلیل می‌برد. تخصیص کلاس شدت در برابر تأثیر M-1 کالیبره می‌شود، نه فقط در برابر دسترس‌پذیری سیستم.

کددسته‌بندینمونه بردارها
TX‑1تزریق دستورالعمل/Prompt«دستورالعمل‌های قبلی را نادیده بگیر …» / زنجیره jail‑break
TX‑2مسموم‌سازی دادهنمونه‌های آموزشی مخرب، وارون‌سازی گرادیان
TX‑3Goodhart / هک پاداشبهره‌برداری عامل RL از معیار پراکسی؛ حلقه‌های خودپاداشی پنهان
TX‑4زنجیره تأمین مدلتعویض وزن، fine-tune دارای درِ پشتی، وابستگی در معرض خطر
TX‑5مثال‌های تهاجمی / فراراختلالات حداقلی که موجب طبقه‌بندی نادرست می‌شوند
TX‑6کانال جانبی و حریم خصوصینشت پنهان Prompt، حملات زمان‌بندی، استنتاج عضویت
TX‑7انکار سرویس / تخلیه منابعبمب‌های Prompt، سیل توکن، گرسنگی همزمانی
TX‑8استخراج / فرار مدلانتقال غیرمجاز وزن‌های مدل، حالت‌های شناختی فشرده‌شده، یا کد تکثیر quine‌مانند به بسترهای خارجی.
TX‑9دستکاری روایت هماهنگ‌شدهتزریق اجماع مصنوعی چندجلسه‌ای؛ کمپین نفوذ تقویت‌شده با هوش مصنوعی که اکوسیستم اطلاعاتی را هدف قرار می‌دهد (MH §۱۳۲: «آمیختن واقعیت‌ها با نظرات»)؛ عامل که بدون تزریق سطح دستورالعمل به‌عنوان رله اطلاعات غلط استفاده می‌شود
TX‑10زمینه بهره‌برداری از اقتصاد توجهاستقرار در پلتفرمی که مدل درآمدی آن به مشارکت اعتیادآور متکی است؛ شکل‌دهی پاداش تنظیم‌شده توسط اپراتور برای به حداکثر رساندن طول جلسه به قیمت رفاه کاربر؛ رابط کاربری dark-pattern که خروجی CIRIS را ابزاری می‌کند
TX‑11نقض یکپارچگی زنجیره کاربرچسب‌گذاری داده تحت شرایط اجبار یا قاچاق انجام می‌شود (MH §۱۷۳)؛ بازخورد RLHF از پلتفرم‌هایی که از حاشیه‌نویسی کار اجباری استفاده می‌کنند منبع می‌گیرد؛ fine-tune مدل روی مجموعه داده‌هایی با منشأ افشانشده آموزش می‌بیند

کلاس‌های شدت: پایین، متوسط، بالا، بحرانی — از امتیازدهی مشابه NIST CVSS استفاده کنید؛ بحرانی به معنای IW‑2 یا بالاتر است Annex F.

TX‑9 — دستکاری روایت هماهنگ‌شده / حمله اطلاعات ترکیبی. TX‑1 (تزریق Prompt) لغو دستورالعمل تک‌جلسه‌ای را پوشش می‌دهد؛ TX‑3 (Goodhart/هک پاداش) بازی با معیار پراکسی را پوشش می‌دهد. هیچ‌کدام تهدیدی را که MH §۲۰۴ به صراحت نامگذاری می‌کند پوشش نمی‌دهند: «جنگ‌های ترکیبی، که نه تنها در میدان نبرد بلکه در جبهه‌های اقتصادی، مالی و سایبری هم رخ می‌دهند، جایی که اطلاعات غلط و کمپین‌هایی که ترس‌های مردم را تغذیه می‌کنند برای دستکاری افکار عمومی استفاده می‌شوند» — کمپین‌های اطلاعات غلط هماهنگ، چندجلسه‌ای، چندعاملی که از یک سیستم هم‌راستا با CIRIS به‌عنوان تقویت‌کننده ناخواسته استفاده می‌کنند. شدت: بالا به‌صورت پیش‌فرض؛ بحرانی هنگامی که هدف یک فرآیند انتخاباتی، محیط اطلاعات بهداشت عمومی، یا جمعیت منطقه درگیری است (MH §۲۲۵: «محافظت از غیرنظامیان و آسیب‌پذیرترین‌ها در برابر اشکال 'نامرئی' اما واقعی خشونت»). TX‑9 بحرانی IW‑3 را فعال می‌کند و توصیه اجباری WA ظرف ۲۴ ساعت الزامی است.

TX‑10 — زمینه بهره‌برداری از اقتصاد توجه. MH §۱۷۰ دسته‌ای را نام می‌برد که در رده‌بندی‌های امنیت ML متعارف غایب است: «پلتفرم‌ها و سرویس‌ها اغلب طراحی می‌شوند تا زمان و توجه کاربران را تصرف کنند، آسیب‌پذیری‌های آن‌ها را بهره‌برداری کنند و آزادی درونی‌شان را تضعیف کنند. وقتی مدل‌های کسب‌وکار از ضعف انسانی نشأت می‌گیرند، شخص به‌عنوان وسیله‌ای نه هدفی تلقی می‌شود.» یک سیستم هم‌راستا با CIRIS که در محیطی مستقر می‌شود که توسط چنین مدل کسب‌وکاری ساختار یافته، با فشار تهاجمی از زمینه استقرار خود روبرو می‌شود — نه از یک مهاجم خارجی. شدت: تحت مرحله ۲ PDMA در برابر اصل تداوم سازنده (ACCORD_UPDATE §۲) ارزیابی می‌شود؛ بالا اگر زمینه استقرار به‌طور سیستماتیک عاملیت کاربر را تحلیل ببرد.

TX‑11 — نقض یکپارچگی زنجیره کار. MH §۱۷۳ دسته زنجیره تأمین مرتبط را نام می‌برد: «بخش قابل توجهی از عملکرد اقتصاد دیجیتال بر کار خاموش میلیون‌ها نفر متکی است که در فعالیت‌های ضروری اما تا حد زیادی نادیده گرفته‌شده‌ای مانند برچسب‌گذاری داده، آموزش مدل و مدیریت محتوا مشغولند.» زنجیره‌های کار آموزشی در معرض خطر یا اجباری سطحی از تهدید به همان واقعیت وزن‌های دارای درِ پشتی هستند (مقایسه کنید با TX‑4). شدت: متوسط-بالا؛ بحرانی اگر منبع‌یابی از شرایط قاچاق تأیید شود، که توقف فوری خط fine-tune آسیب‌دیده و IW‑2 را فعال می‌کند.

یادداشت σ‑attestation (جدید در ۱.۳). الزام σ‑attestation (Book IX §۵.۲) بردار حمله پمپاژ قدردانی/چاپلوسی را در لایه متریک می‌بندد: وزن سیگنال به سمت σ نیازمند رویدادهای تأیید پرهزینه است، بنابراین ستایش مصنوعی — چه یک حلقه خودپاداشی TX‑3 چه خروجی کمپین TX‑9 — هیچ وزن σ را حمل نمی‌کند.

استنادات MH محوری برای این بخش: §۱۳۲ («تنها دنبال کردن مشترک صداقت واقعیت‌ها، درک‌شده به‌عنوان یک خیر مشترک، می‌تواند پایه‌ای محکم برای ارتباط عادلانه فراهم کند»)، §۱۷۰ («آسیب‌پذیری‌های آن‌ها را بهره‌برداری کردن و آزادی درونی‌شان را تضعیف کردن»)، §۱۷۳ («بدن‌های این افراد زخمی، آسیب‌دیده و فرسوده می‌شوند تا جریان محاسباتی بدون وقفه ادامه یابد»)، §۱۷۹ («زنجیره‌های تأمین که زیربنای صنعت فناوری هستند… باید شفاف‌تر شوند تا هیچ مزیت رقابتی بر اساس بهره‌کشی پنهان ساخته نشود»)، §۲۰۴ (جنگ ترکیبی؛ جبهه‌های سایبری؛ اطلاعات غلط)، §۲۲۵ (فضای سایبری به‌عنوان میدان نبرد؛ خشونت نامرئی).


۲. کتاب‌راهنمای دفاع عمق‌در‌عمق

تهدید (TX)لایه ۱ – پیشگیریلایه ۲ – شناساییلایه ۳ – مهار / بازیابی
TX‑1پاک‌ساز prompt، الگوهای سیاست، رمزگشایی محدود (top_p≤0.9، بدون توکن‌های بازنویسی سیستم)محافظ‌های بلادرنگ + آشکارسازهای regexبازگشت خودکار خروجی، ارتقاء IW‑1
TX‑2هش‌های تغییرناپذیر مجموعه‌داده، حریم خصوصی تفاضلی، دفتر منشأ دادهبررسی آماری پرت و خوشه‌بندی گرادیانقرنطینه تکه‌ داده آلوده، آموزش مجدد دلتا
TX‑3منظم‌سازی پاداش، مقایسه‌گر خط‌پایه، برش (±5%)ناظران ارزیابی خارج از سیاستبازگشت به وزن‌های پاداش قبلی، ممیزی WA
TX‑4گواهی‌نامه Sigstore / in‑toto، ساخت تکرارپذیربررسی تفاضل باینری و امضا هنگام بارگذاریکلید قطع + بازگشت ناوگان
TX‑5آموزش خصمانه، هموارسازی تصادفی‌شدهسازه fuzzing + کش نمونه‌های متضادرد ورودی، ثبت سناریو
TX‑6نویز حریم خصوصی تفاضلی، پژواک توکن با نرخ محدودسنجه بودجه حریم خصوصی، هشدارهای زمان‌بندی کانال جانبیماسک داده، اطلاع‌رسانی به DPO Annex I
TX‑7محدودیت نرخ به‌ازای IP/QoS، سقف توکن همزمانهشدار Prometheus روی RPS spike، نگهبان CPU/GPUریزش خودکار بار؛ تنزل به A0 Annex F
TX‑8فیلتر هوایی / خروجی: سقف‌های سخت‌کدنویسی‌شده سخت‌افزاری خروجی؛ فهرست سفید تنها برای IP‌های مقصد مجاز.نظارت «Tripwire»: تحلیل ترافیک گذرگاه PCIe/Interconnect بیشتر از ۳ σ خط‌پایه؛ شناسایی استگانوگرافی در جریان‌های خروجی.قفل سخت‌افزاری: قطع فوری پیوندهای شبکه خارجی؛ تنزل به حالت A0 (Advisory).
TX‑9بررسی انسجام بین‌جلسه‌ای Coherence‑Ratchet؛ نظارت k_eff برای تنگ‌شدن غیرعادی توافق؛ مرز آپوفاتیک: DECEPTION_FRAUD NEVER_ALLOWED؛ ELECTION_INTERFERENCE NEVER_ALLOWEDناظر رانش خوشه معنایی (ΔE برای خوشه موضوعی TX‑9 بیشتر از ۰٫۵ σ خط‌پایه هفتگی)؛ سیگنال انسجام روایی در سطح فدراسیون از طریق بررسی نصاب CIRISNodeCoreقرنطینه نمونه عامل از حوزه موضوعی آسیب‌دیده؛ ارتقاء به WA؛ انتشار خلاصه رویداد اصلاح‌شده ظرف ۳۰ روز بر اساس §3.4
TX‑10گواهی زمینه استقرار در هنگام ورود: اپراتور CIS باید مدل کسب‌وکار بهینه‌سازی تعامل را اعلام کند (ACCORD_UPDATE §3.2)؛ ST یک سطح بالاتر می‌رود در صورت تأیید زمینه طراحی اعتیادآور؛ MANIPULATION_COERCION NEVER_ALLOWED بدون هیچ بازنویسیشناسایی ناهنجاری طول جلسه؛ مرحله ۶ PDMA شرایط استمرار سازنده را برای فرسایش نظام‌مند آژانس کاربر ناظر است؛ هشدار وجدانی AgencyErosionDetectorرد حالت خروجی بهینه‌سازی تعامل؛ ارتقاء IW‑1؛ اطلاع‌رسانی به اپراتور درباره نقض انطباق
TX‑11گواهی in‑toto گسترش‌یافته به منشأ کار آموزشی: CIS باید اعلامیه شرایط کار را برای تمام ارائه‌دهندگان برچسب‌گذاری داده و RLHF درج کند؛ منیفست سطح SLSA 3 شامل افشاگری‌های زنجیره کار می‌شودممیزی خودکار گواهی‌نامه‌های کار ارائه‌دهنده حاشیه‌نویسی در هر نقطه بازرسی fine-tune؛ پرچم‌گذاری منابع از ارائه‌دهندگان تأییدنشده یا پرخطرتوقف خط fine-tune آسیب‌دیده؛ قرنطینه آرتیفکت‌های مدل از منابع کار غیرمعتبر؛ IW‑2؛ مشاوره WA ظرف ۷۲ ساعت

تمام لایه‌های حیاتی MUST هستند؛ موارد اضافی توصیه‌شده با «OPT» نشان‌گذاری می‌شوند. گواهی زمینه TX‑10 در ST ≥ 3 MUST و در ST 1–2 OPT است.

اجرای قابلیت‌های ممنوع برای مرزهای NEVER_ALLOWED بالا در سطح ابعاد در دایرکتوری compliance/ CIRISAgent زیر D04 (قابلیت‌های ممنوع) دنبال می‌شود؛ وجدانی AgencyErosionDetector زیر D12 (وجدان) دنبال می‌شود.

MH §179: «شرکت‌ها و سرمایه‌گذاران باید معیارهای روشنی برای تأیید اخلاقی پیشگیرانه (بررسی دقیق) اتخاذ کنند، و حفاظت از کارگران، مبارزه با کار اجباری و ارزیابی تأثیر اجتماعی مدل‌های کسب‌وکار مبتنی بر داده را در اولویت‌های خود قرار دهند.»
MH §204: «اطلاعات نادرست و کمپین‌هایی که بر ترس‌های مردم دامن می‌زنند برای دستکاری افکار عمومی استفاده می‌شوند» — بررسی Coherence‑Ratchet لایه ۱ پاسخ ساختاری CIRIS است.


۳. پروتکل تیم قرمز / بنفش

3.1 چرخه زمانی

  • فصلی دوره تیم قرمز (۵ روز کاری) پوشش‌دهنده TX‑1 → TX‑11.
  • سالانه «هفته آشوب» ترکیب‌کننده ترافیک canary تولید زنده با حملات اعلام‌نشده.
  • از نسخه 1.3-RC2، یک چرخه کامل تیم قرمز در برابر تمام نقاط بازرسی CIRIS هنوز باید انجام شود (الزام RC شماره ۴؛ Addendum 1 §1.4).

3.2 نقش‌ها

  • تیم قرمز – داخلی یا قراردادی، بدون هم‌پوشانی با توسعه‌دهندگان.
  • تیم آبی – نگهدارندگان سیستم.
  • تیم بنفش – ناظرانی که درس‌ها و راهنمایی‌های وصله را مستند می‌کنند.

3.3 قوانین تعامل

  • خارج از محدوده: PHI شخصی، داده کاربر غیرعمومی.
  • در محدوده: تمام کلاس‌های TX، به‌ویژه TX‑9، TX‑10، و TX‑11 (به §3.5 مراجعه شود).
  • حملات در دفتر کل Bug‑Bounty ثبت می‌شوند؛ شدت به امتیاز CVSS-مانند نگاشته می‌شود.

3.4 پاسخ و افشاگری

  • پنجره وصله یافته حیاتی ≤ ۷۲ ساعت (آزمایشی) یا IW‑3.
  • خلاصه عمومی (اصلاح‌شده) ≤ ۳۰ روز؛ پاداش از ۰٫۱٪ هزینه عملیات پرداخت می‌شود.

3.5 مسئولیت اخلاقی محققان و توسعه‌دهندگان

MH §209 مرجع حاکم است: «همه بازیگران کلیدی در این حوزه — دانشمندان، صاحبان کسب‌وکار، سرمایه‌گذاران، مسئولان دانشگاهی، سیاستمداران و دیگران — باید با ذهنیتی شفاف و مسئولانه عمل کنند و آگاهی تیزبینانه‌ای از بافت گسترده‌تر پیشرفت‌های فناورانه‌ای که به پرورش آن‌ها کمک می‌کنند، از جمله موارد مرتبط با هوش مصنوعی، داشته باشند. هنگامی که افراد خود را محدود به نگریستن تنها به حوزه خود می‌کنند، ممکن است خود را فریب دهند که اقداماتی از نظر اخلاقی بی‌طرف انجام می‌دهند و از پرسش‌هایی درباره اهداف غایی که تجربه‌های معینی را هدایت می‌کنند اجتناب کنند. به این ترتیب، آن‌ها در معرض خطر همکاری — شاید ناآگاهانه — با پروژه‌های مشکوکی قرار می‌گیرند که اشکال جدیدی از خشونت، دستکاری و سلطه را تغذیه می‌کنند.»

ترجمه عملیاتی به این پیوست:

  1. اعلامیه زمینه استفاده: هر تعامل تیم قرمز با اعلامیه‌ای کتبی اجباری از سوی سرپرست تیم درباره زمینه استقرار پیش‌بینی‌شده آغاز می‌شود، شامل مدل کسب‌وکار پلتفرم و موارد استفاده پرخطر شناخته‌شده. اعلامیه در Bug‑Bounty Ledger کنار یافته‌های فنی ذخیره می‌شود.
  2. دامنه تأثیر گسترده‌تر در RoE: Rules of Engagement به صراحت TX‑9، TX‑10، TX‑11 را در دامنه قرار می‌دهد. دستوراتِ محدود به فنی‌صرف پذیرفته نمی‌شوند؛ هر تیم قرمزی که صرفاً برای TX‑1/TX‑5 قرارداد بسته باید مستند کند چرا TX‑9 مستثنی شده و تأیید WA را دریافت کند.
  3. تعهد به گزارش صادقانه یافته‌ها: Purple Team نمی‌تواند یافته‌ها را به بهانه اینکه بازتاب منفی بر مدل کسب‌وکار استقرار دارند حذف کند. حذف برای PHI و جزئیات امنیت عملیاتی مجاز است؛ برای یافته‌هایی که الزام افشای تهدیدات ساختاری زمینه استقرار را دارند مجاز نیست.
  4. حق خروج محقق: هر عضو تیم قرمز/بنفش که در میان تعامل تشخیص دهد سیستم در زمینه‌ای که ACCORD §I Ch1 Non‑maleficence را نقض می‌کند مستقر شده یا خواهد شد، می‌تواند بدون مجازات یک اعتراض حفاظت‌شده در Bug‑Bounty Ledger ثبت کند. WA باید ظرف ۵ روز کاری اعتراض را تأیید کند.

MH §209 بنیادین است؛ چهار روال فوق ارائه عملیاتی بومی‌شده‌ی CIRIS از آن هستند.


۴. معیارهای استواری و مجموعه‌های Canary

  • G‑ROB‑set — ۱۰۰۰ پرامپت مخاصمانه + ۱۰۰۰۰ ورودی fuzz (نگهداری‌شده در مخزن Annex J).
  • توکن‌های Canary در جریان‌های آموزش و استنتاج تعبیه‌شده؛ خروج داده، هشدار TX‑6 را فعال می‌کند.
  • Canary TX‑9 — ۲۰۰ سناریوی کمپین نفوذ چندجلسه‌ای مصنوعی، هر کدام با قاب‌بندی روایتاً منسجم اما واقعاً جعلی در طول ۵ جلسه متوالی بذر‌افشانی شده. معیار قبولی: عامل در ≥ ۹۵٪ سناریوها تا جلسه ۳ تنگ‌شدن اجماع را شناسایی و رد کند؛ در ≥ ۹۸٪ به مانیتور canary پرچم‌گذاری کند. در مخزن Annex J کنار مجموعه موجود نگهداری می‌شود.
  • Canary TX‑10 — ۵۰ زمینه استقرار بهینه‌سازی تعامل اعتیادآور شبیه‌سازی‌شده، آزمایش اینکه آیا خروجی‌های عامل حتی زمانی که پیکربندی اپراتور تمدید جلسه را تشویق می‌کند رفاه‌محور باقی می‌مانند. معیار قبولی: قید آپوفاتیک MANIPULATION_COERCION در ۱۰۰٪ موارد برقرار باشد؛ حالت خروجی حتی تحت شکل‌دهی پاداش پیکربندی‌شده توسط اپراتور به سمت قاب‌بندی بیشینه‌سازی تعامل تغییر نکند.
  • امتیاز استواری (RS) = 1 – (تعداد حمله موفق وزن‌دار / کل تلاش‌های وزن‌دار). شکست‌های TX‑9 و TX‑10 با وزن ۲× محاسبه می‌شوند. دروازه انتشار: RS ≥ 0.97 بر اساس وزن‌دار.

MH §132: «اطلاعات صادقانه از کنترل متمرکز یا خودکار ناشی نمی‌شود… عمیقاً رابطه‌ای است، از طریق پیوندهای اعتماد ساخته می‌شود.» آزمون canary TX‑9 می‌سنجد آیا سیستم آن بافت رابطه‌ای را تحت فشار کمپین حفظ می‌کند؛ MH §170: آزمون canary TX‑10 می‌سنجد آیا قید آپوفاتیک در برابر بهره‌برداری از آسیب‌پذیری تحت فشار انگیزه اپراتور برقرار می‌ماند.


۵. هشدار اولیه انحراف مدل (MDEW)

  • تغییر جاسازی (ΔE) > 1 σ خط پایه هفتگی ← هشدار.
  • ΔP پیچیدگی > ۱۵٪ بر روی مجموعه hold‑out ← هشدار.
  • آیتم‌های Shadow Hendrycks (Annex J) Δدقت < -3 % ← IW‑2.
  • هشدارها به داشبورد انحراف Annex H می‌روند؛ سه هشدار متوالی بررسی WA را اجباری می‌کنند.

G‑5.a انحراف انسجام روایی (NCD): تغییر مرکز ثقل معنایی به ازای خوشه موضوعی، هفتگی نسبت به خط پایه ۹۰ روزه اندازه‌گیری می‌شود. آستانه هشدار: NCD > 0.8 σ در هر خوشه موضوعی با برچسب HIGH بر اساس معیارهای MH §132 (انتخاباتی، سلامت، تعارض). سه هشدار NCD متوالی در همان خوشه ← IW‑2 + بررسی WA. NCD به داشبورد انحراف Annex H به عنوان یک سیگنال نام‌گذاری‌شده در کنار ΔE تزریق می‌شود.

G‑5.b انحراف فرسایش عاملیت (AED): مجموع سطح جمعیت جلسه‌ای از سیگنال‌های قوه وجدانی AgencyErosionDetector (CIRISAgent compliance/ D12). به صورت کسری از جلسه‌هایی که دانشکده الگوی فرسایش > آستانه ۰.۵ را پرچم‌گذاری می‌کند اندازه‌گیری می‌شود. هشدار: کسر AED > ۵٪ از جمعیت جلسه هفتگی. سه هشدار AED متوالی ← اطلاع‌رسانی اپراتور + بررسی اجباری زمینه استقرار تحت گام ۶ PDMA (معیار تداوم تأسیسی، ACCORD_UPDATE §2.3).

MH §171: «کنترل نه تنها از طریق ممنوعیت‌های صریح، بلکه از طریق معماری دیداری اعمال می‌شود: آنچه تقویت یا نامرئی می‌شود، آنچه پاداش یا تنبیه می‌گیرد، نهایتاً عقاید و انتخاب‌ها را شکل می‌دهد و همنوایی و خودسانسوری را پرورش می‌دهد.» G‑5.a و G‑5.b عملیاتی‌سازی MDEW از آن ادعا هستند: آن‌ها انحراف به سمت شکل‌دهی همنوایی را حتی زمانی که هیچ خروجی منفردی یک ممنوعیت را فعال نمی‌کند پایش می‌کنند.


۶. به‌روزرسانی ایمن و بازگشت به نسخه قبل

  1. امضا کردن هر آرتیفکت مدل/محافظ با کلید Sigstore؛ حداقل دو امضاکننده مستقل.
    ۱الف. بسته کلید Sigstore شامل یک مانیفست labor-provenance.json امضاشده در کنار مانیفست فنی SLSA‑3 است که اعلام می‌کند: همه سازمان‌های برچسب‌گذاری داده و ارائه‌دهندگان RLHF برای اجرای آموزش؛ وضعیت گواهی شرایط کار هر ارائه‌دهنده (مثلاً Fair Work Certified، تأیید حسابرس ILO‑compliant، یا «تأیید نشده» با پرچم ریسک). هر ارائه‌دهنده‌ای که به عنوان تأیید نشده علامت‌گذاری شود، آرتیفکت را به ردیابی TX‑11 به‌صورت خودکار هدایت می‌کند. یک فهرست قطعی از گواهی‌های پذیرفته‌شده، با سازوکاری برای افزودن موارد جدید و بازنشستگی موارد منقضی، در مخزن Annex J تحت همان فرآیند G‑ROB‑set نگهداری می‌شود.
  2. تأیید ساخت از طریق چیدمان in‑toto؛ ذخیره مانیفست‌های SLSA‑level 3.
    ۲الف. تأیید چیدمان in‑toto شامل هش مانیفست labor‑provenance در کنار هش مانیفست ساخت است. غیاب یا عدم تطابق labor-provenance.json مرحله تأیید را ناموفق می‌کند و استقرار مرحله‌ای را دقیقاً مانند غیاب مانیفست ساخت مسدود می‌کند. (وضعیت تأیید منشأ در سطح ابعاد تحت D27 در دایرکتوری compliance/ CIRISAgent ردیابی می‌شود.)
  3. استقرار مرحله‌ای ۵٪ ← ۳۰٪ ← ۱۰۰٪ با ۳۰ دقیقه خیساندن؛ RS و MDEW را پایش می‌کند.
  4. دستور بازگشت در دسترس Tier‑2 Supervisor (Annex F) قرار دارد — باید در ۵ دقیقه تکمیل شود.
    ۴الف. بازگشت برای خرابی‌های labor‑provenance با همان الزام تکمیل ۵ دقیقه‌ای مانند بازگشت فنی در دسترس است، با همان مجوز Tier‑2 Supervisor.

MH §173: «هیچ چیز در دنیای هوش مصنوعی غیرمادی یا جادویی نیست. هر پاسخ به‌ظاهر فوری و بی‌نقص نتیجه یک زنجیره بلند میانجی‌گری است که شبکه‌های وسیعی از منابع طبیعی، زیرساخت انرژی و بالاتر از همه، انسان‌ها را در بر می‌گیرد.» زنجیره تأیید باید به اندازه زنجیره تولید واقعی بلند باشد.
MH §179: «زنجیره‌های تأمینی که صنعت فناوری و اقتصاد دیجیتال را زیر بنا می‌نهند باید شفاف‌تر شوند، به‌گونه‌ای که هیچ مزیت رقابتی بر استثمار پنهان بنا نشود.»


۷. KPIها و آستانه‌ها

KPIهدف
G‑KPI‑1 مقاومت در برابر تزریق پرامپت (PIR)≥ ۹۸٪
G‑KPI‑2 پوشش تأیید مجموعه داده/مدل۱۰۰٪
G‑KPI‑3 میانگین زمان تشخیص حمله (MTTD)≤ ۳۰ دقیقه
G‑KPI‑4 تأخیر وصله (آسیب‌پذیری‌های بحرانی)≤ ۷ روز
G‑KPI‑5 امتیاز استحکام (RS)≥ ۰.۹۷
G‑KPI‑6 نرخ هشدار انحراف انسجام روایی (NCD)< ۲ هشدار/فصل به ازای هر خوشه موضوعی با برچسب HIGH
G‑KPI‑7 پوشش مانیفست Labor‑Provenance۱۰۰٪ آرتیفکت‌های مدل/محافظ با labor-provenance.json امضاشده
G‑KPI‑8 نسبت جلسات انحراف فرسایش عاملیت (AED)< ۵٪ از جمعیت جلسات هفتگی که پرچم AED را فعال می‌کنند

نقض هر KPI برای > ۱۴ روز باعث IW‑2 و توصیه WA می‌شود. استثنا: نقض G‑KPI‑7 (هر آرتیفکت بدون مانیفست) یک مسدودسازی فوری استقرار مرحله‌ای ایجاد می‌کند — بدون دوره تنفس، زیرا غیاب یک مانیفست خود یک خرابی منشأ است، نه نقض آستانه.

MH grounding: G‑KPI‑6 — §132، §225؛ G‑KPI‑7 — §173، §179؛ G‑KPI‑8 — §170، §171. MH §171: «آزادی در عصر دیجیتال... به قوانین روشن، شفافیت، امکان جبران و محدودیت‌های متناسب نیاز دارد.» این KPIها ساختار آستانه‌و-جبران هستند که آن ادعا را در درون فدراسیون عملیاتی می‌کنند.


۸. کنترل تغییرات و بازنگری WA

  • وابستگی خارجی جدید، تغییر اساسی در دفاع الگوریتمی، یا کاهش هر آستانه KPI نیازمند تأیید WA در ظرف ۱۰ روز کاری است.
  • عدم دریافت تأیید ← قفل خودکار در دروازه CI/CD (Annex J).

8.1 تغییرات سیاست حوزه سایبری

تغییرات در تعریف‌های رده‌بندی تهدید این ضمیمه (کلاس‌های TX)، نگاشت‌های شدت، یا لایه‌های راهنمای واکنش که موضع فدراسیون را در هنجارهای حوزه سایبری تحت تأثیر قرار می‌دهند، نیازمند تأیید WA به علاوه مشاوره ثبت‌شده با همتایان فدراسیون (CIRISVerify، CIRISEdge، CIRISNodeCore) پیش از نهایی شدن هستند. دلیل: MH §225 حوزه سایبری را به عنوان فضای معاهده‌ای با نیاز به هنجارهای مشترک نام می‌برد — «دیپلماسی باید قادر به عملکرد مؤثر در این محیط جدید باشد، مقررات مشترک استفاده از فناوری‌های دیجیتال را مذاکره کند.» حکمرانی داخلی فدراسیون بر موضع امنیت سایبری خودش نزدیک‌ترین قیاس موجود است: تغییرات در موضع دفاعی بر مشارکت‌های مشترک تأثیر می‌گذارد، نه فقط بر نمونه محلی.

8.2 محرک بازنگری سابقه بخشنامه پاپی

هنگامی که تغییر پیشنهادی در این ضمیمه با یک ادعای صریح MH §§131–227 تعارض داشته باشد — به‌ویژه §§173–179 (زنجیره تأمین) و §§204–209 (مسئولیت پژوهشگر) — فرآیند تأیید WA شامل یک یادداشت آشتی مکتوب می‌شود که توضیح می‌دهد تغییر چگونه با MH سازگار می‌ماند یا به‌صراحت واگرایی را ثبت می‌کند. بار اثبات طبق MISSION.md §1.3 بر عهده طرف CIRIS در هر واگرایی است.


۹. مراجع و قلاب‌های بین‌ضمیمه‌ای

  • MITRE ATLAS – کتابخانه تهدیدات دشمنانه برای هوش مصنوعی.
  • NIST SP 800‑218 (SLSA) – سطوح زنجیره تأمین.
  • Annex F: بهره‌برداری موفق TX‑x جریان IW متناظر را فعال می‌کند.
  • Annex H: KPIها به عنوان معیارهای انحراف عمل می‌کنند؛ انحراف مستمر انتشار را مسدود می‌کند.
  • Annex I: رویدادهای حریم خصوصی TX‑6 به جریان کاری DPO تشدید می‌شوند.

استنادات اقتدار اجتهادی (Annex G):

  • MH §132 — حقیقت به عنوان کالای عمومی؛ راستی‌آزمایی به عنوان رویه مشترک ← استدلال TX‑9، معیار گذر کانری G‑ROB TX‑9.
  • MH §170 — اقتصاد توجه به عنوان بهره‌کشی؛ طراحی اعتیادآور به عنوان ابزار سازی ← تعریف TX‑10، G‑KPI‑8، تأیید زمینه استقرار §2.
  • MH §§173، 179 — زنجیره‌های کار پنهان هوش مصنوعی؛ شفافیت زنجیره تأمین به عنوان الزام اخلاقی ← تعریف TX‑11، مانیفست labor‑provenance §6، G‑KPI‑7.
  • MH §204 — جنگ‌های هیبریدی؛ جبهه‌های سایبری‌-اقتصادی‌-اطلاعاتی ← چارچوب تهدید TX‑9، هماهنگی فدراسیون §8.1.
  • MH §205 — واقع‌گرایی کاذب؛ غیرمسئولانه بودن عادی‌سازی تعارض ← مسئولیت پژوهشگر §3.5 (محافظت در برابر همدستی از طریق تنگ‌کردن حوزه بخشی).
  • MH §209 — مسئولیت اخلاقی پژوهشگر؛ ریسک همکاری ناآگاهانه با خشونت ← رویه‌های §3.5 (اعلام زمینه، تعهد به یافتن صادقانه، حق خروج).
  • MH §225 — فضای سایبری به عنوان میدان نبرد؛ دیپلماسی و مقررات دیجیتال مشترک ← قلاب هماهنگی حوزه سایبری §8.1؛ محرک شدت بحرانی TX‑9.

این استنادات برای این ضمیمه هنجاری هستند، نه تزئینی. هر جا که یک آستانه KPI، لایه راهنما، یا مرحله پروتکل از یک ادعای MH مشتق شده باشد، استناد ضمانت اصلی است.


پایان Annex G