Цю сторінку перекладено машинним способом. Якщо щось здається неправильним, будь ласка, відкрийте звернення — репозиторій є публічним не просто так. Повідомити про проблему з перекладом

назад до лобі

Coherence Collapse Analysis

Коли додаткові перевірки перестають допомагати?

Нагромадження перевірок для виявлення брехні допомагає лише тоді, коли перевірки справді незалежні. Якщо вони таємно копіюють одна одну, додавання нових нічого не дає. Coherence Collapse Analysis — це простий математичний апарат, що вимірює цю різницю. Повна версія з усіма доведеннями міститься в статті.

Математична сторінка

Перевірено програмним забезпеченням для доведення

П'ять перевірок, що всі копіюють одна одну, — це насправді одна перевірка.

Уявіть, що п'ять людей перевіряють відповідь і всі п'ять погоджуються. Це відчувається безпечно. Але якщо всі п'ятеро дізналися це з одного й того самого місця, їхня згода — не п'ять думок. Це одна думка, повторена п'ять разів. Кількість перевірок виглядає як п'ять. Реальна кількість — одна.

Це важливо для AI. Система AI може виконувати багато перевірок власного міркування і все одно помилитись, якщо ці перевірки мають однакову сліпу пляму. Coherence Collapse Analysis — це те, як CIRIS відрізняє справжні перевірки від відлунь.

Підраховуємо, скільки перевірок у вас є насправді.

В основі всього лежить одна коротка формула. Вона походить із опитувальної статистики, де її називають дизайн-ефектом Кіша, і та сама форма з'являється в теорії голосування та в інженерії безпеки. CIRIS застосовує її до вирівнювання AI.

real checks = checks / (1 + copying × (checks − 1))

«Checks» — кількість виконаних перевірок. «Copying» — ступінь їх збігу, від 0 (всі незалежні) до 1 (всі однакові). Результат — скільки перевірок у вас є насправді.

Без копіювання: десять перевірок рахуються як десять. Кожна перевірка виправдовує своє місце.

Повне копіювання: десять перевірок рахуються як одна. Не важливо, скільки ви додасте.

Це було виміряно, а не просто задекларовано.

CIRIS виміряла кількість реальних перевірок на власному живому трафіку агента, охоплюючи тисячі записаних рішень. На здоровому трафіку вона перебувала в діапазоні приблизно семи-дев'яти справді незалежних перевірок. Це вимірювання і те, як воно здійснювалось, є предметом дослідження Constrained Reasoning Chains. Живі числа можна відстежувати на дослідницькій сторінці.

Чого ця математика не може.

Стаття доводить жорстке обмеження на саму себе. Деякі види шкоди виникають не від однієї нечесної частини. Вони виникають від чесних частин, що в сумі дають поганий результат, і стаття доводить, що частина такої шкоди невидима для будь-якої перевірки, яка дивиться лише на частини, наскільки б хорошою вона не була. CIRIS говорить про це прямо, замість того щоб удавати, що математика вловлює все.

Що система справді обіцяє, так це запис. Кожне рішення залишає підписану квитанцію, яку не можна непомітно переписати, тож брехня мусить залишатися узгодженою з тисячами квитанцій, які вона ніколи не зможе стерти. Уміння добре читати ці квитанції залишається відкритою роботою, і ми кажемо це прямо. Облікові книги залишаються правдивими в будь-якому разі.

Математика — це одна частина більшого цілого.

Ця сторінка — вимірювання. Coherence Ratchet — це те, як вимірювання застосовується на практиці. Федерація — це те, як воно стає спільним для багатьох систем. А повні доведення, написані так, щоб комп'ютер міг перевірити їх рядок за рядком, містяться в статті та репозиторії RATCHET.

CIRISsafe by structure · open by principle · kind by design