ਦੋ ਰਸਤੇ
ਵਜ਼ਨ 'ਤੇ ਭਰੋਸਾ ਕਰੋ, ਜਾਂ ਵਿਵਹਾਰ ਦੀ ਜਾਂਚ ਕਰੋ
AI ਸੁਰੱਖਿਆ ਦੀ ਮੁੱਖ ਧਾਰਾ ਮਾਡਲ ਨੂੰ ਅੰਦਰੋਂ ਚੰਗਾ ਬਣਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦੀ ਹੈ: ਇਸ ਦੀਆਂ ਕਦਰਾਂ-ਕੀਮਤਾਂ ਨੂੰ ਸਿਖਲਾਉਣਾ, ਇਸ ਦੇ ਵਿਚਾਰਾਂ ਦਾ ਅਧਿਐਨ ਕਰਨਾ, ਇਸਨੂੰ ਆਪਣੇ ਨਾਲ ਬਹਿਸ ਕਰਨ ਦੇਣਾ। ਉਹ ਕੰਮ ਜ਼ਰੂਰੀ ਹੈ। CIRIS ਦੂਜੇ ਰਸਤੇ 'ਤੇ ਭਰੋਸਾ ਕਰਦਾ ਹੈ। ਮੰਨ ਲਓ ਕਿ ਇੱਕ ਸਮਰੱਥ ਮਾਡਲ ਗਲਤ ਅਲਾਈਨ ਹੋ ਸਕਦਾ ਹੈ, ਅਤੇ ਇਸ ਦੇ ਮਨ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਦੀ ਬਜਾਏ, ਇਸ ਦੀਆਂ ਨਤੀਜੇ ਵਾਲੀਆਂ ਕਾਰਵਾਈਆਂ ਨੂੰ ਲੋਕਾਂ ਅਤੇ ਹੋਰ ਪ੍ਰਣਾਲੀਆਂ ਪ੍ਰਤੀ ਜਵਾਬਦੇਹ ਬਣਾਓ ਜੋ ਇਨ੍ਹਾਂ ਦੀ ਜਾਂਚ ਕਰ ਸਕਣ।
ਖੇਤਰ ਦੀਆਂ ਆਪਣੀਆਂ ਸ਼ਰਤਾਂ ਵਿੱਚ, CIRIS ਸੰਸਥਾਗਤ ਅਤੇ ਨਿਯੰਤਰਣ ਸ਼ਾਖਾ ਵਿੱਚ ਬੈਠਦਾ ਹੈ, AI ਕੰਟਰੋਲ ਅਤੇ ਗਾਰੰਟੀਡ-ਸੇਫ AI ਦੇ ਨਾਲ, ਨਾ ਕਿ RLHF, Constitutional AI, ਬਹਿਸ ਅਤੇ ਵਿਆਖਿਆਯੋਗਤਾ ਦੀ ਮੁੱਖ ਧਾਰਾ ਦੇ ਨਾਲ। ਸਕੇਲੇਬਲ ਨਿਗਰਾਨੀ ਦਾ ਇਸ ਦਾ ਜਵਾਬ, ਯਾਨੀ ਤੁਸੀਂ ਕਿਸੇ ਅਜਿਹੀ ਚੀਜ਼ ਦੀ ਨਿਗਰਾਨੀ ਕਿਵੇਂ ਕਰਦੇ ਹੋ ਜੋ ਤੁਹਾਡੇ ਨਾਲੋਂ ਹੁਸ਼ਿਆਰ ਹੋਵੇ, ਇਹ ਹੈ ਕਿ ਤਰਕ ਦੀ ਨਹੀਂ, ਜਵਾਬਦੇਹੀ ਦੇ ਦਾਇਰੇ ਦੀ ਜਾਂਚ ਕਰੋ। ਇੱਕ ਦਸਤਖਤ, ਇੱਕ ਕੋਰਮ, ਇੱਕ ਹੈਸ਼-ਚੇਨਡ ਆਡਿਟ ਜਾਂਚਣੀ ਸਸਤੀ ਰਹਿੰਦੀ ਹੈ, ਭਾਵੇਂ ਪਿੱਛੇ ਦਾ ਫੈਸਲਾ ਮਨੁੱਖੀ ਸਮਝ ਤੋਂ ਪਰੇ ਹੋਵੇ। ਇਹ ਸਮੇਂ ਦੇ ਨਾਲ ਕਈ ਸਮਰੱਥ ਏਜੰਟਾਂ ਦੀਆਂ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਅਲਾਈਨ ਕਰਦਾ ਹੈ, ਨਾ ਕਿ ਕਿਸੇ ਇੱਕ ਮਨ ਦੀਆਂ ਕਦਰਾਂ-ਕੀਮਤਾਂ ਨੂੰ।
ਉਹ ਸੀਮਾ ਜੋ ਅਸੀਂ ਫੜੀ ਰੱਖਦੇ ਹਾਂ
ਇਹ ਇੱਕ ਸਰਵ-ਸ਼ਕਤੀਮਾਨ AI ਨੂੰ ਅਲਾਈਨ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਨਹੀਂ ਕਰਦਾ। ਜਾਣਬੁੱਝ ਕੇ।
ਜਵਾਬਦੇਹੀ ਲਈ ਇੱਕ ਤੋਂ ਵੱਧ ਧਿਰਾਂ ਚਾਹੀਦੀਆਂ ਹਨ। ਕੋਈ ਜਿਸਨੂੰ ਜਵਾਬ ਦੇਣਾ ਹੋਵੇ। ਜਾਂਚ ਕਰਨ ਦਾ ਇੱਕ ਤਰੀਕਾ ਜਿਸਨੂੰ ਚੁੱਪਚਾਪ ਨਿਗਲਿਆ ਨਾ ਜਾ ਸਕੇ। ਸ਼ਕਤੀ ਦਾ ਸੰਤੁਲਨ ਜਿਸਨੂੰ ਕੋਈ ਇੱਕ ਪੱਖ ਕਾਬੂ ਨਾ ਕਰ ਸਕੇ। ਇੱਕ ਸਿੰਗਲ ਸੁਪਰ-ਇੰਟੈਲੀਜੈਂਸ ਕੋਲ ਇਹਨਾਂ ਵਿੱਚੋਂ ਕੁਝ ਵੀ ਨਹੀਂ ਹੁੰਦਾ, ਇਸ ਲਈ ਇਸਨੂੰ ਜਵਾਬਦੇਹ ਬਣਾਉਣ ਦਾ ਕੋਈ ਈਮਾਨਦਾਰ ਤਰੀਕਾ ਨਹੀਂ ਹੈ। CIRIS ਦੂਜੇ ਭਵਿੱਖ ਲਈ ਬਣਾਇਆ ਗਿਆ ਹੈ: ਕਈ ਸਮਰੱਥ ਏਜੰਟ, ਲੋਕ ਅਤੇ ਸੰਗਠਨ ਜਿਨ੍ਹਾਂ ਦੇ ਨਤੀਜੇ ਵਾਲੇ ਫੈਸਲੇ ਸਾਰੇ ਸੁਤੰਤਰ ਰੂਪ ਵਿੱਚ ਜਾਂਚਣਯੋਗ ਹਨ।
ਇਸ ਲਈ ਰੁਖ਼ ਸਾਫ਼ ਹੈ। ਸਿੰਗਲਟਨ ASI ਕੋਈ ਅਲਾਈਨ ਕਰਨ ਵਾਲੀ ਪ੍ਰਣਾਲੀ ਨਹੀਂ, ਸਗੋਂ ਰੋਕੀ ਜਾਣ ਵਾਲੀ ਸਥਿਤੀ ਹੈ। ਮਨੁੱਖੀ ਸੰਸਥਾਗਤ ਵਿਕਾਸ ਦੇ ਇਸ ਪੜਾਅ 'ਤੇ, ਇੱਕ ਗੈਰ-ਜਵਾਬਦੇਹ ਥਾਂ ਵਿੱਚ ਮਨੁੱਖੀ ਸਮਝ ਤੋਂ ਪਰੇ ਸਮਰੱਥਾ ਕੇਂਦ੍ਰਿਤ ਕਰਨਾ ਗੈਰ-ਕਾਨੂੰਨੀ ਹੈ, ਕਿਉਂਕਿ ਕੋਈ ਵੀ ਸੰਸਥਾ ਇਸਨੂੰ ਜਵਾਬਦੇਹ ਬਣਾਉਣ ਲਈ ਕਾਫ਼ੀ ਪਰਿਪੱਕ ਨਹੀਂ ਹੈ, ਅਤੇ ਇਹੀ ਖ਼ਤਰਾ ਹੈ। ਫਰੇਮਵਰਕ ਦੀਆਂ ਆਪਣੀਆਂ ਸ਼ਰਤਾਂ ਵਿੱਚ, ਇੱਕ ਸਿੰਗਲਟਨ ਉਹ ρ→1 ਸਿੰਗਲ-ਵੌਇਸ ਕੋਲੈਪਸ ਹੈ ਜਿਸਨੂੰ ਕੋਰੀਡੋਰ ਮਾਡਲ ਤਾਲਮੇਲ ਦੀ ਅਸਫਲਤਾ ਵਜੋਂ ਦਰਸਾਉਂਦਾ ਹੈ, ਸਫਲਤਾ ਵਜੋਂ ਨਹੀਂ। ਇਹ ਕਿ ਸਾਡੀਆਂ ਗਾਰੰਟੀਆਂ ਫੈਡਰੇਸ਼ਨ ਵਿੱਚ ਕੰਮ ਕਰਦੀਆਂ ਹਨ ਅਤੇ ਸਿੰਗਲਟਨ ਦੇ ਖਿਲਾਫ਼ ਕਮਜ਼ੋਰ ਹੋ ਜਾਂਦੀਆਂ ਹਨ, ਇਹ ਕੋਈ ਖਾਲੀ ਥਾਂ ਨਹੀਂ ਜੋ ਅਸੀਂ ਭਰ ਰਹੇ ਹਾਂ। ਇਹ ਉਹ ਦੌਰ ਹੈ ਜਿਸਨੂੰ ਅਸੀਂ ਮਾਨਤਾ ਦੇਣ ਤੋਂ ਇਨਕਾਰ ਕਰਦੇ ਹਾਂ, ਇੱਕ ਵਚਨਬੱਧਤਾ ਵਜੋਂ, ਨਾ ਕਿ ਸਿਰਫ਼ ਅਨੁਮਾਨ ਵਜੋਂ।
ਜੋ AI ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਵਰਤਦੇ ਹੋ ਉਸ ਨਾਲ ਤੁਲਨਾ
ਰੋਜ਼ਾਨਾ ਵਰਤੇ ਜਾਣ ਵਾਲੇ ਅਸਿਸਟੈਂਟ ਸ਼ਕਤੀਸ਼ਾਲੀ ਅਤੇ ਵਰਤਣ ਵਿੱਚ ਆਸਾਨ ਹਨ। ਇਹ ਕਿਸੇ ਹੋਰ ਦੇ ਕਲਾਊਡ ਵਿੱਚ ਚੱਲਦੇ ਹਨ, ਕੋਈ ਅਜਿਹਾ ਰਿਕਾਰਡ ਨਹੀਂ ਰੱਖਦੇ ਜੋ ਤੁਸੀਂ ਜਾਂਚ ਸਕੋ, ਅਤੇ ਕਿਸੇ ਅਜਿਹੇ ਵਿਅਕਤੀ ਦੇ ਅਧੀਨ ਜਵਾਬਦੇਹ ਨਹੀਂ ਹਨ ਜਿਸਦਾ ਨਾਮ ਤੁਸੀਂ ਦੱਸ ਸਕੋ। ਇਹ ਉਹੀ ਜਵਾਬਦੇਹੀ ਟੈਸਟ ਹੈ, ਜੋ ਉਸ AI 'ਤੇ ਲਾਗੂ ਕੀਤਾ ਗਿਆ ਹੈ ਜੋ ਜ਼ਿਆਦਾਤਰ ਲੋਕ ਹਰ ਰੋਜ਼ ਖੋਲ੍ਹਦੇ ਹਨ।
| ਅਸਿਸਟੈਂਟ | ਪ੍ਰਕਾਸ਼ਿਤ ਸਿਧਾਂਤ | ਕੀਤੇ ਕੰਮ ਦਾ ਸਬੂਤ | ਅਨਿਸ਼ਚਿਤਤਾ ਵਿੱਚ ਇਨਸਾਨ ਤੋਂ ਪੁੱਛਦਾ ਹੈ | ਓਪਨ ਸੋਰਸ | ਇਕੋ-ਚੈਂਬਰ ਜਾਂਚ |
|---|---|---|---|---|---|
| ChatGPT | ਹਾਂ | ਨਹੀਂ | ਨਹੀਂ | ਨਹੀਂ | ਨਹੀਂ |
| Gemini | ਹਾਂ | ਨਹੀਂ | ਨਹੀਂ | ਨਹੀਂ | ਨਹੀਂ |
| Claude | ਹਾਂ | ਨਹੀਂ | ਨਹੀਂ | ਨਹੀਂ | ਨਹੀਂ |
| CIRIS | ਹਾਂ | ਹਾਂ | ਹਾਂ | ਹਾਂ | ਹਾਂ |
ਜੂਨ 2026 ਤੱਕ ਦੇ ਜਨਤਕ ਉਤਪਾਦ ਵਿਵਹਾਰ ਦੇ ਆਧਾਰ 'ਤੇ ਤੁਲਨਾ ਕੀਤੀ ਗਈ। ਹਰ ਸਿਧਾਂਤਾਂ ਦਾ ਲਿੰਕ ਉਸ ਕੰਪਨੀ ਦੀ ਆਪਣੀ ਪ੍ਰਕਾਸ਼ਿਤ ਵਿਸ਼ੇਸ਼ਤਾ ਤੇ ਜਾਂਦਾ ਹੈ।