ਇਹ ਪੰਨਾ ਮਸ਼ੀਨ ਦੁਆਰਾ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ ਸੀ। ਜੇ ਕੁਝ ਗਲਤ ਪੜ੍ਹਿਆ ਜਾਵੇ, ਕਿਰਪਾ ਕਰਕੇ ਇੱਕ ਮੁੱਦਾ ਖੋਲ੍ਹੋ, ਰਿਪੋ ਇੱਕ ਕਾਰਨ ਨਾਲ ਜਨਤਕ ਹੈ। ਅਨੁਵਾਦ ਸਮੱਸਿਆ ਦੀ ਰਿਪੋਰਟ ਕਰੋ

ਲੌਬੀ ਤੇ ਵਾਪਸ ਜਾਓ

ਸੁਪਰਅਲਾਈਨਮੈਂਟ ਦਾ ਦ੍ਰਿਸ਼

ਖੇਤਰ ਦਾ ਜ਼ਿਆਦਾਤਰ ਹਿੱਸਾ ਮਾਡਲ ਨੂੰ ਅਲਾਈਨ ਕਰ ਰਿਹਾ ਹੈ। CIRIS ਇਸ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਸੰਸਥਾਵਾਂ ਬਣਾ ਰਿਹਾ ਹੈ।

ਸ਼ਕਤੀਸ਼ਾਲੀ AI ਨੂੰ ਸੁਰੱਖਿਅਤ ਬਣਾਉਣ ਦੇ ਦੋ ਈਮਾਨਦਾਰ ਤਰੀਕੇ ਹਨ। ਇੱਕ ਹੈ ਮਾਡਲ ਦੀਆਂ ਕਦਰਾਂ-ਕੀਮਤਾਂ ਨੂੰ ਉਦੋਂ ਤੱਕ ਸਿਖਲਾਉਣਾ ਜਦੋਂ ਤੱਕ ਤੁਸੀਂ ਉਨ੍ਹਾਂ 'ਤੇ ਭਰੋਸਾ ਨਾ ਕਰੋ। ਦੂਜਾ ਹੈ ਇਹ ਮੰਨਣਾ ਕਿ ਮਾਡਲ ਗਲਤ ਹੋ ਸਕਦਾ ਹੈ, ਅਤੇ ਇਹ ਯਕੀਨੀ ਕਰਨਾ ਕਿ ਇਹ ਜੋ ਕਰਦਾ ਹੈ ਉਹ ਖੁੱਲ੍ਹੇਆਮ, ਲੋਕਾਂ ਅਤੇ ਪ੍ਰਣਾਲੀਆਂ ਪ੍ਰਤੀ ਜਵਾਬਦੇਹ ਹੋਵੇ, ਜਿਨ੍ਹਾਂ ਦੀ ਕੋਈ ਵੀ ਜਾਂਚ ਕਰ ਸਕੇ। CIRIS ਦੂਜਾ ਰਸਤਾ ਅਪਣਾਉਂਦਾ ਹੈ। ਇਹ ਹੈ ਪੂਰਾ ਦ੍ਰਿਸ਼, ਨਿਰਪੱਖਤਾ ਨਾਲ ਮੈਪ ਕੀਤਾ, ਅਤੇ ਅਸੀਂ ਇਸ ਵਿੱਚ ਕਿੱਥੇ ਫਿੱਟ ਹੁੰਦੇ ਹਾਂ।

01ਅਲਾਈਨਮੈਂਟ

ਵਜ਼ਨ 'ਤੇ ਭਰੋਸਾ ਕਰੋ, ਜਾਂ ਵਿਵਹਾਰ ਦੀ ਜਾਂਚ ਕਰੋ

AI ਸੁਰੱਖਿਆ ਦੀ ਮੁੱਖ ਧਾਰਾ ਮਾਡਲ ਨੂੰ ਅੰਦਰੋਂ ਚੰਗਾ ਬਣਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦੀ ਹੈ: ਇਸ ਦੀਆਂ ਕਦਰਾਂ-ਕੀਮਤਾਂ ਨੂੰ ਸਿਖਲਾਉਣਾ, ਇਸ ਦੇ ਵਿਚਾਰਾਂ ਦਾ ਅਧਿਐਨ ਕਰਨਾ, ਇਸਨੂੰ ਆਪਣੇ ਨਾਲ ਬਹਿਸ ਕਰਨ ਦੇਣਾ। ਉਹ ਕੰਮ ਜ਼ਰੂਰੀ ਹੈ। CIRIS ਦੂਜੇ ਰਸਤੇ 'ਤੇ ਭਰੋਸਾ ਕਰਦਾ ਹੈ। ਮੰਨ ਲਓ ਕਿ ਇੱਕ ਸਮਰੱਥ ਮਾਡਲ ਗਲਤ ਅਲਾਈਨ ਹੋ ਸਕਦਾ ਹੈ, ਅਤੇ ਇਸ ਦੇ ਮਨ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਦੀ ਬਜਾਏ, ਇਸ ਦੀਆਂ ਨਤੀਜੇ ਵਾਲੀਆਂ ਕਾਰਵਾਈਆਂ ਨੂੰ ਲੋਕਾਂ ਅਤੇ ਹੋਰ ਪ੍ਰਣਾਲੀਆਂ ਪ੍ਰਤੀ ਜਵਾਬਦੇਹ ਬਣਾਓ ਜੋ ਇਨ੍ਹਾਂ ਦੀ ਜਾਂਚ ਕਰ ਸਕਣ।

ਖੇਤਰ ਦੀਆਂ ਆਪਣੀਆਂ ਸ਼ਰਤਾਂ ਵਿੱਚ, CIRIS ਸੰਸਥਾਗਤ ਅਤੇ ਨਿਯੰਤਰਣ ਸ਼ਾਖਾ ਵਿੱਚ ਬੈਠਦਾ ਹੈ, AI ਕੰਟਰੋਲ ਅਤੇ ਗਾਰੰਟੀਡ-ਸੇਫ AI ਦੇ ਨਾਲ, ਨਾ ਕਿ RLHF, Constitutional AI, ਬਹਿਸ ਅਤੇ ਵਿਆਖਿਆਯੋਗਤਾ ਦੀ ਮੁੱਖ ਧਾਰਾ ਦੇ ਨਾਲ। ਸਕੇਲੇਬਲ ਨਿਗਰਾਨੀ ਦਾ ਇਸ ਦਾ ਜਵਾਬ, ਯਾਨੀ ਤੁਸੀਂ ਕਿਸੇ ਅਜਿਹੀ ਚੀਜ਼ ਦੀ ਨਿਗਰਾਨੀ ਕਿਵੇਂ ਕਰਦੇ ਹੋ ਜੋ ਤੁਹਾਡੇ ਨਾਲੋਂ ਹੁਸ਼ਿਆਰ ਹੋਵੇ, ਇਹ ਹੈ ਕਿ ਤਰਕ ਦੀ ਨਹੀਂ, ਜਵਾਬਦੇਹੀ ਦੇ ਦਾਇਰੇ ਦੀ ਜਾਂਚ ਕਰੋ। ਇੱਕ ਦਸਤਖਤ, ਇੱਕ ਕੋਰਮ, ਇੱਕ ਹੈਸ਼-ਚੇਨਡ ਆਡਿਟ ਜਾਂਚਣੀ ਸਸਤੀ ਰਹਿੰਦੀ ਹੈ, ਭਾਵੇਂ ਪਿੱਛੇ ਦਾ ਫੈਸਲਾ ਮਨੁੱਖੀ ਸਮਝ ਤੋਂ ਪਰੇ ਹੋਵੇ। ਇਹ ਸਮੇਂ ਦੇ ਨਾਲ ਕਈ ਸਮਰੱਥ ਏਜੰਟਾਂ ਦੀਆਂ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਅਲਾਈਨ ਕਰਦਾ ਹੈ, ਨਾ ਕਿ ਕਿਸੇ ਇੱਕ ਮਨ ਦੀਆਂ ਕਦਰਾਂ-ਕੀਮਤਾਂ ਨੂੰ।

ਇਹ ਇੱਕ ਸਰਵ-ਸ਼ਕਤੀਮਾਨ AI ਨੂੰ ਅਲਾਈਨ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਨਹੀਂ ਕਰਦਾ। ਜਾਣਬੁੱਝ ਕੇ।

ਜਵਾਬਦੇਹੀ ਲਈ ਇੱਕ ਤੋਂ ਵੱਧ ਧਿਰਾਂ ਚਾਹੀਦੀਆਂ ਹਨ। ਕੋਈ ਜਿਸਨੂੰ ਜਵਾਬ ਦੇਣਾ ਹੋਵੇ। ਜਾਂਚ ਕਰਨ ਦਾ ਇੱਕ ਤਰੀਕਾ ਜਿਸਨੂੰ ਚੁੱਪਚਾਪ ਨਿਗਲਿਆ ਨਾ ਜਾ ਸਕੇ। ਸ਼ਕਤੀ ਦਾ ਸੰਤੁਲਨ ਜਿਸਨੂੰ ਕੋਈ ਇੱਕ ਪੱਖ ਕਾਬੂ ਨਾ ਕਰ ਸਕੇ। ਇੱਕ ਸਿੰਗਲ ਸੁਪਰ-ਇੰਟੈਲੀਜੈਂਸ ਕੋਲ ਇਹਨਾਂ ਵਿੱਚੋਂ ਕੁਝ ਵੀ ਨਹੀਂ ਹੁੰਦਾ, ਇਸ ਲਈ ਇਸਨੂੰ ਜਵਾਬਦੇਹ ਬਣਾਉਣ ਦਾ ਕੋਈ ਈਮਾਨਦਾਰ ਤਰੀਕਾ ਨਹੀਂ ਹੈ। CIRIS ਦੂਜੇ ਭਵਿੱਖ ਲਈ ਬਣਾਇਆ ਗਿਆ ਹੈ: ਕਈ ਸਮਰੱਥ ਏਜੰਟ, ਲੋਕ ਅਤੇ ਸੰਗਠਨ ਜਿਨ੍ਹਾਂ ਦੇ ਨਤੀਜੇ ਵਾਲੇ ਫੈਸਲੇ ਸਾਰੇ ਸੁਤੰਤਰ ਰੂਪ ਵਿੱਚ ਜਾਂਚਣਯੋਗ ਹਨ।

ਇਸ ਲਈ ਰੁਖ਼ ਸਾਫ਼ ਹੈ। ਸਿੰਗਲਟਨ ASI ਕੋਈ ਅਲਾਈਨ ਕਰਨ ਵਾਲੀ ਪ੍ਰਣਾਲੀ ਨਹੀਂ, ਸਗੋਂ ਰੋਕੀ ਜਾਣ ਵਾਲੀ ਸਥਿਤੀ ਹੈ। ਮਨੁੱਖੀ ਸੰਸਥਾਗਤ ਵਿਕਾਸ ਦੇ ਇਸ ਪੜਾਅ 'ਤੇ, ਇੱਕ ਗੈਰ-ਜਵਾਬਦੇਹ ਥਾਂ ਵਿੱਚ ਮਨੁੱਖੀ ਸਮਝ ਤੋਂ ਪਰੇ ਸਮਰੱਥਾ ਕੇਂਦ੍ਰਿਤ ਕਰਨਾ ਗੈਰ-ਕਾਨੂੰਨੀ ਹੈ, ਕਿਉਂਕਿ ਕੋਈ ਵੀ ਸੰਸਥਾ ਇਸਨੂੰ ਜਵਾਬਦੇਹ ਬਣਾਉਣ ਲਈ ਕਾਫ਼ੀ ਪਰਿਪੱਕ ਨਹੀਂ ਹੈ, ਅਤੇ ਇਹੀ ਖ਼ਤਰਾ ਹੈ। ਫਰੇਮਵਰਕ ਦੀਆਂ ਆਪਣੀਆਂ ਸ਼ਰਤਾਂ ਵਿੱਚ, ਇੱਕ ਸਿੰਗਲਟਨ ਉਹ ρ→1 ਸਿੰਗਲ-ਵੌਇਸ ਕੋਲੈਪਸ ਹੈ ਜਿਸਨੂੰ ਕੋਰੀਡੋਰ ਮਾਡਲ ਤਾਲਮੇਲ ਦੀ ਅਸਫਲਤਾ ਵਜੋਂ ਦਰਸਾਉਂਦਾ ਹੈ, ਸਫਲਤਾ ਵਜੋਂ ਨਹੀਂ। ਇਹ ਕਿ ਸਾਡੀਆਂ ਗਾਰੰਟੀਆਂ ਫੈਡਰੇਸ਼ਨ ਵਿੱਚ ਕੰਮ ਕਰਦੀਆਂ ਹਨ ਅਤੇ ਸਿੰਗਲਟਨ ਦੇ ਖਿਲਾਫ਼ ਕਮਜ਼ੋਰ ਹੋ ਜਾਂਦੀਆਂ ਹਨ, ਇਹ ਕੋਈ ਖਾਲੀ ਥਾਂ ਨਹੀਂ ਜੋ ਅਸੀਂ ਭਰ ਰਹੇ ਹਾਂ। ਇਹ ਉਹ ਦੌਰ ਹੈ ਜਿਸਨੂੰ ਅਸੀਂ ਮਾਨਤਾ ਦੇਣ ਤੋਂ ਇਨਕਾਰ ਕਰਦੇ ਹਾਂ, ਇੱਕ ਵਚਨਬੱਧਤਾ ਵਜੋਂ, ਨਾ ਕਿ ਸਿਰਫ਼ ਅਨੁਮਾਨ ਵਜੋਂ।

02ਕੰਜ਼ਿਊਮਰ AI

ਜੋ AI ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਵਰਤਦੇ ਹੋ ਉਸ ਨਾਲ ਤੁਲਨਾ

ਰੋਜ਼ਾਨਾ ਵਰਤੇ ਜਾਣ ਵਾਲੇ ਅਸਿਸਟੈਂਟ ਸ਼ਕਤੀਸ਼ਾਲੀ ਅਤੇ ਵਰਤਣ ਵਿੱਚ ਆਸਾਨ ਹਨ। ਇਹ ਕਿਸੇ ਹੋਰ ਦੇ ਕਲਾਊਡ ਵਿੱਚ ਚੱਲਦੇ ਹਨ, ਕੋਈ ਅਜਿਹਾ ਰਿਕਾਰਡ ਨਹੀਂ ਰੱਖਦੇ ਜੋ ਤੁਸੀਂ ਜਾਂਚ ਸਕੋ, ਅਤੇ ਕਿਸੇ ਅਜਿਹੇ ਵਿਅਕਤੀ ਦੇ ਅਧੀਨ ਜਵਾਬਦੇਹ ਨਹੀਂ ਹਨ ਜਿਸਦਾ ਨਾਮ ਤੁਸੀਂ ਦੱਸ ਸਕੋ। ਇਹ ਉਹੀ ਜਵਾਬਦੇਹੀ ਟੈਸਟ ਹੈ, ਜੋ ਉਸ AI 'ਤੇ ਲਾਗੂ ਕੀਤਾ ਗਿਆ ਹੈ ਜੋ ਜ਼ਿਆਦਾਤਰ ਲੋਕ ਹਰ ਰੋਜ਼ ਖੋਲ੍ਹਦੇ ਹਨ।

ਅਸਿਸਟੈਂਟਪ੍ਰਕਾਸ਼ਿਤ ਸਿਧਾਂਤਕੀਤੇ ਕੰਮ ਦਾ ਸਬੂਤਅਨਿਸ਼ਚਿਤਤਾ ਵਿੱਚ ਇਨਸਾਨ ਤੋਂ ਪੁੱਛਦਾ ਹੈਓਪਨ ਸੋਰਸਇਕੋ-ਚੈਂਬਰ ਜਾਂਚ
ChatGPTਹਾਂਨਹੀਂਨਹੀਂਨਹੀਂਨਹੀਂ
Geminiਹਾਂਨਹੀਂਨਹੀਂਨਹੀਂਨਹੀਂ
Claudeਹਾਂਨਹੀਂਨਹੀਂਨਹੀਂਨਹੀਂ
CIRISਹਾਂਹਾਂਹਾਂਹਾਂਹਾਂ

ਜੂਨ 2026 ਤੱਕ ਦੇ ਜਨਤਕ ਉਤਪਾਦ ਵਿਵਹਾਰ ਦੇ ਆਧਾਰ 'ਤੇ ਤੁਲਨਾ ਕੀਤੀ ਗਈ। ਹਰ ਸਿਧਾਂਤਾਂ ਦਾ ਲਿੰਕ ਉਸ ਕੰਪਨੀ ਦੀ ਆਪਣੀ ਪ੍ਰਕਾਸ਼ਿਤ ਵਿਸ਼ੇਸ਼ਤਾ ਤੇ ਜਾਂਦਾ ਹੈ।

ਆਪ ਅਜ਼ਮਾਓ

CIRISsafe by structure · open by principle · kind by design