Ukurasa huu ulitafsiriwa na mashine. Ikiwa kitu chochote hakisomeki vizuri, tafadhali fungua suala, hifadhi inapatikana kwa umma kwa sababu hiyo. Ripoti tatizo la tafsiri

rudi kwenye ukumbi

Mandhari ya usalama wa AI wa juu

Sehemu kubwa ya uwanja huu inajaribu kurekebisha mfano. CIRIS inajenga taasisi zinazouizunguka.

Kuna njia mbili za kweli za kufanya AI yenye nguvu iwe salama. Moja ni kufundisha maadili ya mfano hadi uamini. Nyingine ni kukubali kwamba mfano unaweza kukosea, na kuhakikisha kinachofanywa kinawajibika, hadharani, kwa watu na mifumo ambayo mtu yeyote anaweza kukagua. CIRIS inachagua njia ya pili. Hapa kuna mandhari yote, iliyopangwa kwa uaminifu, na mahali tunapoingia ndani yake.

01Ulinganifu

Amini uzito wa mfano, au kagua tabia yake

Mkondo mkuu wa usalama wa AI unajaribu kufanya mfano uwe mzuri kwa ndani: kufundisha maadili yake, kusoma mawazo yake, kuufanya ujadiliane na nafsi yake. Kazi hiyo ina umuhimu. CIRIS inaamini njia nyingine. Kubali kwamba mfano wenye uwezo unaweza kuwa na mwelekeo mbaya, na badala ya kuamini akili yake, fanya matendo yake muhimu yawajibike kwa watu na mifumo mingine inayoweza kuyakagua.

Kwa maneno ya uwanja wenyewe, CIRIS ipo katika tawi la taasisi na udhibiti, pamoja na udhibiti wa AI na AI salama inayohakikishwa, si katika mkondo mkuu wa RLHF, Constitutional AI, mjadala, na ufafanuzi wa ndani. Jibu lake kwa usimamizi unaoweza kupanuka, jinsi ya kusimamia kitu chenye akili kuliko wewe, ni kuthibitisha kamba ya uwajibikaji, si fikira. Saini, quorum, na ukaguzi unaounganishwa kwa hash unabaki rahisi kukagua hata wakati uamuzi wake uko juu ya uwezo wa binadamu. Inaunga mkomo mifumo ya mawakala wengi wenye uwezo kwa wakati, si maadili ya akili moja yoyote.

Haijaribu kurekebisha AI moja yenye nguvu yote. Kwa makusudi.

Uwajibikaji unahitaji zaidi ya mhusika mmoja. Mtu wa kujibu kwake. Njia ya kukagua ambayo haiwezi kumezwa kimya kimya. Uwiano wa nguvu ambao hakuna upande mmoja unaoweza kuuteka. AI moja yenye akili kuu haina chochote kati ya hivi, kwa hivyo hakuna njia ya kweli ya kuishikilia kuwajibika. CIRIS imejengwa kwa ajili ya mustakabali mwingine: mawakala wengi wenye uwezo, watu, na mashirika ambao maamuzi yao yote muhimu yanaweza kukaguliwa kwa kujitegemea.

Kwa hivyo msimamo ni wazi. ASI moja haiwajibiwi kama mfumo wa kurekebisha bali hali ya kuzuia. Kukusanya uwezo wa ziada ya binadamu mahali pamoja pasipo uwajibikaji, katika hatua hii ya ukuaji wa taasisi za binadamu, ni jambo lisilo halali, kwa sababu hakuna taasisi zilizo na ukomavu wa kutosha kulishikilia kuwajibika, na hii ndiyo hatari halisi. Katika muundo wa mfumo huu, singleton ni kuanguka kwa sauti moja ρ→1 ambayo mfano wa corridor unaitaja kama kushindwa kwa uratibu, si mafanikio. Kwamba dhamana zetu zinashikilia katika shirikisho na kudhoofika dhidi ya singleton si pengo tunaloliziba. Ni utaratibu tunaokataa kuhalalisha, ukishikiliwa kama ahadi, si tu utabiri.

02AI ya Watumiaji

Jinsi inavyolinganishwa na AI unayoitumia kweli

Wasaidizi wa kila siku ni wenye nguvu na rahisi kutumia. Pia wanafanya kazi katika wingu la mtu mwingine, hawaacha rekodi unayoweza kukagua, na hawajibu kwa mtu yeyote unayeweza kumtaja. Hapa ni mtihani sawa wa uwajibikaji, unaotumika kwa AI ambayo watu wengi wanafungua kila siku.

MsaidiziKanuni zilizochapishwaUthibitisho wa alichofanyaAnauliza mtu anaposhindwaChanzo waziUkaguzi wa mwangwi
ChatGPTNdiyoHapanaHapanaHapanaHapana
GeminiNdiyoHapanaHapanaHapanaHapana
ClaudeNdiyoHapanaHapanaHapanaHapana
CIRISNdiyoNdiyoNdiyoNdiyoNdiyo

Ulinganishwa kwa tabia ya bidhaa ya umma kufikia Juni 2026. Kila kiungo cha kanuni kinaelekeza kwa taarifa iliyochapishwa na kampuni yenyewe.

Jaribu Mwenyewe

CIRISsafe by structure · open by principle · kind by design