ሁለት መንገዶች
ክብደቱን መተማመን፣ ወይም ባህሪውን መፈተሽ
የ AI ደህንነት ዋና ትኩረት ሞዴሉን ከውስጥ ጥሩ ለማድረግ ነው: እሴቶቹን ማሰልጠን፣ ሀሳቦቹን ማጥናት፣ ከራሱ ጋር ክርክር ማድረግ። ያ ሥራ ጠቃሚ ነው። CIRIS ሌላ መንገድ ይመርጣል። ብቁ የሆነ ሞዴል ስህተት ሊኖረው እንደሚችል ወስዶ፣ ሀሳቡን ከመታመን ይልቅ፣ ወሳኝ ድርጊቶቹን ለሰዎችና ሊፈትሿቸው ለሚችሉ ሌሎች ስርዓቶች ተጠያቂ ያደርጋል።
በዘርፉ ቃላት፣ CIRIS በተቋማዊና ቁጥጥር ቅርንጫፍ ውስጥ ይገኛል፣ ከ AI ቁጥጥርና ዋስትና ያለው ደህንነቱ የተጠበቀ AI ጋር አብሮ፣ RLHF፣ Constitutional AI፣ ክርክርና ተርጓሚነት ዋና መስመር ውስጥ ሳይሆን። ለሚያስፈልጋቸው ሰዎች ክትትል ሚዛን ለሚናቸው ምላሹ፣ ከሰው የሚስሉ ነገሮችን እንዴት መቆጣጠር ይቻላል፣ ምክንያቱን ሳይሆን ተጠያቂነቱን ማረጋገጥ ነው። ፊርማ፣ ቁጥር፣ ሃሽ-ሰንሰለት ኦዲት ውሳኔው ከሰው አቅም ያለፈ ቢሆንም ፈጣን ፍተሻ ያደርጋሉ። ብዙ ብቁ ወኪሎችን ስርዓቶች በጊዜ ሂደት ያሰልፋል፣ የአንድ ሰው ሀሳቦችን ሳይሆን።
የምንይዘው መስመር
አንድ ሁሉ ኃያል AI ለማሰለፍ አይሞክርም። ሆን ብሎ።
ተጠያቂነት ከአንድ ወገን በላይ ይፈልጋል። ለሚመልስ ሰው። ሰምጦ ሊዋጥ የማይችል የምርመራ ዘዴ። ማንም ወገን ሊቆጣጠረው የማይችል የስልጣን ሚዛን። ነጠላ ሱፐር-ኢንተለጀንስ ከነዚህ ምንም የለውም፣ ስለዚህ ተጠያቂ ለማድረግ ሐቀኛ መንገድ የለም። CIRIS ለሌላ ወደፊት ተሰርቷል: ብዙ ብቁ ወኪሎች፣ ሰዎችና ድርጅቶች ወሳኝ ውሳኔዎቻቸው ሁሉ ነጻ ፍተሻ የሚደረግላቸው።
ስለዚህ አቋሙ ግልጽ ነው። ነጠላ ASI ለማሰለፍ ስርዓት ሳይሆን ሊከላከሉት የሚገባ ሁኔታ ነው። በዚህ ደረጃ የሰው ተቋማዊ እድገት፣ ሱፐርሂውማን አቅምን በአንድ ተጠያቂ ያልሆነ ቦታ ማጎሪያ ሕጋዊ አይደለም፣ ምክንያቱም ምንም ተቋም ተጠያቂ ለማድረግ በቂ ብስለት የለውም፣ ይህ ደግሞ ትክክለኛው አደጋ ነው። በማዕቀፉ ቃላት ነጠላ ፍቃድ ρ→1 የአንድ ድምጽ ውድቀት ሲሆን ይህ የቅንጅት ውድቀት ነው፣ ስኬት ሳይሆን። ዋስትናዎቻችን በፌዴሬሽን እንደሚሰሩና ነጠላ ፍቃድ ፊት እንደሚዳከሙ ያሉ ክፍተቶች አይደሉም። ሕጋዊ ለማድረግ የምን거ፈው ስርዓት ነው፣ ቁርጠኝነት ሆኖ የሚያዝ፣ ትንበያ ብቻ ሳይሆን።
ከሚጠቀሙት AI ጋር እንዴት ይወዳደራል
የዕለት ተዕለት ረዳቶች ሃይለኛ እና ለመጠቀም ቀላል ናቸው። እነሱ ደግሞ በሌሎ ሰዎች ክላውድ ውስጥ ይሰራሉ፣ ሊፈትሹት የሚሹት መዝገብ አይያዙም፣ እና ስም ሊሰጡት ለሚሹት ሰው ተጠያቂ አይሆኑም። ይህ ተጠያቂነት ፈተና ብዙ ሰዎች በየቀኑ የሚከፍቱትን AI ላይ ተፈጻሚ ነው።
| ረዳት | የታተሙ መርሆዎች | ያደረገውን ማስረጃ | ሲጠራጠር ሰው ይጠይቃል | ክፍት ምንጭ | የማስተጋባት ቤት ምርመራ |
|---|---|---|---|---|---|
| ChatGPT | አዎ | አይደለም | አይደለም | አይደለም | አይደለም |
| Gemini | አዎ | አይደለም | አይደለም | አይደለም | አይደለም |
| Claude | አዎ | አይደለም | አይደለም | አይደለም | አይደለም |
| CIRIS | አዎ | አዎ | አዎ | አዎ | አዎ |
የቀረበው ንጽጽር በሰኔ 2026 ዕለት በይፋ ይፋ በሆነው የምርት ባህሪ ላይ የተመሠረተ ነው። እያንዳንዱ የመርሆዎች አገናኝ ወደ የዚያ ኩባንያ ራሱ ወዳሳተመው ዝርዝር ይወስዳል።