CIRIS
ይህ ገጽ በማሽን ተተርጉሟል። የተሳሳተ ነገር ካለ እባክዎ በ GitHub ላይ ጉዳይ ይክፈቱ። ማከማቻው ክፍት ስለሆነ ማንኛውም ሰው ለማስተካከል ሊረዳ ይችላል። የትርጉም ስህተት ሪፖርት ያድርጉ

ወደ መነሻ ገጽ ተመለስ

የሱፐርአሊኝመንት ገጽታ

አብዛኛው መስክ ሞዴሉን ያሰልፋል። CIRIS ዙሪያውን ያሉ ተቋማትን እየገነባ ነው።

ኃይለኛ አርቴፊሻል ኢንተለጀንስን ደህንነቱ የተጠበቀ ለማድረግ ሁለት ሐቀኛ መንገዶች አሉ። አንደኛው የሞዴሉን እሴቶች እስክትታምናቸው ድረስ ማሰልጠን ነው። ሌላኛው ደግሞ ሞዴሉ ሊሳሳት እንደሚችል ወስዶ፣ የሚያደርጋቸውን ነገሮች ሁሉም ሰው ሊፈትሸው ለሚችለው ሰዎችና ስርዓቶች ተጠያቂ ማድረግ ነው። CIRIS ሁለተኛውን መንገድ ይከተላል። ይህ ሙሉ ገጽታ ነው፣ ትክክለኛ ካርታ ተሰርቶለት፣ እና እኛ የምንገኝበት ቦታ።

01አሰላለፍ

ክብደቱን መተማመን፣ ወይም ባህሪውን መፈተሽ

የ AI ደህንነት ዋና ትኩረት ሞዴሉን ከውስጥ ጥሩ ለማድረግ ነው: እሴቶቹን ማሰልጠን፣ ሀሳቦቹን ማጥናት፣ ከራሱ ጋር ክርክር ማድረግ። ያ ሥራ ጠቃሚ ነው። CIRIS ሌላ መንገድ ይመርጣል። ብቁ የሆነ ሞዴል ስህተት ሊኖረው እንደሚችል ወስዶ፣ ሀሳቡን ከመታመን ይልቅ፣ ወሳኝ ድርጊቶቹን ለሰዎችና ሊፈትሿቸው ለሚችሉ ሌሎች ስርዓቶች ተጠያቂ ያደርጋል።

በዘርፉ በራሱ የሙያ ቃላት፣ CIRIS ከተቋማዊ እና የቁጥጥር ቅርንጫፍ ውስጥ ከ AI ቁጥጥር እና ዋስትና የተሰጠ ደህንነት ካለው AI ጋር አብሮ ይቀመጣል፤ የ RLHF፣ Constitutional AI፣ ክርክር እና ተርጓሚነት ዋና መስመር ውስጥ ሳይሆን። ለሚሰፋ ክትትል፣ ማለትም ከእርስዎ የበለጠ ብልህ የሆነን ነገር እንዴት መከታተል እንደሚቻል ለሚለው ጥያቄ፣ የሚሰጠው ምላሽ ምክንያቱን ሳይሆን የተጠያቂነት ማዕቀፉን ማረጋገጥ ነው። ፊርማ፣ ምልአተ ጉባኤ፣ በሃሽ ሰንሰለት የተሳሰረ የኦዲት መዝገብ — ከጀርባቸው ያለው ውሳኔ ከሰው አቅም በላይ ቢሆንም እንኳ ለመፈተሽ ቀላል ሆነው ይቆያሉ። በጊዜ ሂደት የበርካታ ብቁ ወኪሎችን ሥርዓት ያስተካክላል እንጂ የአንድን ነጠላ አእምሮ እሴቶችን አይደለም።

አንድ ሁሉን ቻይ AI ለማሰለፍ አይሞክርም። ይህ ሆን ተብሎ የተደረገ ነው።

ተጠያቂነት ከአንድ ወገን በላይ ይፈልጋል። ለሚመልስ ሰው። ሰምጦ ሊዋጥ የማይችል የምርመራ ዘዴ። ማንም ወገን ሊቆጣጠረው የማይችል የስልጣን ሚዛን። ነጠላ ሱፐር-ኢንተለጀንስ ከነዚህ ምንም የለውም፣ ስለዚህ ተጠያቂ ለማድረግ ሐቀኛ መንገድ የለም። CIRIS ለሌላ ወደፊት ተሰርቷል: ብዙ ብቁ ወኪሎች፣ ሰዎችና ድርጅቶች ወሳኝ ውሳኔዎቻቸው ሁሉ ነጻ ፍተሻ የሚደረግላቸው።

ስለዚህ አቋሙ ግልጽ ነው። ነጠላ ASI ሊስማማ የሚያስፈልገው ሥርዓት ሳይሆን መከላከል የሚገባው ሁኔታ ነው። በዚህ የሰው ልጅ ተቋማዊ ዕድገት ደረጃ ላይ፣ ከሰው በላይ የሆነን አቅም በአንድ ተጠያቂ ባልሆነ ቦታ ላይ ማከማቸት ተቀባይነት የሌለው ነው፤ ምክንያቱም ተጠያቂ የሚያደርግ በቂ ብስለት ላይ የደረሰ ተቋም የለም፣ ይህም ትክክለኛው አደጋ ነው። በማዕቀፉ ቃላት፣ ነጠላ ሥርዓት የρ→1 ነጠላ ድምፅ ውድቀት ሲሆን የኮሪደር ሞዴሉ ይህን የቅንጅት ውድቀት እንጂ ስኬት አይደለም ይለዋል። ዋስትናዎቻችን በፌዴሬሽን ላይ የሚሠሩ መሆናቸውና በነጠላ ሥርዓት ፊት መዳከማቸው ለመጠገን የምንሞክረው ክፍተት አይደለም። ሕጋዊነትን ለመስጠት የምንቃወመው ሥርዓት ነው፤ ይህም እንደ ትንበያ ብቻ ሳይሆን እንደ ቁርጠኝነት የተያዘ ነው።

02የሸማቾ AI

ከሚጠቀሙት AI ጋር እንዴት ይወዳደራል

የዕለት ተዕለት ረዳቶች ኃያል እና ለመጠቀም ቀላል ናቸው። እነሱ ደግሞ በሌላ ሰው ክላውድ ውስጥ ይሰራሉ፣ ሊፈትሹት የሚችሉትን መዝገብ አይይዙም፣ እና በስም ሊጠቅሱት ለሚችሉት ለማንም ሰው ተጠያቂ አይሆኑም። ብዙ ሰዎች በየቀኑ በሚከፍቱት AI ላይ የተተገበረው ተመሳሳይ የተጠያቂነት ፈተና ይኸውና።

ረዳትየታተሙ መርሆዎችያደረገውን ማስረጃሲጠራጠር ሰው ይጠይቃልክፍት ምንጭየ"echo chamber" ፍተሻ
ChatGPTአዎአይደለምአይደለምአይደለምአይደለም
Geminiአዎአይደለምአይደለምአይደለምአይደለም
Claudeአዎአይደለምአይደለምአይደለምአይደለም
CIRISአዎአዎአዎአዎአዎ

እስከ ሰኔ 2026 ድረስ በይፋ በታወቀው የምርት ባህሪ ላይ የተመሠረተ ንጽጽር። እያንዳንዱ የ«መርሆዎች» አገናኝ ወደ ኩባንያው ራሱ ወደታተመው ቴክኒካዊ መግለጫ ይወስዳል።

ራስዎ ይሞክሩ