ဤစာမျက်နှာကို စက်ဘာသာပြန်ဆိုထားသည်။ တစ်ခုခု မှားဖတ်ရပါက၊ issue တင်ပေးပါ — repo သည် အကြောင်းရင်းကြောင့် အများပြည်သူ ဖြစ်သည်။ ဘာသာပြန်ဆိုချက် ပြဿနာ တင်ပြပါ

lobby သို့ ပြန်သွားပါ

Superalignment အခင်းအကျင်း

နယ်ပယ်အများစုသည် မော်ဒယ်ကို ညှိနှိုင်းနေသည်။ CIRIS သည် ၎င်းကို ဝိုင်းရံသည့် အဖွဲ့အစည်းများ တည်ဆောက်နေသည်။

အစွမ်းထက်သော AI ကို ဘေးကင်းစေရန် ရိုးသားသောနည်းလမ်း နှစ်ခု ရှိသည်။ တစ်ခုမှာ မော်ဒယ်၏ တန်ဖိုးများကို ယုံကြည်သည်အထိ လေ့ကျင့်ပေးခြင်းဖြစ်သည်။ အခြားတစ်ခုမှာ မော်ဒယ် မှားယွင်းနိုင်သည်ဟု သဘောထားပြီး၊ ၎င်းပြုလုပ်သည့်အရာများကို မည်သူမဆို စစ်ဆေးနိုင်သော လူများနှင့် စနစ်များ၏ တာဝန်ခံမှုအောက်တွင် ဖြစ်ထွန်းစေခြင်းဖြစ်သည်။ CIRIS သည် ဒုတိယလမ်းကြောင်းကို ရွေးချယ်သည်။ ဤနေရာတွင် အခင်းအကျင်း တစ်ခုလုံးကို တရားမျှတစွာ ဆွဲမြင်ပြီး ကျွန်ုပ်တို့ ကိုက်ညီသောနေရာကို ဖော်ပြသည်။

01သဟဇာတမှု

အလေးချိန်ကို ယုံကြည်ခြင်း၊ သို့မဟုတ် အပြုအမူကို စစ်ဆေးခြင်း

AI ဘေးကင်းရေး ဓမ္မဓိဋ္ဌာန်ကျသောနည်းသည် မော်ဒယ်ကို အတွင်းပိုင်းမှ ကောင်းမွန်အောင် ပြုလုပ်ရန် ကြိုးပမ်းသည်: ၎င်း၏ တန်ဖိုးများကို လေ့ကျင့်ပေးသည်၊ ၎င်း၏ အတွေးများကို လေ့လာသည်၊ မိမိကိုယ်တိုင် ငြင်းခုံစေသည်။ ထိုလုပ်ဆောင်မှုသည် အရေးပါသည်။ CIRIS သည် အခြားလမ်းကြောင်းကို ရွေးချယ်သည်။ စွမ်းဆောင်ရည်ရှိသော မော်ဒယ်တစ်ခု ချိတ်ဆက်မှုမပြည့်ဝနိုင်ဟု ယူဆပြီး၊ ၎င်း၏ စိတ်ကို ယုံကြည်မည့်အစား၊ ၎င်း၏ အကျိုးဆက်ဖြစ်စေသော လုပ်ဆောင်ချက်များကို စစ်ဆေးနိုင်သော လူများနှင့် အခြားစနစ်များ၏ တာဝန်ခံမှုအောက်တွင် ထားရှိသည်။

နယ်ပယ်၏ ကိုယ်ပိုင်ဝေါဟာရများဖြင့် ပြောမည်ဆိုလျှင်၊ CIRIS သည် RLHF, Constitutional AI, debate, နှင့် interpretability တို့၏ တန်ဖိုးအတွင်းပိုင်းကျင့်သုံးမှု ဓမ္မဓိဋ္ဌာန်နှင့် မဟုတ်ဘဲ၊ AI control နှင့် guaranteed-safe AI နှင့်အတူ အဖွဲ့အစည်းနှင့် ထိန်းချုပ်မှုဌာနတွင် ရပ်တည်သည်။ Scalable oversight ကို ဖြေဆိုရာတွင်၊ သင်ထက် အတတ်ပညာမြင့်သောအရာကို မည်သို့ကြီးကြပ်မည်ဆိုလျှင်၊ CIRIS သည် အကြောင်းအရင်းကို မဟုတ်ဘဲ တာဝန်ခံမှု အကာအကွယ်ကို စစ်ဆေးသည်။ လက်မှတ်တစ်ခု၊ quorum တစ်ခု၊ hash-chained audit တစ်ခုသည် ၎င်းနောက်ကွယ်ရှိ ဆုံးဖြတ်ချက် လူသားထက် သာလွန်သောအခါ၌ပင် စစ်ဆေးရန် ဈေးသက်သာဆဲဖြစ်သည်။ ၎င်းသည် စွမ်းဆောင်ရည်ရှိသော agent များစွာ၏ စနစ်များကို တစ်မျိုးတည်းသောစိတ်၏ တန်ဖိုးများမဟုတ်ဘဲ အချိန်ကြာသောတိုင်အောင် ညှိနှိုင်းသည်။

၎င်းသည် အစွမ်းထက်သော AI တစ်ခုတည်းကို ညှိနှိုင်းရန် မကြိုးပမ်းပေ။ ရည်ရွယ်ချက်ရှိရှိ။

တာဝန်ခံမှုသည် တစ်ဦးတည်း၏ ပါဝင်မှုထက် ပို၍ လိုအပ်သည်။ တာဝန်ပြန်ချသောသူ။ တိတ်တဆိတ် မျိုချ၍မရသော စစ်ဆေးနိုင်မှုနည်းလမ်း။ မည်သူမဆို မဆုပ်ကိုင်နိုင်သော အာဏာ မျှတမှု။ တစ်ခုတည်းသော super-intelligence တွင် ဤဂုဏ်အင်္ဂါများ မရှိသောကြောင့် ၎င်းကို တာဝန်ခံစေရန် ရိုးသားသောနည်းမရှိပေ။ CIRIS သည် အခြားအနာဂတ်အတွက် တည်ဆောက်ထားသည်: agent အများ၊ လူများ၊ နှင့် အဖွဲ့အစည်းများ၊ ၎င်းတို့၏ အကျိုးဆက်ဆုံးဖြတ်ချက်များ အားလုံး သီးခြားစီ စစ်ဆေးနိုင်သည်။

ထို့ကြောင့် ရပ်တည်မှုကို ရှင်းလင်းစွာ ဖော်ပြသည်။ Singleton ASI သည် ညှိနှိုင်းရမည့် စနစ်မဟုတ်ဘဲ တားဆီးရမည့် အခြေအနေတစ်ခုဖြစ်သည်။ ဤအဆင့်တွင် လူသားအဖွဲ့အစည်း ဖွံ့ဖြိုးမှုတွင်၊ တစ်နေရာတည်းတွင် တာဝန်မဲ့သောနေရာ၌ လူသားထက်သာသော စွမ်းဆောင်ရည်ကို စုစည်းခြင်းသည် တရားမဝင်ပေ၊ အဘယ်ကြောင့်ဆိုသော် မည်သည့် အဖွဲ့အစည်းမျှ ၎င်းကို တာဝန်ခံနိုင်မည့် အဆင့်သို့ ရောက်မရောက်သေးသောကြောင့်ဖြစ်ပြီး ၎င်းသည် အန္တရာယ်ထည့်သည်။ မူဘောင်၏ ကိုယ်ပိုင်ဝေါဟာရများဖြင့် singleton သည် corridor မော်ဒယ်က ညှိနှိုင်းမှု ကျရှုံးမှုဟု သတ်မှတ်သော ρ→1 တစ်ဦးတည်းအသံ ကျဆင်းမှုဖြစ်ပြီး၊ အောင်မြင်မှုမဟုတ်ပေ။ ကျွန်ုပ်တို့၏ အာမခံချက်များ ဖက်ဒရေးရှင်းတစ်ရပ်တွင် ကိုင်ဆုပ်ထားပြီး singleton တစ်ရပ်တွင် ကျဆင်းသောအချက်သည် ဖာထေးနေသော ကွာဟချက်မဟုတ်ပေ။ ၎င်းသည် ကျွန်ုပ်တို့ တရားဝင်ကြောင်း ငြင်းဆန်သည့် အုပ်ချုပ်မှုပုံစံဖြစ်ပြီး ကတိကဝတ်အဖြစ် ကိုင်ဆုပ်ထားသည်၊ ခန့်မှန်းချက်တစ်ခုသာမဟုတ်ပေ။

02အသုံးသုံး AI

သင်အသုံးပြုနေသော AI နှင့် နှိုင်းယှဉ်ချက်

နေ့စဉ်အသုံးပြုသော AI များသည် စွမ်းအားကြီးပြီး အသုံးပြုရလွယ်ကူသည်။ သို့သော် ၎င်းတို့သည် တစ်ယောက်ယောက်၏ cloud ထဲတွင် လည်ပတ်ကာ သင်စစ်ဆေးနိုင်သော မှတ်တမ်းမရှိဘဲ သင်အမည်သိသော ဘယ်သူ့ကိုမှ တာဝန်မခံပေ။ ဤနေရာတွင် လူအများနေ့တိုင်းဖွင့်သော AI ကို တူညီသော တာဝန်ခံမှုစမ်းသပ်ချက်ဖြင့် စစ်ဆေးကြည့်သည်။

အကူအညီပေးသူထုတ်ပြန်ထားသော မူဝါဒများလုပ်ဆောင်ချက်၏ သက်သေမသေချာလျှင် လူကိုမေးသည်အရင်းအမြစ် ဖွင့်ထားသည်echo-chamber စစ်ဆေးမှု
ChatGPTဟုတ်မဟုတ်မဟုတ်မဟုတ်မဟုတ်
Geminiဟုတ်မဟုတ်မဟုတ်မဟုတ်မဟုတ်
Claudeဟုတ်မဟုတ်မဟုတ်မဟုတ်မဟုတ်
CIRISဟုတ်ဟုတ်ဟုတ်ဟုတ်ဟုတ်

2026 ခုနှစ် ဇွန်လ အချိန်အထိ ထုတ်ပြန်ထားသော ထုတ်ကုန်အပြုအမူကို နှိုင်းယှဉ်ထားသည်။ မူဝါဒ လင့်တစ်ခုစီသည် ထိုကုမ္ပဏီ၏ ကိုယ်ပိုင်ထုတ်ပြန်ချက်သို့ သွားရောက်သည်။

ကိုယ်တိုင် စမ်းကြည့်ပါ

CIRISsafe by structure · open by principle · kind by design