หน้านี้แปลโดยเครื่อง หากอ่านแล้วไม่ถูกต้อง กรุณาเปิดประเด็น — รีโปเป็นสาธารณะด้วยเหตุผลนั้น รายงานปัญหาการแปล

กลับไปที่ล็อบบี้

ภูมิทัศน์ของ superalignment

ส่วนใหญ่ของสาขานี้กำลังปรับแนวของโมเดล CIRIS กำลังสร้างสถาบันรอบ ๆ โมเดลนั้น

มีสองวิธีที่ซื่อสัตย์ในการทำให้ AI ที่ทรงพลังปลอดภัย วิธีแรกคือฝึกค่านิยมของโมเดลจนกว่าคุณจะไว้ใจมัน อีกวิธีหนึ่งคือสมมติว่าโมเดลอาจผิดพลาดได้ และทำให้สิ่งที่มันทำนั้นสามารถตรวจสอบได้ เปิดเผย และต้องรับผิดชอบต่อผู้คนและระบบที่ทุกคนสามารถตรวจสอบได้ CIRIS เลือกเส้นทางที่สอง นี่คือภูมิทัศน์ทั้งหมด ที่ถูกวาดแผนที่อย่างเป็นธรรม และตำแหน่งที่เราอยู่ในนั้น

01การปรับแนวทาง

ไว้ใจน้ำหนัก หรือตรวจสอบพฤติกรรม

แนวทางหลักของความปลอดภัย AI พยายามทำให้โมเดลดีจากภายใน: ฝึกค่านิยม ศึกษาความคิด และให้โมเดลถกเถียงกับตัวเอง งานนั้นมีความสำคัญ CIRIS เดิมพันกับเส้นทางอื่น สมมติว่าโมเดลที่มีความสามารถอาจไม่ได้รับการปรับแนวอย่างถูกต้อง และแทนที่จะไว้ใจความคิดของมัน ให้ทำให้การกระทำที่สำคัญของมันต้องรับผิดชอบต่อผู้คนและระบบอื่น ๆ ที่สามารถตรวจสอบได้

ในแง่ของสาขานี้ CIRIS อยู่ในกลุ่มสถาบันและการควบคุม ร่วมกับการควบคุม AI และ GS-AI ไม่ใช่แนวทางหลักด้านการปลูกฝังค่านิยมอย่าง RLHF, Constitutional AI, การถกเถียง และ interpretability คำตอบของมันต่อการดูแลที่ขยายได้ ซึ่งก็คือวิธีที่คุณดูแลสิ่งที่ฉลาดกว่าคุณ คือการตรวจสอบกรอบความรับผิดชอบ ไม่ใช่การใช้เหตุผล ลายเซ็น, quorum, และบันทึกที่เชื่อมโยงด้วย hash นั้นยังคงตรวจสอบได้ง่ายแม้เมื่อการตัดสินใจเบื้องหลังจะเหนือมนุษย์ มันปรับแนวระบบของ agent ที่มีความสามารถหลายตัวตลอดเวลา ไม่ใช่ค่านิยมของจิตใจใดจิตใจหนึ่ง

มันไม่ได้พยายามปรับแนว AI ที่ทรงพลังเพียงหนึ่งเดียว ซึ่งเป็นเรื่องตั้งใจ

ความรับผิดชอบต้องการมากกว่าหนึ่งฝ่าย ต้องมีคนที่ต้องรับผิดชอบต่อ ต้องมีวิธีตรวจสอบที่ไม่สามารถกลืนหายไปอย่างเงียบ ๆ ต้องมีการถ่วงดุลอำนาจที่ไม่มีฝ่ายใดฝ่ายหนึ่งยึดครองได้ ASI ตัวเดียวที่ทรงพลังสูงสุดไม่มีสิ่งเหล่านี้เลย ดังนั้นจึงไม่มีวิธีที่ซื่อสัตย์ในการให้มันรับผิดชอบ CIRIS ถูกสร้างขึ้นสำหรับอนาคตอีกแบบหนึ่ง: agent, ผู้คน และองค์กรที่มีความสามารถหลายฝ่าย ซึ่งการตัดสินใจที่สำคัญทั้งหมดสามารถตรวจสอบได้อย่างอิสระ

ดังนั้นจุดยืนนี้จึงชัดเจน ASI แบบ singleton ไม่ใช่ระบบที่จะปรับแนว แต่เป็นเงื่อนไขที่ต้องป้องกัน การรวมศูนย์ความสามารถเหนือมนุษย์ไว้ในที่เดียวที่ไม่มีความรับผิดชอบ ในขั้นตอนของการพัฒนาสถาบันมนุษย์นี้ ถือเป็นสิ่งที่ไม่ถูกต้อง เพราะไม่มีสถาบันใดที่พร้อมพอที่จะให้มันรับผิดชอบได้ ซึ่งนี่คือความอันตรายอย่างแท้จริง ในแง่ของกรอบงาน singleton คือการยุบรวมเสียงเดียวแบบ ρ→1 ที่โมเดล corridor เรียกว่าความล้มเหลวในการประสานงาน ไม่ใช่ความสำเร็จ การที่การรับประกันของเราใช้ได้ในเครือข่าย federation และเสื่อมลงเมื่อเจอ singleton ไม่ใช่ช่องโหว่ที่เราจะแก้ไข แต่เป็นระบอบที่เราปฏิเสธที่จะทำให้ถูกต้อง โดยยึดเป็นพันธสัญญา ไม่ใช่แค่การคาดการณ์

02AI สำหรับผู้บริโภค

เปรียบเทียบกับ AI ที่คุณใช้จริง

ผู้ช่วย AI ในชีวิตประจำวันนั้นทรงพลังและใช้งานง่าย แต่ก็ทำงานบนคลาวด์ของคนอื่น ไม่มีบันทึกที่คุณตรวจสอบได้ และไม่ต้องรับผิดชอบต่อใครที่คุณระบุชื่อได้ นี่คือการทดสอบความรับผิดชอบแบบเดียวกัน ที่นำมาใช้กับ AI ที่คนส่วนใหญ่เปิดใช้ทุกวัน

ผู้ช่วยหลักการที่เปิดเผยหลักฐานสิ่งที่ทำไปถามมนุษย์เมื่อไม่แน่ใจโอเพนซอร์สการตรวจสอบกลุ่มก้อง
ChatGPTใช่ไม่ไม่ไม่ไม่
Geminiใช่ไม่ไม่ไม่ไม่
Claudeใช่ไม่ไม่ไม่ไม่
CIRISใช่ใช่ใช่ใช่ใช่

เปรียบเทียบจากพฤติกรรมของผลิตภัณฑ์สาธารณะ ณ มิถุนายน 2026 ลิงก์หลักการแต่ละรายการไปยังข้อกำหนดที่บริษัทนั้นเผยแพร่เอง

ลองด้วยตัวเอง

CIRISsafe by structure · open by principle · kind by design