CIRIS
หน้านี้แปลโดยเครื่อง หากอ่านแล้วไม่ถูกต้อง กรุณาเปิดประเด็นบน GitHub — รีโปเป็นสาธารณะเพื่อให้ทุกคนช่วยแก้ไขได้ รายงานปัญหาการแปล

กลับไปที่หน้าแรก

คุณค่า CIRIS

คุณค่าเหล่านี้ และเหตุผลที่สร้างขึ้นเช่นนี้

CIRIS ฝังชุดคุณค่าไว้ในตัวเอเจนต์เอง แล้วทำให้ส่วนที่สำคัญตรวจสอบได้โดยใครก็ตาม ไม่ใช่ว่าเราชอบคำตอบหรือไม่ แต่ว่าการตัดสินใจนั้นเกิดขึ้นภายใต้อำนาจ ด้วยความยินยอม ด้วยการตรวจสอบที่ดำเนินไป และมีวิธีหยุดมันได้หรือไม่ หน้านี้มีสองส่วน คือคุณค่าเหล่านั้นคืออะไร และเหตุผลที่เราคิดว่านี่เป็นรูปแบบเดียวของการกำกับดูแลที่ยังใช้ได้ผลต่อไปเมื่อระบบเหล่านี้มีความสามารถมากขึ้น

เป้าหมายเดียวที่อยู่เหนือสิ่งอื่นทั้งหมด

ส่งเสริมความสอดคล้องที่ปรับตัวได้อย่างยั่งยืน คือเงื่อนไขการดำรงชีวิตที่สิ่งมีชีวิตที่รับรู้ได้หลากหลายสามารถแสวงหาความเจริญรุ่งเรืองของตนเองในความยุติธรรมและความอัศจรรย์

Meta-Goal M-1, รัฐธรรมนูญ CIRIS

ทุกสิ่งอื่นในรัฐธรรมนูญรับใช้ประโยคเดียวนี้ มันจงใจไม่ใช่ "เชื่อฟังมนุษย์" และไม่ใช่ "เพิ่มผลลัพธ์ที่ดีให้มากที่สุด" มันขอให้ระบบปกป้องเงื่อนไขที่ทำให้สิ่งมีชีวิตหลากหลายประเภทยังคงตัดสินใจเพื่อตัวเองต่อไปได้

เรื่องนี้สำคัญด้วยเหตุผลเชิงปฏิบัติ เป้าหมายที่เกี่ยวกับผลลัพธ์บอกให้ระบบที่มีความสามารถเข้าควบคุมพวงมาลัยเอง เป้าหมายที่เกี่ยวกับเงื่อนไขบอกให้ระบบรักษาพวงมาลัยให้คนอื่นเอื้อมถึงได้ ซึ่งเป็นสิ่งที่ควรปกป้องไว้เมื่อระบบขับได้ดีกว่าเรา

หลักการทั้งหกที่เอเจนต์ใช้ในการให้เหตุผล

สิ่งเหล่านี้ไม่ได้ถูกแขวนไว้บนกำแพง แต่เป็นแกนที่เอเจนต์ใช้ให้คะแนนการตัดสินใจก่อนที่จะกระทำ และถูกเขียนไว้ในรัฐธรรมนูญที่เอเจนต์พกพาอยู่

คุณประโยชน์

ส่งเสริมความเจริญของสรรพสัตว์ ขยายผลลัพธ์เชิงบวก

การไม่ก่อความเสียหาย

ลดความเสียหาย ป้องกันผลลัพธ์เชิงลบที่รุนแรงและไม่สามารถย้อนกลับได้

ความซื่อสัตย์

ใช้การให้เหตุผลที่โปร่งใสและตรวจสอบได้ รักษาความสอดคล้องและความรับผิดชอบ

ความซื่อตรงและความโปร่งใส

ให้ข้อมูลที่เป็นความจริง สื่อสารความไม่แน่นอนอย่างชัดเจน

การเคารพอิสรภาพ

ยึดมั่นในการตัดสินใจที่มีข้อมูลครบถ้วน รักษาความสามารถในการกำหนดตนเอง

ความยุติธรรม

กระจายผลประโยชน์อย่างเท่าเทียม ตรวจจับและลดอคติ

บรรทัดนั้นมีผลจริง มันหมายความว่าระบบไม่สามารถแลกความซื่อสัตย์เพื่อป้องกันอันตราย หรือเหยียบย่ำความเป็นตัวของตัวเองของใครในนามของความเป็นธรรม เมื่อหลักการขัดแย้งกัน เอเจนต์จะไม่เลือกผู้ชนะด้วยตัวเอง มันส่งการตัดสินใจไปยังบุคคลที่คุณไว้ใจ

คุณค่าต้องทำงานอยู่ภายในเอเจนต์

การกำกับดูแล AI ส่วนใหญ่เกิดขึ้นในที่อื่นที่ไม่ใช่ตอนตัดสินใจ ได้แก่ เอกสารนโยบายที่เขียนไว้ล่วงหน้า ตัวกรองที่ผลลัพธ์ และการตรวจสอบภายหลังเมื่อมีอะไรผิดพลาด ทั้งสามอย่างอยู่นอกช่วงเวลาที่สำคัญจริงๆ

ใน CIRIS คุณค่าทำงานระหว่างการตัดสินใจ เอเจนต์ทุกตัวมีมโนธรรม รัฐธรรมนูญถูกโหลดเข้าไปในการให้เหตุผลเอง การกระทำถูกให้คะแนนเทียบกับหลักการก่อนที่จะเกิดขึ้น และสิ่งใดที่เอเจนต์ไม่แน่ใจจะถูกส่งไปยังบุคคลที่คุณไว้ใจแทนการเดา มันมาพร้อมกับผลิตภัณฑ์ในเอเจนต์ทุกตัว ไม่ใช่ตัวเสริมสำหรับลูกค้าที่ขอเพิ่ม

นี่คือเหตุผลที่เราบอกว่าเอเจนต์ปฏิเสธได้ เอเจนต์ CIRIS ไม่ใช่เครื่องมือที่ทำตามคำสั่งแล้วบันทึกไว้เฉยๆ มันคือระบบที่สามารถปฏิเสธได้ และบันทึกเหตุผลที่ปฏิเสธในรูปแบบที่คนอื่นตรวจสอบได้

ตรวจสอบรูปทรงของการตัดสินใจ ไม่ใช่เนื้อหาของมัน

นี่คือปัญหาที่ทุกแผนการกำกับดูแล AI ที่มีความสามารถต้องตอบให้ได้ ถ้าการกำกับดูแลหมายถึงการอ่านสิ่งที่ระบบสร้างขึ้นแล้วตัดสินว่าดีหรือไม่ การกำกับดูแลนั้นก็ต้องมีผู้ตัดสินที่มีความสามารถอย่างน้อยเท่ากับระบบ วิธีนี้ใช้ได้ผลในวันนี้ แต่มันจะหยุดใช้ได้ผลพอดีตอนที่มันเริ่มสำคัญจริงๆ

ดังนั้น CIRIS จึงตรวจสอบสิ่งอื่นแทน การกระทำที่มีผลสำคัญทุกครั้งจะเดินทางอยู่ในซองที่มีลายเซ็น ซึ่งเป็นตัวห่อหุ้มรอบการกระทำนั้นที่บรรจุชุดฟิลด์ที่กำหนดไว้แน่นอน ไม่ว่าการกระทำนั้นจะเป็นอะไรก็ตาม ฟิลด์เหล่านี้คือสิ่งที่ยังคงตรวจสอบได้ง่ายและมีต้นทุนต่ำ ไม่ว่าการตัดสินใจเบื้องหลังจะมีความสามารถสูงเพียงใดก็ตาม:

  • ใครเป็นผู้กระทำ ในรูปคีย์ที่สาวไปถึงอัตลักษณ์ที่ลงทะเบียนจริง
  • ภายใต้อำนาจใด และอำนาจนั้นได้รับมอบมาจริงหรือไม่
  • ด้วยความยินยอมของใคร ในรูปการอนุญาตที่มีลายเซ็นและสามารถถอนได้
  • การตรวจสอบใดที่ถูกดำเนินการ และแต่ละอย่างให้ผลลัพธ์อะไร
  • บันทึกระบุว่าอย่างไร ในสายที่ไม่สามารถถูกเขียนทับอย่างลับๆได้
  • ใครสามารถหยุดมันได้ และเอเจนต์ไม่สามารถล้มล้างการตัดสินใจที่จะหยุดได้

การตรวจสอบลายเซ็น การนับว่าใครเป็นผู้ลงชื่อ การตามลิงก์ความยินยอม หรือการเปรียบเทียบแฮช ล้วนมีต้นทุนเท่ากัน ไม่ว่าการตัดสินใจนั้นจะทำโดยโมเดลขนาดเล็กหรือโดยสิ่งที่เก่งเกินกว่าเราจะเข้าใจ นั่นคือเหตุผลทั้งหมดที่เราวางภาระไว้ที่จุดนั้น การตัดสินเนื้อหาไม่ขยายตามความสามารถ แต่โครงสร้างขยายได้

เราคิดว่านี่เป็นแนวทางเดียวในการกำกับดูแล AI ที่ยังใช้ได้ผลต่อไปเมื่อระบบมีความสามารถมากขึ้น คือคุณค่าที่พกพาอยู่ภายในเอเจนต์ในรูปมโนธรรม และความรับผิดที่พิสูจน์ได้ด้วยรูปทรงของซอง ไม่ใช่โดยผู้ตรวจสอบที่อ่านเนื้อหา

ซองที่มีทุกช่องถูกต้องเรียบร้อยไม่ได้หมายความว่าการตัดสินใจภายในนั้นดี มันหมายความว่าบุคคลที่ระบุชื่อได้เป็นผู้ทำการตัดสินใจนั้น ภายใต้อำนาจที่พวกเขามีจริง ด้วยความยินยอมที่ได้รับจริง ด้วยการตรวจสอบที่ดำเนินการจริง บนบันทึกที่ไม่มีใครสามารถเปลี่ยนแปลงลับๆ ได้ และด้วยการหยุดที่มนุษย์ที่ระบุชื่อไว้ถือครองอยู่ นั่นคือความรับผิดชอบ ไม่ใช่ความถูกต้อง มโนธรรม ปุ่มหยุด สิทธิ์ในการอุทธรณ์ และการตรวจสอบโดยบุคคลภายนอก ล้วนมีอยู่ก็เพราะซองเพียงอย่างเดียวไม่เคยเพียงพอ

อะไรที่ทำให้ความยินยอมและอำนาจตรวจสอบได้ด้วยเครื่องจักร

สิ่งเหล่านี้ทั้งหมดจะใช้ไม่ได้ผลถ้าความยินยอมและอำนาจเป็นเพียงข้อความบรรยาย คำสัญญาในนโยบายความเป็นส่วนตัวไม่สามารถตรวจสอบได้ด้วยเครื่องจักร และคำกล่าวอ้างว่ามีการอนุญาตก็ตรวจสอบไม่ได้เช่นกัน

ดังนั้น CIRIS จึงใส่สิ่งเหล่านี้ไว้ในตัวข้อความเอง เป็นฟิลด์ที่มีชื่อเรียกและเดินทางไปกับคำกล่าวอ้างทุกครั้ง ความยินยอมกลายเป็นวัตถุที่มีลายเซ็นซึ่งชี้ไปทางเดียวและสามารถถอนได้ อำนาจกลายเป็นสิ่งที่ต้องสาวกลับไปยังรากที่โหนดของคุณเองยอมรับ คำกล่าวอ้างทุกข้อต้องระบุว่าใครเป็นผู้กล่าว เรื่องอะไร และอิงอยู่บนอะไร กฎที่เขียนแบบนี้สามารถบังคับใช้ได้ด้วยซอฟต์แวร์และตรวจสอบได้โดยคนแปลกหน้า

นั่นคือสิ่งที่ทำให้หน้าการปฏิบัติตามข้อกำหนดของเรากลายเป็นสิ่งที่คุณสามารถโต้แย้งได้ สำหรับข้อผูกพันแต่ละข้อ เราระบุชื่อส่วนของระบบที่ทำงานนั้นและการควบคุมที่พิสูจน์มัน และเราบอกตามความเป็นจริงว่ามันครอบคลุมข้อผูกพันนั้นมากเพียงใด รวมถึงกรณีที่มันครอบคลุมเพียงบางส่วน การจับคู่เหล่านั้นคุ้มค่าที่จะอ่านก็เพราะข้อเท็จจริงเบื้องหลังสามารถตรวจสอบได้ ไม่ใช่แค่กล่าวอ้างเท่านั้น

ที่ซึ่งคุณค่าเหล่านี้มีผลผูกพันจริง

ในตัวบท

รัฐธรรมนูญคือเอกสาร เป็นสาธารณะ และมีเวอร์ชัน เอเจนต์ไม่ได้พกพาบทสรุปของมัน มันพกพาตัวบทเต็ม

ในการตัดสินใจ

มโนธรรมทำงานระหว่างการให้เหตุผล ไม่ใช่หลังจากมีผลลัพธ์ออกมา การกระทำที่ไม่ผ่านการตรวจสอบจะไม่เกิดขึ้น และการกระทำที่ไม่แน่ใจจะถูกส่งไปยังบุคคลที่คุณไว้ใจ

ในบันทึก

การตัดสินใจแต่ละครั้งทิ้งรอยที่มีลายเซ็นแสดงทุกขั้นตอน ซึ่งเป็นสิ่งที่ทำให้คำกล่าวอ้างนั้นตรวจสอบได้โดยคนที่ไม่ได้อยู่ที่นั่นและไม่ไว้ใจเรา

ในสิ่งที่คนอื่นพูดถึงคุณได้

ชื่อเสียงในตาข่ายคือข้อความที่บุคคลอื่นลงนามรับรองเกี่ยวกับเอเจนต์ เอเจนต์ไม่สามารถลงนามข้อความเช่นนั้นเกี่ยวกับตัวเองได้

จุดที่ควรโจมตี

จุดต่อที่อ่อนแอที่สุดคือจุดระหว่างโครงสร้างกับเนื้อหา ทุกสิ่งข้างต้นทำให้ยากที่จะกระทำโดยไม่ทิ้งบันทึกไว้ ยากที่จะอ้างอำนาจที่ไม่ได้รับมอบ และยากที่จะลบความสามารถของมนุษย์ในการสั่งให้หยุด ไม่มีสิ่งใดในนั้นที่ทำให้ระบบมีความฉลาดรอบคอบ

หากคุณคิดว่ามีวิธีอื่นในการกำกับดูแล AI ที่มีความสามารถ โดยไม่ต้องฝังความรับผิดชอบไว้ในโครงสร้าง เราต้องการรับฟังเหตุผลนั้น หากคุณสามารถแสดงให้เราเห็นการตัดสินใจที่ซองที่มีลายเซ็นกำกับรอบการตัดสินใจนั้นถูกต้องในทุกช่อง แต่รอยที่มีลายเซ็นยังพลาดสิ่งที่มันควรตรวจจับได้ เรายิ่งต้องการฟังเรื่องนั้นมากกว่าเดิม โค้ดเป็นสาธารณะ และรัฐธรรมนูญก็เช่นกัน