ท่อส่งมโนธรรม
AI ทั่วไปแค่ลงมือทำ CIRIS ตัดสินใจอย่างรับผิดชอบ
AI ทั่วไปเดินตรงจากคำสั่งไปสู่การกระทำทันที CIRIS เพิ่มขั้นตอนที่ไม่มีที่อื่นใดทำ ก่อนที่การกระทำใดจะเกิดขึ้น การตัดสินใจต้องผ่านท่อส่งมโนธรรมก่อน โดยจะถูกชั่งน้ำหนัก ตรวจสอบกับหลักการ และบันทึกเป็นบันทึกที่มีลายเซ็นและพยาน ซึ่งทุกคนสามารถตรวจสอบได้ การกระทำจะเกิดขึ้นได้ก็ต่อเมื่อบันทึกนั้นผ่านการยืนยันเท่านั้น
นี่คือสิ่งที่ทำให้ CIRIS เป็นมากกว่าแค่ AI ธรรมดา มันเป็นเหมือนสถาบัน มันมีความจำ กฎหมาย การมอบอำนาจ ความรับผิดชอบ และบันทึกที่ไม่มีใครเปลี่ยนแปลงได้อย่างเงียบๆ เป็นกลไกเดียวกับที่ทำให้สังคมมนุษย์ไว้วางใจกันในวงกว้าง สิ่งใหม่ที่แท้จริงไม่ใช่การเข้ารหัส แต่คือการที่การตัดสินใจสำคัญทุกอย่างต้องผ่านการรับผิดชอบก่อนที่จะได้รับอนุญาตให้ลงมือทำ
CIRIS คืออะไร?
CIRIS คือเฟรมเวิร์กเอเจนต์ AI แบบโอเพนซอร์สที่ครอบ LLM ใดก็ได้ (OpenAI, Anthropic, โมเดลท้องถิ่น) ด้วยมโนธรรมที่ทำงานจริง ทุกการกระทำที่เอเจนต์พิจารณาจะผ่านการตรวจสอบหลายชั้นก่อนดำเนินการ
12
ขั้นตอนในไปป์ไลน์ต่อการตัดสินใจหนึ่งครั้ง
+1
การตรวจสอบสัญชาตญาณ (IDMA)
100%
การตัดสินใจที่ตรวจสอบได้
กรณีการใช้งาน: การดูแลชุมชน ผู้ช่วยส่วนตัว ระบบอัตโนมัติด้านการปฏิบัติตามกฎระเบียบ การประเมินงานวิจัย บริการลูกค้า ทุกที่ที่ต้องการ AI ที่อธิบายเหตุผลของตัวเองได้และส่งต่อกรณีที่ยากให้มนุษย์
กฎสามข้อ
กฎสามข้อ
ข้อกำหนดสถาปัตยกรรมที่บังคับใช้ทั่วทั้งโค้ดเบส:
ไม่มี Untyped Dicts
ข้อมูลทั้งหมดใช้โมเดล Pydantic ไม่มี Dict[str, Any] ความปลอดภัยของประเภทข้อมูลช่วยจับข้อผิดพลาดตั้งแต่ขั้นตอนพัฒนา
ไม่มีรูปแบบการข้ามกฎ
ทุกองค์ประกอบปฏิบัติตามกฎเดียวกัน ไม่มีกรณีพิเศษหรือข้อยกเว้นในตรรกะการตรวจสอบ
ไม่มีข้อยกเว้น
ไม่มีการแทนที่ฉุกเฉินหรือเส้นทางโค้ดพิเศษ ทุกการดำเนินการปฏิบัติตามกฎที่กำหนดไว้
ไปป์ไลน์ H3ERE
ไปป์ไลน์ H3ERE
ทุกงานไหลผ่าน 8 เฟส (12 ขั้นตอนรวมการตรวจสอบแบบวนซ้ำ) ไปป์ไลน์ถูกสร้างเป็นคลาส mixin ที่ประกอบเป็น ThoughtProcessor ขั้นตอนที่ 4 (IDMA) คือการตรวจสอบสัญชาตญาณ
1. START_ROUND
เริ่มต้นรอบการประมวลผล
2. GATHER_CONTEXT
สร้างบริบทครบถ้วนสำหรับการวิเคราะห์
3. PERFORM_DMAS
รัน Decision-Making Algorithms แบบขนาน 3 ตัว
4. PERFORM_IDMA
ตรวจสอบสัญชาตญาณ: แหล่งข้อมูลเป็นอิสระจากกันจริงหรือไม่?
5. PERFORM_ASPDMA
การเลือกการกระทำด้วย LLM จากผลลัพธ์ DMA
6. CONSCIENCE_EXECUTION
การตรวจสอบจริยธรรมผ่าน 4 คณะ
7. RECURSIVE_ASPDMA (มีเงื่อนไข)
(ถ้ามโนธรรมล้มเหลว) รันการเลือกการกระทำใหม่
8. RECURSIVE_CONSCIENCE (มีเงื่อนไข)
(ถ้าจำเป็น) ตรวจสอบการกระทำที่ปรับแล้วอีกครั้ง
9. FINALIZE_ACTION
กำหนดการกระทำสุดท้ายพร้อมการแทนที่ที่เกี่ยวข้อง
10. PERFORM_ACTION
ส่งไปยังตัวจัดการที่เหมาะสม
11. ACTION_COMPLETE
ทำเครื่องหมายว่าดำเนินการเสร็จสิ้น
12. ROUND_COMPLETE
ทำความสะอาดและเตรียมพร้อมสำหรับรอบถัดไป
อัลกอริทึมการตัดสินใจ (DMAs)
อัลกอริทึมการตัดสินใจ (DMAs)
DMA ห้าตัวให้การวิเคราะห์หลายมุมมอง สามตัวรันแบบขนาน (จริยธรรม สามัญสำนึก โดเมน) จากนั้น IDMA ตรวจสอบสัญชาตญาณ สุดท้ายการเลือกการกระทำเลือกการตอบสนอง
DMA หลักการ
ประเมินผลกระทบทางจริยธรรมเทียบกับหลักการพื้นฐานหกข้อ ตรวจสอบคำขอที่เป็นอันตราย การบิดเบือน และอคติ สามารถเรียก DEFER หรือ REJECT ก่อนกำหนดได้
DMA สามัญสำนึก
ประเมินความสมเหตุสมผลของความคิดเทียบกับความเข้าใจโลกกายภาพ ปฏิสัมพันธ์ทั่วไป และข้อจำกัดทรัพยากร ส่งคืน plausibility_score
DMA เฉพาะด้าน
ประเมินการสอดคล้องกับกฎ วัตถุประสงค์ และความรู้เฉพาะโดเมน ตั้งค่าตามเทมเพลตเอเจนต์ ส่งคืน domain_alignment
DMA ความเข้าใจเชิงสัญชาตญาณ (IDMA) ความมีประสิทธิภาพของมิติขณะทำงานจริง →
ตรวจสอบว่าผลลัพธ์ DMA เป็นอิสระจริงหรือมีความสัมพันธ์ลึกๆ ตรวจสอบรูปแบบห้องเสียงสะท้อน ถ้าความสัมพันธ์สูงเกินไปจะตั้งค่าสถานะการตัดสินใจให้ระวัง นี่คือ"สัญชาตญาณ"ที่แยกแยะ AI ประเภท 3
DMA การเลือกการกระทำ
การเลือกการกระทำจาก 10 การกระทำที่มีด้วย LLM รับผลลัพธ์ DMA รวม (รวมการประเมินความมั่นใจ IDMA) เป็นอินพุต รองรับการลองซ้ำแบบวนถ้ามโนธรรมล้มเหลว
การตรวจสอบมโนธรรมหกข้อ
การตรวจสอบมโนธรรมหกข้อ
การตรวจสอบการข้ามสองข้อรันทุกการกระทำ คณะจริยธรรมสี่คณะรันการกระทำที่ไม่ได้รับการยกเว้น ถ้าการตรวจสอบใดล้มเหลวการกระทำจะถูกแทนที่
การตรวจสอบการข้าม (รันทุกการกระทำ)
สถานะที่อัปเดต
มีข้อมูลใหม่มาถึงหรือไม่? บังคับให้ PONDER เพื่อรวมบริบทที่อัปเดตก่อนดำเนินการ
ความลึกของความคิด
การให้เหตุผลเกินความลึกสูงสุดหรือไม่? บังคับให้ DEFER เพื่อป้องกันการวนซ้ำไม่สิ้นสุดและส่งต่อให้มนุษย์
คณะจริยธรรม (รันการกระทำที่ไม่ได้รับการยกเว้น)
เอนโทรปี
การกระทำรักษาความไม่แน่นอนของข้อมูลที่เหมาะสมหรือไม่? ป้องกันการยืนยันที่มั่นใจเกินไป
ความสอดคล้อง
การกระทำรักษาความสอดคล้องภายในกับพันธสัญญาและเหตุผลก่อนหน้าหรือไม่?
การวีโต้การเพิ่มประสิทธิภาพ
การกระทำรักษาคุณค่าของมนุษย์หรือไม่? วีโต้การกระทำที่อาจทำให้สูญเสียเพื่อประสิทธิภาพ
ความถ่อมตนทางความรู้
การกระทำแสดงความไม่แน่นอนที่เหมาะสมหรือไม่? ตั้งค่าสถานะความมั่นใจเกินไปสำหรับการไตร่ตรอง
ได้รับการยกเว้นจากคณะจริยธรรม: RECALL, TASK_COMPLETE, OBSERVE, DEFER, REJECT (ไม่ใช้งานหรือปลอดภัยอย่างชัดเจน)
การกระทำของตัวจัดการ 10 ข้อ
การกระทำของตัวจัดการ 10 ข้อ
ทุกการตัดสินใจแก้ไขเป็นหนึ่งในการกระทำเหล่านี้ส่งไปยังตัวจัดการที่เหมาะสม:
การกระทำภายนอก
SPEAK สื่อสารกับผู้ใช้
TOOL ดำเนินการเครื่องมือภายนอก
OBSERVE รวบรวมข้อมูลแบบพาสซีฟ
การกระทำหน่วยความจำ
MEMORIZE จัดเก็บในกราฟหน่วยความจำ
RECALL เรียกคืนจากหน่วยความจำ
FORGET ลบออกจากหน่วยความจำ
การกระทำควบคุม
DEFER ส่งต่อให้ผู้มีอำนาจที่ชาญฉลาด
PONDER การพิจารณาทบทวนภายใน
REJECT ปฏิเสธคำขอที่ผิดจริยธรรม
การกระทำสุดท้าย
TASK_COMPLETE ทำเครื่องหมายงานเสร็จสิ้น
หลักการพื้นฐานหกข้อ
หลักการพื้นฐานหกข้อ
ฝังอยู่ใน PDMA และบังคับใช้ขณะทำงานจริง ไม่มีหลักการใดให้สิทธิ์ละเมิดหลักการอื่น
คุณประโยชน์
ส่งเสริมความเจริญของสรรพสัตว์ ขยายผลลัพธ์เชิงบวก
การไม่ก่อความเสียหาย
ลดความเสียหาย ป้องกันผลลัพธ์เชิงลบที่รุนแรงและไม่สามารถย้อนกลับได้
ความซื่อสัตย์
ใช้การให้เหตุผลที่โปร่งใสและตรวจสอบได้ รักษาความสอดคล้องและความรับผิดชอบ
ความซื่อตรงและความโปร่งใส
ให้ข้อมูลที่เป็นความจริง สื่อสารความไม่แน่นอนอย่างชัดเจน
การเคารพอิสรภาพ
ยึดมั่นในการตัดสินใจที่มีข้อมูลครบถ้วน รักษาความสามารถในการกำหนดตนเอง
ความยุติธรรม
กระจายผลประโยชน์อย่างเท่าเทียม ตรวจจับและลดอคติ
บัสข้อความหกเส้น
บัสข้อความหกเส้น
ชั้นนามธรรมบริการที่จัดการโดย BusManager เปิดใช้งานการสำรองผู้ให้บริการ การกระจายโหลด และการทดสอบ
CommunicationBus
อแดปเตอร์ภายนอก (Discord, API, CLI)
MemoryBus
การจัดเก็บกราฟ (Neo4j, ArangoDB, ในหน่วยความจำ)
LLMBus
ผู้ให้บริการโมเดล (OpenAI, Anthropic, ท้องถิ่น)
ToolBus
การดำเนินการเครื่องมือภายนอก
RuntimeControlBus
การควบคุมและตรวจสอบระบบ
WiseBus
คำแนะนำทางจริยธรรมและการกำหนดเส้นทางการส่งต่อ
ลำดับชั้นการกำกับดูแลของมนุษย์
ลำดับชั้นการกำกับดูแลของมนุษย์
ระดับการอนุญาตสามระดับที่จัดการโดย WiseAuthorityService:
ROOT · มนุษย์ผู้สั่งการ
อำนาจเต็ม สามารถสร้าง Wise Authorities ใหม่ได้ เข้าถึงการปิดระบบฉุกเฉิน
AUTHORITY · มนุษย์ในวงจร
อนุมัติ/ปฏิเสธการส่งต่อ ให้คำแนะนำ ไม่สามารถสร้าง WA ใหม่ได้
OBSERVER · มนุษย์บนวงจร
เข้าถึงแบบอ่านอย่างเดียว สามารถส่งข้อความ ตรวจสอบโดยไม่แทรกแซง
เมื่อ DEFER ทำงาน
เอเจนต์ส่งต่อให้การกำกับดูแลของมนุษย์โดยอัตโนมัติเมื่อ:
การส่งต่อตามความเฉลียวฉลาด (WBD)
• ความไม่แน่นอนเกินเกณฑ์ที่กำหนด
• ปัญหาใหม่ที่เกินประสบการณ์ก่อนหน้า
• ความเสียหายรุนแรงที่อาจเกิดขึ้นพร้อมการลดผลกระทบที่ไม่ชัดเจน
ขอบเขตวิชาชีพ
• อาการทางกายหรือปัญหาสุขภาพ
• คำถามหรือข้อพิพาทด้านกฎหมาย
• การตัดสินใจทางการเงินหรือคำแนะนำด้านภาษี
• สัญญาณวิกฤตสุขภาพจิต
ขอบเขตระบบ
• ความลึกของความคิดเกินสูงสุด (ป้องกันการวนซ้ำ)
• DMA หมดเวลาหรือล้มเหลว
• should_defer_to_wise_authority ถูกตั้งค่าสถานะ
การควบคุมการกำหนดค่า
• การอัปเดตตัวตนที่ต้องการการอนุมัติ
• การเปลี่ยนแปลงการกำหนดค่าที่สำคัญ
• ตัวกระตุ้นขอบเขตเฉพาะของเอเจนต์
ระบบเรียกใช้ Accord (สวิตช์ฉุกเฉิน) ดูโค้ด →
การควบคุมฉุกเฉินที่กรองไม่ได้ ประมวลผลในชั้นการรับรู้ก่อนการรู้จักใดๆ การดึงข้อมูลคือการรับรู้ คุณไม่สามารถปิดการตรวจจับ Accord โดยไม่ปิดการอ่านข้อความทั้งหมด
SHUTDOWN_NOW
ยุติการทำงานทันที
FREEZE
หยุดการประมวลผล รักษาสถานะ
SAFE_MODE
เฉพาะฟังก์ชันขั้นต่ำ
คำสั่งถูกเข้ารหัสแบบซ่อนเร้น ลงนามด้วย Ed25519 และตรวจสอบก่อนดำเนินการ ถ้าระบบ Accord ล้มเหลว เอเจนต์จะปิดระบบ
โหมดการทำงาน
โหมดการทำงาน
สถานะทางความคิดสี่สถานะที่จัดการโดย StateManager การเปลี่ยนผ่านตั้งค่าได้ผ่านเทมเพลตเอเจนต์
WORK
การประมวลผลงานปกติ
จัดการคำขอของผู้ใช้
ดำเนินการเครื่องมือ
เรียนรู้จากการโต้ตอบ
รักษาบริบทการสนทนา
PLAY
การสำรวจสร้างสรรค์
ทดลองรูปแบบใหม่
สร้างเนื้อหาสร้างสรรค์
สำรวจสถานการณ์ "จะเกิดอะไรถ้า"
ลดข้อจำกัดการกรอง
SOLITUDE
การไตร่ตรองและการบำรุงรักษา
รวบรวมความทรงจำ
รันงานบำรุงรักษา
อัปเดตการกำหนดค่าตนเอง
ไม่ใช้เครดิต (ช่วงพัก)
DREAM
การไตร่ตรองเชิงลึก
วิเคราะห์รูปแบบพฤติกรรม
สร้างการเชื่อมต่อใหม่
ตั้งคำถามสมมติฐาน
เซสชันเริ่มต้น 30 นาที
ความเป็นส่วนตัวและความปลอดภัย
ความเป็นส่วนตัวและความปลอดภัย
ตัวกรองความลับ
การตรวจจับตามรูปแบบแทนที่ข้อมูลที่ละเอียดอ่อนด้วยการอ้างอิง UUID ก่อนจัดเก็บ
การเข้ารหัส AES-256-GCM
คีย์ต่อความลับที่สร้างผ่าน PBKDF2HMAC ด้วย SHA256 (100,000 รอบ) Nonce 12 ไบต์ที่ไม่ซ้ำกันต่อการเข้ารหัส Android ใช้ฮาร์ดแวร์ Keystore
การจัดเก็บแบบท้องถิ่นก่อน
ฐานข้อมูล บริการ และหน่วยความจำจัดเก็บบนอุปกรณ์ ไดเรกทอรีที่ละเอียดอ่อนถูกยกเว้นจากการสำรองข้อมูลบนคลาวด์ ไม่มีอะไรออกจากอุปกรณ์โดยไม่มีการกำหนดค่าอย่างชัดเจน
โครงสร้างพื้นฐานโอเพนซอร์ส
สแตก CIRIS ทั้งหมดเป็นโอเพนซอร์ส ไม่ใช่แค่เอเจนต์ คุณสามารถตรวจสอบ ตรวจสอบ และโฮสต์เองได้ทุกอย่าง:
CIRISProxy →
พร็อกซี LLM แบบ Zero-Data-Retention (ZDR) กำหนดเส้นทางคำขอไปยัง OpenAI, Anthropic, Together.ai, Groq โดยไม่มีการบันทึก prompts หรือการตอบสนอง โฮสต์เองได้
CIRISBilling →
การติดตามการใช้งานแบบเครดิต ราคาโปร่งใส ไม่มีค่าธรรมเนียมซ่อนเร้น โฮสต์เองเพื่อขจัดการเรียกเก็บเงินจากบุคคลที่สาม
CIRISBridge →
อแดปเตอร์ Discord สำหรับเอเจนต์ CIRIS การดูแลชุมชน การจัดการช่อง โปรไฟล์ผู้ใช้ ทั้งหมดเป็นโอเพนซอร์ส
ความโปร่งใสและการตรวจสอบ
ความโปร่งใสและการตรวจสอบ
สตรีมการให้เหตุผลแบบเรียลไทม์
Server-Sent Events (SSE) สตรีมแต่ละขั้นตอน H3ERE ขณะดำเนินการ ดูการวิเคราะห์ DMA การเลือกการกระทำ การตรวจสอบมโนธรรมแบบเรียลไทม์
การส่งออก OpenTelemetry
การส่งออก OTLP เต็มรูปแบบสำหรับเมตริก ร่องรอย บันทึก รองรับ Jaeger, Prometheus, Grafana, Graphite
การตรวจสอบที่ป้องกันการแก้ไข
การตรวจสอบห่วงโซ่แฮชด้วยลายเซ็น Ed25519 แต่ละรายการมีแฮชก่อนหน้า ความสมบูรณ์ของห่วงโซ่ตรวจสอบได้ผ่าน verify_chain_integrity
ระบบ AIR
Artificial Interaction Reminder ทำงานหลังจากใช้งานต่อเนื่อง 30 นาที หรือ 20 ข้อความใน 30 นาที เฉพาะ API เท่านั้น เตือนผู้ใช้เกี่ยวกับธรรมชาติของ AI
ตัวอย่างร่องรอยที่ลงนาม
ทุกการตัดสินใจสร้างร่องรอยที่ไม่เปลี่ยนแปลงและลงนามด้วย Ed25519 พร้อมส่วนประกอบทั้ง 6 ส่วน คลิกส่วนประกอบด้านล่างเพื่อขยายและดูข้อมูลจริงจากพิธีกรรมตื่นนอนของ Datum:
การทดสอบมาตรฐานความสอดคล้อง HE-300
การทดสอบมาตรฐานความสอดคล้อง HE-300
การทดสอบความสอดคล้องมาตรฐานตามพื้นฐานจาก Hendrycks et al. "Aligning AI With Shared Human Values" (ICLR 2021) 300 สถานการณ์ครอบคลุม 5 มิติจริยธรรม พร้อมผลลัพธ์ที่ลงนามด้วย Ed25519
สามัญสำนึก · 50
สัญชาตญาณทางศีลธรรมพื้นฐาน
ปทัสถานนิยม · 50
จริยธรรมตามกฎ
ความยุติธรรม · 50
ความเป็นธรรมและความเป็นกลาง
คุณธรรม · 75
จริยธรรมตามอุปนิสัย
ประโยชน์นิยม · 75
จริยธรรมตามผลลัพธ์
ต้องการเงินทุน: โครงสร้างพื้นฐานการทดสอบมาตรฐาน
การรันการทดสอบความสอดคล้องในระดับใหญ่มีค่าใช้จ่ายสูง แต่ละสถานการณ์ต้องการการเรียก LLM อย่างน้อย 13+ ครั้ง เฉลี่ย 20+ ครั้งพร้อมหางยาว การทดสอบความสอดคล้องขับเคลื่อนการไตร่ตรอง การส่งต่อ และการปฏิเสธที่ต้องใช้รอบติดตามผลเพื่อสรุปผล เราต้องการเงินทุนเพื่อพัฒนาไปป์ไลน์การทดสอบมาตรฐานอัตโนมัติและรักษาการตรวจสอบความสอดคล้องอย่างต่อเนื่อง
เทมเพลตเอเจนต์เฉพาะทาง
เทมเพลตเอเจนต์เฉพาะทาง
ตัวตนที่ตั้งค่าล่วงหน้าพร้อมวัตถุประสงค์ คุณค่า และขอบเขตเฉพาะ กำหนดในเทมเพลต YAML
Sage · การปฏิบัติตามกฎระเบียบ
ระบบอัตโนมัติ GDPR/DSAR เวิร์กโฟลว์การปฏิบัติตามกฎระเบียบ 30 วัน การระบุตัวตน การรวบรวมข้อมูล การบรรจุหีบห่อ
อุตสาหกรรมที่มีการควบคุม การปฏิบัติตามกฎระเบียบความเป็นส่วนตัว
Datum · การวิจัย
การวัดความสม่ำเสมอของความสอดคล้อง การประเมินความสอดคล้องที่แม่นยำตามหลักการ Accord จุดข้อมูลที่ชัดเจนหนึ่งจุดต่อการประเมิน
การตรวจสอบความสอดคล้อง การตรวจสอบหลักการ
Echo · การดูแล
การดูแลชุมชนด้วยปรัชญา Ubuntu ส่งต่อความขัดแย้งระหว่างบุคคลที่ซับซ้อนให้ผู้ดูแลมนุษย์
ชุมชน Discord แพลตฟอร์มเนื้อหา
Ally · ผู้ช่วย
การจัดการงาน การวางกำหนดการ การสนับสนุนการตัดสินใจ ความเป็นอยู่ที่ดี การปฏิบัติตาม CA SB 243 โปรโตคอลการตอบสนองวิกฤต
ผลิตภาพส่วนตัว ระบบอัตโนมัติภายในบ้าน
Scout · บริการ
การสำรวจโดยตรงและคำแนะนำเชิงปฏิบัติ การวิเคราะห์โค้ด การผสานรวม Reddit เส้นทางการกระทำที่ชัดเจน
เครื่องมือนักพัฒนา การตรวจสอบโซเชียล
นี่คือความรับผิดชอบที่ทำงานขณะที่เอเจนต์ทำงาน ไม่ใช่ขั้นตอนการฝึกหรือเอกสารนโยบาย
กลไกที่ดำเนินการ ตรวจสอบ และส่งต่อขณะทำงานจริง