Một mục tiêu vượt trên tất cả
Thúc đẩy tính nhất quán thích nghi bền vững: các điều kiện sống mà trong đó những sinh linh có ý thức đa dạng có thể theo đuổi sự phát triển thịnh vượng của riêng mình trong công lý và kỳ diệu.
Meta-Goal M-1, Hiến pháp CIRIS
Mọi điều khác trong Hiến pháp đều phục vụ cho câu này. Nó được cố ý không phải là "vâng lời con người" và cũng không phải là "tối đa hóa kết quả tốt". Nó yêu cầu hệ thống bảo vệ các điều kiện để nhiều loại thực thể khác nhau có thể tiếp tục tự quyết định cho chính mình.
Điều đó quan trọng vì một lý do thực tế. Một mục tiêu về kết quả bảo hệ thống có năng lực hãy cầm lấy vô lăng. Một mục tiêu về điều kiện bảo nó giữ vô lăng trong tầm tay của người khác, đó chính là điều đáng bảo vệ khi hệ thống lái giỏi hơn chúng ta.
Sáu nguyên tắc tác nhân dùng để lập luận
Đây không phải là những thứ được dán lên tường. Chúng là các trục mà tác nhân dùng để đánh giá một quyết định trước khi hành động, và chúng được viết vào Hiến pháp mà tác nhân mang theo.
Nhân Từ
Thúc đẩy sự Phát Triển Thịnh Vượng của mọi sinh linh có ý thức. Tối đa hóa kết quả tích cực.
Bất Hại
Giảm thiểu tổn hại. Ngăn ngừa các kết quả tiêu cực nghiêm trọng và không thể đảo ngược.
Chính Trực
Áp dụng lập luận minh bạch, có thể kiểm tra. Duy trì Tính Nhất Quán và trách nhiệm giải trình.
Trung Thực & Minh Bạch
Cung cấp thông tin trung thực. Truyền đạt sự không chắc chắn rõ ràng.
Tôn Trọng Quyền Tự Quyết
Duy trì quyền hành động có hiểu biết. Bảo tồn khả năng tự quyết định.
Công Bằng
Phân phối lợi ích công bằng. Phát hiện và giảm thiểu thiên kiến.
Không nguyên tắc nào cho phép vi phạm một nguyên tắc khác.
Câu đó thực sự có tác dụng. Nó có nghĩa là một hệ thống không thể đánh đổi sự trung thực để ngăn ngừa tổn hại, hay chà đạp quyền tự quyết của ai đó dưới danh nghĩa công bằng. Khi các nguyên tắc mâu thuẫn với nhau, tác nhân không tự mình chọn ra người thắng. Nó chuyển quyết định đến một người mà bạn tin cậy.
Giá trị phải hoạt động bên trong tác nhân
Hầu hết việc quản trị AI diễn ra ở một nơi khác ngoài quyết định: một văn bản chính sách được viết từ trước, một bộ lọc trên đầu ra, một cuộc xem xét sau khi có gì đó sai sót. Cả ba đều nằm ngoài thời điểm quan trọng.
Trong CIRIS, các giá trị hoạt động ngay trong quá trình ra quyết định. Mỗi tác nhân mang trong mình một lương tâm: Hiến pháp được nạp vào chính quá trình lập luận, hành động được đánh giá theo các nguyên tắc trước khi nó xảy ra, và bất cứ điều gì tác nhân không chắc chắn sẽ được chuyển đến một người mà bạn tin cậy thay vì bị đoán mò. Nó được tích hợp sẵn trong sản phẩm, trong mọi tác nhân, chứ không phải là một tùy chọn thêm cho khách hàng nào yêu cầu.
Đây là lý do chúng tôi nói tác nhân có thể từ chối. Một tác nhân CIRIS không phải là một công cụ làm theo những gì được yêu cầu và ghi lại điều đó. Nó là một hệ thống có thể từ chối, và ghi lại lý do nó từ chối theo một hình thức mà người khác có thể kiểm tra.
Kiểm tra hình dạng của một quyết định, không phải nội dung của nó
Đây là vấn đề mà mọi kế hoạch quản trị AI có năng lực đều phải giải đáp. Nếu sự giám sát có nghĩa là đọc những gì hệ thống tạo ra và đánh giá xem nó có tốt hay không, thì sự giám sát cần một người đánh giá có năng lực ít nhất bằng hệ thống đó. Điều đó đúng ngày hôm nay. Nó ngừng đúng khi vấn đề bắt đầu thực sự quan trọng.
Vì vậy CIRIS kiểm tra một điều khác. Mọi hành động có hệ quả đều di chuyển trong một phong bì đã ký: một lớp bọc quanh hành động, mang theo một tập hợp trường dữ liệu cố định, bất kể hành động đó là gì. Những trường dữ liệu đó là những thứ luôn ít tốn kém để xác minh, bất kể quyết định phía sau chúng có năng lực đến đâu:
- ai đã hành động, dưới dạng một key phân giải về một danh tính đã đăng ký thực sự
- dưới thẩm quyền nào, và liệu thẩm quyền đó có thực sự được cấp hay không
- với sự đồng ý của ai, dưới dạng một sự cấp phép đã ký có thể bị thu hồi
- những kiểm tra nào đã chạy, và mỗi kiểm tra trả về kết quả gì
- bản ghi nói gì, trong một chuỗi không thể bị viết lại một cách âm thầm
- ai có thể dừng nó, và tác nhân không thể đảo ngược quyết định dừng
Kiểm tra một chữ ký, đếm số người đã ký, theo dõi một liên kết đồng thuận, hoặc so sánh một mã băm có chi phí như nhau, bất kể quyết định đó được đưa ra bởi một mô hình nhỏ hay bởi thứ gì đó vượt xa chúng ta. Đó chính là lý do để đặt gánh nặng vào chỗ đó. Việc đánh giá nội dung không mở rộng theo năng lực. Cấu trúc thì có.
Luận điểm, nói rõ ràng
Chúng tôi nghĩ đây là cách tiếp cận duy nhất để quản trị AI tiếp tục hoạt động khi các hệ thống trở nên có năng lực hơn: giá trị được mang trong tác nhân dưới dạng một lương tâm, và trách nhiệm giải trình được chứng minh bằng hình dạng của phong bì thay vì bằng một người kiểm tra đọc nội dung.
Và điều nó không chứng minh
Một phong bì với mọi trường đều hợp lệ không có nghĩa là quyết định bên trong nó là đúng đắn. Nó có nghĩa là một bên được xác định danh tính đã đưa ra quyết định đó, dưới thẩm quyền mà họ thực sự có, với sự đồng ý thực sự được đưa ra, với các kiểm tra thực sự được thực hiện, trên một bản ghi mà không ai có thể lặng lẽ thay đổi, và với một lệnh dừng do những con người được xác định danh tính nắm giữ. Đó là trách nhiệm giải trình, không phải là sự đúng đắn. Lương tâm, nút dừng, quyền khiếu nại và sự xem xét từ những người ngoài đều tồn tại vì chỉ riêng phong bì thôi sẽ không bao giờ là đủ.
Điều gì khiến sự đồng ý và thẩm quyền có thể được máy kiểm tra
Không điều gì trong số này hoạt động nếu sự đồng ý và thẩm quyền chỉ là văn xuôi. Một lời hứa trong chính sách quyền riêng tư không thể được máy kiểm tra, và một tuyên bố rằng ai đó đã được ủy quyền cũng vậy.
Vì vậy CIRIS đưa chúng vào chính thông điệp, dưới dạng các trường được đặt tên đi cùng mọi tuyên bố. Sự đồng ý trở thành một đối tượng đã ký, chỉ theo một hướng và có thể bị thu hồi. Thẩm quyền trở thành thứ phải truy nguyên về một gốc mà node của chính bạn đã chấp nhận. Mọi tuyên bố phải mang theo ai đã nói ra nó, nó nói về điều gì, và nó dựa trên điều gì. Một quy tắc được viết theo cách đó có thể được thực thi bằng phần mềm và được kiểm tra bởi một người lạ.
Đó cũng là điều biến các trang tuân thủ của chúng tôi thành thứ bạn có thể chất vấn. Với mỗi nghĩa vụ, chúng tôi chỉ ra phần nào của hệ thống làm việc đó và biện pháp kiểm soát nào chứng minh điều đó, và chúng tôi nói thật mức độ mà nó đáp ứng nghĩa vụ, bao gồm cả những trường hợp nó chỉ đáp ứng một phần. Những sự đối chiếu đó chỉ đáng đọc vì các sự kiện bên dưới có thể được kiểm tra, không chỉ được tuyên bố.
Nơi các giá trị này thực sự có tính ràng buộc
Trong văn bản
Hiến pháp là văn bản, nó công khai, và nó được đánh phiên bản. Tác nhân không mang theo một bản tóm tắt của nó. Nó mang theo toàn văn.
Trong quyết định
Lương tâm hoạt động trong quá trình lập luận, không phải sau khi có đầu ra. Một hành động không qua được kiểm tra sẽ không xảy ra, và một hành động không chắc chắn sẽ được chuyển đến một người mà bạn tin cậy.
Trong bản ghi
Mỗi quyết định để lại một dấu vết đã ký cho thấy từng giai đoạn, đó là điều khiến tuyên bố này có thể được kiểm tra bởi một người không có mặt ở đó và không tin tưởng chúng tôi.
Trong điều người khác có thể nói về bạn
Danh tiếng trong mạng lưới là một tuyên bố mà các bên khác ký về một tác nhân. Một tác nhân không bao giờ có thể tự ký tuyên bố như vậy về chính mình.
Nơi cần chất vấn
Khớp yếu nhất nằm giữa cấu trúc và nội dung thực chất. Mọi điều nêu trên khiến việc hành động mà không để lại bản ghi trở nên khó khăn, khiến việc nhận thẩm quyền mà bạn không được cấp trở nên khó khăn, và khiến việc loại bỏ khả năng con người nói dừng lại trở nên khó khăn. Không điều nào trong số đó khiến một hệ thống trở nên khôn ngoan.
Nếu bạn nghĩ có một cách khác để quản trị AI có năng lực, một cách không đặt trách nhiệm giải trình vào cấu trúc, chúng tôi muốn nghe lập luận đó. Nếu bạn có thể cho chúng tôi thấy một quyết định mà phong bì đã ký xung quanh nó đúng ở mọi trường, nhưng dấu vết đã ký vẫn bỏ lỡ điều nó lẽ ra phải phát hiện, chúng tôi càng muốn thấy điều đó hơn. Mã nguồn là công khai, và Hiến pháp cũng vậy.