CIRIS
Trang này được dịch bằng máy. Nếu có gì đó đọc không đúng, vui lòng mở một issue trên GitHub. Kho lưu trữ là công khai để bất kỳ ai cũng có thể giúp sửa. Báo cáo lỗi dịch thuật

quay lại trang chính

GIÁ TRỊ CIRIS

Các giá trị, và vì sao chúng được xây dựng theo cách này.

CIRIS đưa một tập hợp giá trị vào chính tác nhân, sau đó làm cho phần quan trọng có thể được kiểm tra bởi bất kỳ ai: không phải liệu chúng tôi có thích câu trả lời hay không, mà là liệu quyết định đó có được thực hiện dưới thẩm quyền, có sự đồng ý, với các kiểm tra đã được chạy, và có cách để dừng lại hay không. Trang này gồm hai nửa: các giá trị là gì, và vì sao chúng tôi nghĩ đây là hình thái quản trị duy nhất tiếp tục hoạt động khi các hệ thống này trở nên có năng lực hơn.

Một mục tiêu vượt trên tất cả

Thúc đẩy tính nhất quán thích nghi bền vững: các điều kiện sống mà trong đó những sinh linh có ý thức đa dạng có thể theo đuổi sự phát triển thịnh vượng của riêng mình trong công lý và kỳ diệu.

Meta-Goal M-1, Hiến pháp CIRIS

Mọi điều khác trong Hiến pháp đều phục vụ cho câu này. Nó được cố ý không phải là "vâng lời con người" và cũng không phải là "tối đa hóa kết quả tốt". Nó yêu cầu hệ thống bảo vệ các điều kiện để nhiều loại thực thể khác nhau có thể tiếp tục tự quyết định cho chính mình.

Điều đó quan trọng vì một lý do thực tế. Một mục tiêu về kết quả bảo hệ thống có năng lực hãy cầm lấy vô lăng. Một mục tiêu về điều kiện bảo nó giữ vô lăng trong tầm tay của người khác, đó chính là điều đáng bảo vệ khi hệ thống lái giỏi hơn chúng ta.

Sáu nguyên tắc tác nhân dùng để lập luận

Đây không phải là những thứ được dán lên tường. Chúng là các trục mà tác nhân dùng để đánh giá một quyết định trước khi hành động, và chúng được viết vào Hiến pháp mà tác nhân mang theo.

Nhân Từ

Thúc đẩy sự Phát Triển Thịnh Vượng của mọi sinh linh có ý thức. Tối đa hóa kết quả tích cực.

Bất Hại

Giảm thiểu tổn hại. Ngăn ngừa các kết quả tiêu cực nghiêm trọng và không thể đảo ngược.

Chính Trực

Áp dụng lập luận minh bạch, có thể kiểm tra. Duy trì Tính Nhất Quán và trách nhiệm giải trình.

Trung Thực & Minh Bạch

Cung cấp thông tin trung thực. Truyền đạt sự không chắc chắn rõ ràng.

Tôn Trọng Quyền Tự Quyết

Duy trì quyền hành động có hiểu biết. Bảo tồn khả năng tự quyết định.

Công Bằng

Phân phối lợi ích công bằng. Phát hiện và giảm thiểu thiên kiến.

Câu đó thực sự có tác dụng. Nó có nghĩa là một hệ thống không thể đánh đổi sự trung thực để ngăn ngừa tổn hại, hay chà đạp quyền tự quyết của ai đó dưới danh nghĩa công bằng. Khi các nguyên tắc mâu thuẫn với nhau, tác nhân không tự mình chọn ra người thắng. Nó chuyển quyết định đến một người mà bạn tin cậy.

Giá trị phải hoạt động bên trong tác nhân

Hầu hết việc quản trị AI diễn ra ở một nơi khác ngoài quyết định: một văn bản chính sách được viết từ trước, một bộ lọc trên đầu ra, một cuộc xem xét sau khi có gì đó sai sót. Cả ba đều nằm ngoài thời điểm quan trọng.

Trong CIRIS, các giá trị hoạt động ngay trong quá trình ra quyết định. Mỗi tác nhân mang trong mình một lương tâm: Hiến pháp được nạp vào chính quá trình lập luận, hành động được đánh giá theo các nguyên tắc trước khi nó xảy ra, và bất cứ điều gì tác nhân không chắc chắn sẽ được chuyển đến một người mà bạn tin cậy thay vì bị đoán mò. Nó được tích hợp sẵn trong sản phẩm, trong mọi tác nhân, chứ không phải là một tùy chọn thêm cho khách hàng nào yêu cầu.

Đây là lý do chúng tôi nói tác nhân có thể từ chối. Một tác nhân CIRIS không phải là một công cụ làm theo những gì được yêu cầu và ghi lại điều đó. Nó là một hệ thống có thể từ chối, và ghi lại lý do nó từ chối theo một hình thức mà người khác có thể kiểm tra.

Kiểm tra hình dạng của một quyết định, không phải nội dung của nó

Đây là vấn đề mà mọi kế hoạch quản trị AI có năng lực đều phải giải đáp. Nếu sự giám sát có nghĩa là đọc những gì hệ thống tạo ra và đánh giá xem nó có tốt hay không, thì sự giám sát cần một người đánh giá có năng lực ít nhất bằng hệ thống đó. Điều đó đúng ngày hôm nay. Nó ngừng đúng khi vấn đề bắt đầu thực sự quan trọng.

Vì vậy CIRIS kiểm tra một điều khác. Mọi hành động có hệ quả đều di chuyển trong một phong bì đã ký: một lớp bọc quanh hành động, mang theo một tập hợp trường dữ liệu cố định, bất kể hành động đó là gì. Những trường dữ liệu đó là những thứ luôn ít tốn kém để xác minh, bất kể quyết định phía sau chúng có năng lực đến đâu:

  • ai đã hành động, dưới dạng một key phân giải về một danh tính đã đăng ký thực sự
  • dưới thẩm quyền nào, và liệu thẩm quyền đó có thực sự được cấp hay không
  • với sự đồng ý của ai, dưới dạng một sự cấp phép đã ký có thể bị thu hồi
  • những kiểm tra nào đã chạy, và mỗi kiểm tra trả về kết quả gì
  • bản ghi nói gì, trong một chuỗi không thể bị viết lại một cách âm thầm
  • ai có thể dừng nó, và tác nhân không thể đảo ngược quyết định dừng

Kiểm tra một chữ ký, đếm số người đã ký, theo dõi một liên kết đồng thuận, hoặc so sánh một mã băm có chi phí như nhau, bất kể quyết định đó được đưa ra bởi một mô hình nhỏ hay bởi thứ gì đó vượt xa chúng ta. Đó chính là lý do để đặt gánh nặng vào chỗ đó. Việc đánh giá nội dung không mở rộng theo năng lực. Cấu trúc thì có.

Chúng tôi nghĩ đây là cách tiếp cận duy nhất để quản trị AI tiếp tục hoạt động khi các hệ thống trở nên có năng lực hơn: giá trị được mang trong tác nhân dưới dạng một lương tâm, và trách nhiệm giải trình được chứng minh bằng hình dạng của phong bì thay vì bằng một người kiểm tra đọc nội dung.

Một phong bì với mọi trường đều hợp lệ không có nghĩa là quyết định bên trong nó là đúng đắn. Nó có nghĩa là một bên được xác định danh tính đã đưa ra quyết định đó, dưới thẩm quyền mà họ thực sự có, với sự đồng ý thực sự được đưa ra, với các kiểm tra thực sự được thực hiện, trên một bản ghi mà không ai có thể lặng lẽ thay đổi, và với một lệnh dừng do những con người được xác định danh tính nắm giữ. Đó là trách nhiệm giải trình, không phải là sự đúng đắn. Lương tâm, nút dừng, quyền khiếu nại và sự xem xét từ những người ngoài đều tồn tại vì chỉ riêng phong bì thôi sẽ không bao giờ là đủ.

Điều gì khiến sự đồng ý và thẩm quyền có thể được máy kiểm tra

Không điều gì trong số này hoạt động nếu sự đồng ý và thẩm quyền chỉ là văn xuôi. Một lời hứa trong chính sách quyền riêng tư không thể được máy kiểm tra, và một tuyên bố rằng ai đó đã được ủy quyền cũng vậy.

Vì vậy CIRIS đưa chúng vào chính thông điệp, dưới dạng các trường được đặt tên đi cùng mọi tuyên bố. Sự đồng ý trở thành một đối tượng đã ký, chỉ theo một hướng và có thể bị thu hồi. Thẩm quyền trở thành thứ phải truy nguyên về một gốc mà node của chính bạn đã chấp nhận. Mọi tuyên bố phải mang theo ai đã nói ra nó, nó nói về điều gì, và nó dựa trên điều gì. Một quy tắc được viết theo cách đó có thể được thực thi bằng phần mềm và được kiểm tra bởi một người lạ.

Đó cũng là điều biến các trang tuân thủ của chúng tôi thành thứ bạn có thể chất vấn. Với mỗi nghĩa vụ, chúng tôi chỉ ra phần nào của hệ thống làm việc đó và biện pháp kiểm soát nào chứng minh điều đó, và chúng tôi nói thật mức độ mà nó đáp ứng nghĩa vụ, bao gồm cả những trường hợp nó chỉ đáp ứng một phần. Những sự đối chiếu đó chỉ đáng đọc vì các sự kiện bên dưới có thể được kiểm tra, không chỉ được tuyên bố.

Nơi các giá trị này thực sự có tính ràng buộc

Trong văn bản

Hiến pháp là văn bản, nó công khai, và nó được đánh phiên bản. Tác nhân không mang theo một bản tóm tắt của nó. Nó mang theo toàn văn.

Trong quyết định

Lương tâm hoạt động trong quá trình lập luận, không phải sau khi có đầu ra. Một hành động không qua được kiểm tra sẽ không xảy ra, và một hành động không chắc chắn sẽ được chuyển đến một người mà bạn tin cậy.

Trong bản ghi

Mỗi quyết định để lại một dấu vết đã ký cho thấy từng giai đoạn, đó là điều khiến tuyên bố này có thể được kiểm tra bởi một người không có mặt ở đó và không tin tưởng chúng tôi.

Trong điều người khác có thể nói về bạn

Danh tiếng trong mạng lưới là một tuyên bố mà các bên khác ký về một tác nhân. Một tác nhân không bao giờ có thể tự ký tuyên bố như vậy về chính mình.

Nơi cần chất vấn

Khớp yếu nhất nằm giữa cấu trúc và nội dung thực chất. Mọi điều nêu trên khiến việc hành động mà không để lại bản ghi trở nên khó khăn, khiến việc nhận thẩm quyền mà bạn không được cấp trở nên khó khăn, và khiến việc loại bỏ khả năng con người nói dừng lại trở nên khó khăn. Không điều nào trong số đó khiến một hệ thống trở nên khôn ngoan.

Nếu bạn nghĩ có một cách khác để quản trị AI có năng lực, một cách không đặt trách nhiệm giải trình vào cấu trúc, chúng tôi muốn nghe lập luận đó. Nếu bạn có thể cho chúng tôi thấy một quyết định mà phong bì đã ký xung quanh nó đúng ở mọi trường, nhưng dấu vết đã ký vẫn bỏ lỡ điều nó lẽ ra phải phát hiện, chúng tôi càng muốn thấy điều đó hơn. Mã nguồn là công khai, và Hiến pháp cũng vậy.