দুটি পথ
ওজনকে বিশ্বাস করবেন, নাকি আচরণ যাচাই করবেন
AI নিরাপত্তার মূলধারা মডেলটিকে ভেতর থেকে ভালো করার চেষ্টা করে: এর মূল্যবোধ প্রশিক্ষণ দেয়, এর চিন্তাভাবনা পর্যবেক্ষণ করে, এটিকে নিজের সাথে বিতর্ক করায়। সেই কাজ গুরুত্বপূর্ণ। CIRIS অন্য পথে বাজি ধরে। ধরে নাও যে একটি সক্ষম মডেল ভুলভাবে অ্যালাইন থাকতে পারে, এবং তার মনকে বিশ্বাস করার বদলে, এর গুরুত্বপূর্ণ কাজগুলো মানুষ ও অন্যান্য সিস্টেমের কাছে জবাবদিহিযোগ্য করো, যারা সেগুলো যাচাই করতে পারে।
এই ক্ষেত্রের নিজস্ব পরিভাষায়, CIRIS প্রাতিষ্ঠানিক ও নিয়ন্ত্রণ শাখায় অবস্থান করে, AI নিয়ন্ত্রণ এবং গ্যারান্টিযুক্ত-নিরাপদ AI-এর পাশে, RLHF, Constitutional AI, বিতর্ক এবং ব্যাখ্যাযোগ্যতার মূল্যবোধ-অভ্যন্তরীণকরণ মূলধারায় নয়। স্কেলযোগ্য তত্ত্বাবধানের প্রশ্নে, আপনার চেয়ে স্মার্ট কিছুকে কীভাবে তদারক করবেন, CIRIS-এর উত্তর হলো জবাবদিহিতার খামটি যাচাই করা, যুক্তিতর্ক নয়। একটি স্বাক্ষর, একটি কোরাম, একটি হ্যাশ-চেইনড অডিট যাচাই করা সস্তাই থাকে, এমনকি যখন পেছনের সিদ্ধান্তটি অতিমানবীয়। এটি সময়ের সাথে সাথে অনেক সক্ষম এজেন্টের সিস্টেমকে অ্যালাইন করে, কোনো একক মনের মূল্যবোধকে নয়।
আমরা যে রেখা ধরে রাখি
এটি একটি সর্বশক্তিমান AI-কে অ্যালাইন করার চেষ্টা করে না। উদ্দেশ্যমূলকভাবে।
জবাবদিহিতার জন্য একাধিক পক্ষ দরকার। কাউকে জবাব দিতে হবে। যাচাই করার একটি উপায় যা চুপচাপ গিলে ফেলা যাবে না। ক্ষমতার একটি ভারসাম্য যা কোনো একটি পক্ষ দখল করতে পারবে না। একটি একক সুপার-ইন্টেলিজেন্সের এগুলোর কিছুই নেই, তাই এটিকে জবাবদিহিতায় ধরে রাখার কোনো সৎ উপায় নেই। CIRIS অন্য ভবিষ্যতের জন্য তৈরি: অনেক সক্ষম এজেন্ট, মানুষ এবং সংগঠন, যাদের গুরুত্বপূর্ণ সিদ্ধান্তগুলো সবই স্বাধীনভাবে যাচাইযোগ্য।
তাই অবস্থানটি স্পষ্ট। একক ASI একটি অ্যালাইন করার সিস্টেম নয়, বরং একটি প্রতিরোধ করার অবস্থা। মানব প্রাতিষ্ঠানিক বিকাশের এই পর্যায়ে অতিমানবীয় সক্ষমতা একটি অজবাবদিহিযোগ্য জায়গায় কেন্দ্রীভূত করা অবৈধ, কারণ কোনো প্রতিষ্ঠানই এটিকে জবাবদিহিতায় ধরে রাখার মতো যথেষ্ট পরিপক্ক নয়, এবং এটাই ঠিক বিপদ। কাঠামোর নিজস্ব পরিভাষায় একটি সিঙ্গেলটন হলো ρ→1 একক-কণ্ঠ পতন যা করিডোর মডেল একটি সমন্বয় ব্যর্থতা হিসেবে চিহ্নিত করে, সাফল্য নয়। আমাদের গ্যারান্টিগুলো একটি ফেডারেশন জুড়ে প্রযোজ্য এবং একটি সিঙ্গেলটনের বিরুদ্ধে ক্ষয় পায়, এটি কোনো ফাঁক নয় যা আমরা পূরণ করছি। এটি সেই পরিস্থিতি যাকে আমরা বৈধতা দিতে অস্বীকার করি, একটি প্রতিশ্রুতি হিসেবে, শুধু একটি পূর্বাভাস নয়।
আপনি আসলে যে AI ব্যবহার করেন তার সাথে তুলনা
প্রতিদিনের সহকারীগুলো শক্তিশালী এবং ব্যবহারে সহজ। তবে এগুলো অন্য কারো ক্লাউডে চলে, কোনো রেকর্ড রাখে না যা আপনি যাচাই করতে পারবেন, এবং এমন কারো কাছে জবাবদিহি করে না যাকে আপনি চেনেন। এখানে একই জবাবদিহিতার পরীক্ষা, যা বেশিরভাগ মানুষ প্রতিদিন যে AI খোলেন তার উপর প্রয়োগ করা হয়েছে।
| সহকারী | প্রকাশিত নীতিমালা | কী করেছে তার প্রমাণ | অনিশ্চিত হলে মানুষকে জিজ্ঞেস করে | ওপেন সোর্স | এক্কো-চেম্বার যাচাই |
|---|---|---|---|---|---|
| ChatGPT | হ্যাঁ | না | না | না | না |
| Gemini | হ্যাঁ | না | না | না | না |
| Claude | হ্যাঁ | না | না | না | না |
| CIRIS | হ্যাঁ | হ্যাঁ | হ্যাঁ | হ্যাঁ | হ্যাঁ |
জুন ২০২৬ পর্যন্ত প্রকাশ্য পণ্য আচরণের ভিত্তিতে তুলনা করা হয়েছে। প্রতিটি নীতিমালার লিঙ্ক সেই কোম্পানির নিজস্ব প্রকাশিত বিবরণে যায়।