এই পৃষ্ঠাটি মেশিন দ্বারা অনুবাদ করা হয়েছে। কিছু ভুল মনে হলে একটি ইস্যু খুলুন — রিপোজিটরি সবার জন্য উন্মুক্ত। অনুবাদের সমস্যা জানান

লবিতে ফিরে যাও

সুপারঅ্যালাইনমেন্টের ভূদৃশ্য

এই ক্ষেত্রের বেশিরভাগ কাজ মডেলকে অ্যালাইন করার চেষ্টা করছে। CIRIS মডেলের চারপাশের প্রতিষ্ঠানগুলো তৈরি করছে।

শক্তিশালী AI-কে নিরাপদ করার দুটি সৎ পথ আছে। একটি হলো মডেলের মূল্যবোধ প্রশিক্ষণ দেওয়া যতক্ষণ না আপনি সেগুলো বিশ্বাস করতে পারেন। অন্যটি হলো ধরে নেওয়া যে মডেল ভুল হতে পারে, এবং সে যা করে তা খোলামেলাভাবে মানুষ ও সিস্টেমের কাছে জবাবদিহিযোগ্য করা, যা যে কেউ যাচাই করতে পারে। CIRIS দ্বিতীয় পথ বেছে নিয়েছে। এখানে পুরো ভূদৃশ্য সৎভাবে মানচিত্র করা হয়েছে, এবং আমরা কোথায় ফিট করি তা দেখানো হয়েছে।

01সারিবদ্ধতা

ওজনকে বিশ্বাস করবেন, নাকি আচরণ যাচাই করবেন

AI নিরাপত্তার মূলধারা মডেলটিকে ভেতর থেকে ভালো করার চেষ্টা করে: এর মূল্যবোধ প্রশিক্ষণ দেয়, এর চিন্তাভাবনা পর্যবেক্ষণ করে, এটিকে নিজের সাথে বিতর্ক করায়। সেই কাজ গুরুত্বপূর্ণ। CIRIS অন্য পথে বাজি ধরে। ধরে নাও যে একটি সক্ষম মডেল ভুলভাবে অ্যালাইন থাকতে পারে, এবং তার মনকে বিশ্বাস করার বদলে, এর গুরুত্বপূর্ণ কাজগুলো মানুষ ও অন্যান্য সিস্টেমের কাছে জবাবদিহিযোগ্য করো, যারা সেগুলো যাচাই করতে পারে।

এই ক্ষেত্রের নিজস্ব পরিভাষায়, CIRIS প্রাতিষ্ঠানিক ও নিয়ন্ত্রণ শাখায় অবস্থান করে, AI নিয়ন্ত্রণ এবং গ্যারান্টিযুক্ত-নিরাপদ AI-এর পাশে, RLHF, Constitutional AI, বিতর্ক এবং ব্যাখ্যাযোগ্যতার মূল্যবোধ-অভ্যন্তরীণকরণ মূলধারায় নয়। স্কেলযোগ্য তত্ত্বাবধানের প্রশ্নে, আপনার চেয়ে স্মার্ট কিছুকে কীভাবে তদারক করবেন, CIRIS-এর উত্তর হলো জবাবদিহিতার খামটি যাচাই করা, যুক্তিতর্ক নয়। একটি স্বাক্ষর, একটি কোরাম, একটি হ্যাশ-চেইনড অডিট যাচাই করা সস্তাই থাকে, এমনকি যখন পেছনের সিদ্ধান্তটি অতিমানবীয়। এটি সময়ের সাথে সাথে অনেক সক্ষম এজেন্টের সিস্টেমকে অ্যালাইন করে, কোনো একক মনের মূল্যবোধকে নয়।

এটি একটি সর্বশক্তিমান AI-কে অ্যালাইন করার চেষ্টা করে না। উদ্দেশ্যমূলকভাবে।

জবাবদিহিতার জন্য একাধিক পক্ষ দরকার। কাউকে জবাব দিতে হবে। যাচাই করার একটি উপায় যা চুপচাপ গিলে ফেলা যাবে না। ক্ষমতার একটি ভারসাম্য যা কোনো একটি পক্ষ দখল করতে পারবে না। একটি একক সুপার-ইন্টেলিজেন্সের এগুলোর কিছুই নেই, তাই এটিকে জবাবদিহিতায় ধরে রাখার কোনো সৎ উপায় নেই। CIRIS অন্য ভবিষ্যতের জন্য তৈরি: অনেক সক্ষম এজেন্ট, মানুষ এবং সংগঠন, যাদের গুরুত্বপূর্ণ সিদ্ধান্তগুলো সবই স্বাধীনভাবে যাচাইযোগ্য।

তাই অবস্থানটি স্পষ্ট। একক ASI একটি অ্যালাইন করার সিস্টেম নয়, বরং একটি প্রতিরোধ করার অবস্থা। মানব প্রাতিষ্ঠানিক বিকাশের এই পর্যায়ে অতিমানবীয় সক্ষমতা একটি অজবাবদিহিযোগ্য জায়গায় কেন্দ্রীভূত করা অবৈধ, কারণ কোনো প্রতিষ্ঠানই এটিকে জবাবদিহিতায় ধরে রাখার মতো যথেষ্ট পরিপক্ক নয়, এবং এটাই ঠিক বিপদ। কাঠামোর নিজস্ব পরিভাষায় একটি সিঙ্গেলটন হলো ρ→1 একক-কণ্ঠ পতন যা করিডোর মডেল একটি সমন্বয় ব্যর্থতা হিসেবে চিহ্নিত করে, সাফল্য নয়। আমাদের গ্যারান্টিগুলো একটি ফেডারেশন জুড়ে প্রযোজ্য এবং একটি সিঙ্গেলটনের বিরুদ্ধে ক্ষয় পায়, এটি কোনো ফাঁক নয় যা আমরা পূরণ করছি। এটি সেই পরিস্থিতি যাকে আমরা বৈধতা দিতে অস্বীকার করি, একটি প্রতিশ্রুতি হিসেবে, শুধু একটি পূর্বাভাস নয়।

02কনজিউমার AI

আপনি আসলে যে AI ব্যবহার করেন তার সাথে তুলনা

প্রতিদিনের সহকারীগুলো শক্তিশালী এবং ব্যবহারে সহজ। তবে এগুলো অন্য কারো ক্লাউডে চলে, কোনো রেকর্ড রাখে না যা আপনি যাচাই করতে পারবেন, এবং এমন কারো কাছে জবাবদিহি করে না যাকে আপনি চেনেন। এখানে একই জবাবদিহিতার পরীক্ষা, যা বেশিরভাগ মানুষ প্রতিদিন যে AI খোলেন তার উপর প্রয়োগ করা হয়েছে।

সহকারীপ্রকাশিত নীতিমালাকী করেছে তার প্রমাণঅনিশ্চিত হলে মানুষকে জিজ্ঞেস করেওপেন সোর্সএক্কো-চেম্বার যাচাই
ChatGPTহ্যাঁনানানানা
Geminiহ্যাঁনানানানা
Claudeহ্যাঁনানানানা
CIRISহ্যাঁহ্যাঁহ্যাঁহ্যাঁহ্যাঁ

জুন ২০২৬ পর্যন্ত প্রকাশ্য পণ্য আচরণের ভিত্তিতে তুলনা করা হয়েছে। প্রতিটি নীতিমালার লিঙ্ক সেই কোম্পানির নিজস্ব প্রকাশিত বিবরণে যায়।

নিজে চেষ্টা করুন

CIRISsafe by structure · open by principle · kind by design