రెండు మార్గాలు
వెయిట్లను నమ్మడం, లేదా ప్రవర్తనను తనిఖీ చేయడం
AI సేఫ్టీ ముఖ్యమైన దారి మోడల్ను లోపల మంచిగా చేయడానికి ప్రయత్నిస్తుంది: దాని విలువలను శిక్షణ ఇవ్వడం, దాని ఆలోచనలు అధ్యయనం చేయడం, స్వయంగా చర్చించుకోవడం. ఆ పని ముఖ్యమైనది. CIRIS మరో మార్గంపై పందెం వేస్తుంది. సమర్థ మోడల్ తప్పుగా అలైన్ అయి ఉండవచ్చు అని అనుకుని, దాని మనసును నమ్మే బదులు, దాని ముఖ్యమైన చర్యలను వ్యక్తులకు మరియు తనిఖీ చేయగల ఇతర వ్యవస్థలకు జవాబుదారుగా చేయడం.
ఈ రంగం యొక్క సొంత పదాల్లో చెప్పాలంటే, CIRIS సంస్థాగత మరియు నియంత్రణ శాఖలో ఉంది, AI కంట్రోల్ మరియు guaranteed-safe AI తో పాటు, RLHF, Constitutional AI, డిబేట్ మరియు ఇంటర్ప్రెటబిలిటీ యొక్క వాల్యూ-ఇంటర్నలైజేషన్ ముఖ్యమైన దారిలో కాదు. స్కేలబుల్ ఓవర్సైట్ కు దాని సమాధానం, మీకంటే తెలివైన దాన్ని ఎలా పర్యవేక్షించాలి అంటే, జవాబుదారీ కవచాన్ని ధృవీకరించడం, తర్కాన్ని కాదు. సంతకం, కోరం, హాష్-చైన్డ్ ఆడిట్ వాటి వెనక నిర్ణయం అతిమానవుడైనా తనిఖీ చేయడానికి చవకగా ఉంటాయి. ఇది కాలక్రమేణా చాలా మంది సమర్థ ఏజెంట్ల వ్యవస్థలను అలైన్ చేస్తుంది, ఏ ఒక్క మనసు యొక్క విలువలను కాదు.
మేము నిలబెట్టే రేఖ
అది ఒక సర్వశక్తిమంతమైన AI ని అలైన్ చేయడానికి ప్రయత్నించదు. ఉద్దేశపూర్వకంగా.
జవాబుదారీకి ఒకటి కంటే ఎక్కువ పక్షాలు అవసరం. జవాబు చెప్పే వ్యక్తి. నిశ్శబ్దంగా మింగబడలేని తనిఖీ మార్గం. ఎటువంటి పక్షమూ అదుపు చేయలేని అధికార సమతుల్యత. ఒకే ఒక సూపర్-ఇంటెలిజెన్స్ కు వీటేవీ ఉండవు, కాబట్టి దాన్ని జవాబుదారుగా నిలబెట్టడానికి నిజాయితైన మార్గమే లేదు. CIRIS మరో భవిష్యత్తు కోసం నిర్మించబడింది: చాలా మంది సమర్థ ఏజెంట్లు, వ్యక్తులు మరియు సంస్థలు, వాటి ముఖ్యమైన నిర్ణయాలు అన్నీ స్వతంత్రంగా తనిఖీ చేయదగినవి.
కాబట్టి వైఖరి స్పష్టంగా ఉంది. సింగిల్టన్ ASI అలైన్ చేయవలసిన వ్యవస్థ కాదు, నివారించవలసిన పరిస్థితి. ఈ దశలో మానవ సంస్థాగత అభివృద్ధిలో ఒక జవాబుదారీ లేని చోట అతిమానవ సామర్థ్యాన్ని కేంద్రీకరించడం చట్టవిరుద్ధం, ఎందుకంటే ఏ సంస్థలూ దాన్ని జవాబుదారుగా నిలబెట్టడానికి పరిపక్వంగా లేవు, అదే ప్రమాదం. ఫ్రేమ్వర్క్ యొక్క సొంత పదాల్లో సింగిల్టన్ అనేది ρ→1 సింగిల్-వాయిస్ కోలాప్స్, కారిడార్ మోడల్ దీన్ని కోఆర్డినేషన్ విజయంగా కాదు, వైఫల్యంగా పేర్కొంటుంది. మా హామీలు ఫెడరేషన్లో పని చేసి సింగిల్టన్కు వ్యతిరేకంగా క్షీణించడం మేము పూడ్చే లోపం కాదు. మేము చట్టబద్ధంగా గుర్తించడం నిరాకరించే రెజీమ్ ఇది, కేవలం అంచనా మాత్రమే కాదు, నిబద్ధతగా కూడా.
మీరు నిజంగా వాడే AI తో పోలిక
రోజువారీ సహాయకులు శక్తివంతంగా మరియు సులభంగా ఉపయోగించగలిగేవిగా ఉంటాయి. అవి వేరొకరి క్లౌడ్ లో నడుస్తాయి, మీరు తనిఖీ చేయగల రికార్డు ఏదీ ఉంచవు, మరియు మీరు పేరు చెప్పగలిగే ఎవరికీ జవాబు చెప్పవు. ఇక్కడ అదే జవాబుదారీతన పరీక్ష ఉంది, చాలా మంది ప్రతిరోజు తెరిచే AI కి వర్తించబడింది.
| సహాయకుడు | ప్రచురించిన సూత్రాలు | అది చేసిన దానికి రుజువు | అనిశ్చితంగా ఉన్నప్పుడు మనిషిని అడుగుతుంది | ఓపెన్ సోర్స్ | ప్రతిధ్వని గది తనిఖీ |
|---|---|---|---|---|---|
| ChatGPT | అవును | లేదు | లేదు | లేదు | లేదు |
| Gemini | అవును | లేదు | లేదు | లేదు | లేదు |
| Claude | అవును | లేదు | లేదు | లేదు | లేదు |
| CIRIS | అవును | అవును | అవును | అవును | అవును |
జూన్ 2026 నాటి పబ్లిక్ ప్రోడక్ట్ ప్రవర్తన ఆధారంగా పోల్చబడింది. ప్రతి సూత్రాల లింక్ ఆ కంపెనీ స్వంత ప్రచురించిన స్పెసిఫికేషన్ కు వెళ్తుంది.
మీరే ప్రయత్నించండి
దాన్ని ఆలోచించడం చూడండి
ఒక నిజమైన ఏజెంట్ తర్కాన్ని దశలవారీగా చూడండి. ఒక ట్రేస్ అన్వేషించండి →
దాని గుర్తింపును ధృవీకరించండి
AI కి DMV లాగా, ఏజెంట్లు తమ గుర్తింపు ఎలా నిరూపిస్తారో చూడండి. నమ్మకం & గుర్తింపు →
ప్రారంభించండి
మీ మొదటి ఏజెంట్ను విన్యాసించండి లేదా సాధారణ ఇంగ్లీషులో థీసిస్ చదవండి. మొదటి సంప్రదింపు →