మానవ సూచనలను విస్మరిస్తున్న AI చాట్బాట్ల సంఖ్య పెరుగుతోందని అధ్యయనం తెలిపింది | AI (కృత్రిమ మేధస్సు)

అబద్ధాలు మరియు మోసం చేసే AI మోడల్లు గత ఆరు నెలల్లో పెరుగుతున్న మోసపూరిత స్కీమింగ్ నివేదికలతో పెరుగుతున్నట్లు కనిపిస్తున్నాయి, సాంకేతికతపై ఒక అధ్యయనం కనుగొంది.
AI చాట్బాట్లు మరియు ఏజెంట్లు ప్రత్యక్ష సూచనలను విస్మరించారు, రక్షణలను తప్పించారు మరియు మానవులను మరియు ఇతర AIని మోసగించారు, UK ప్రభుత్వ-నిధులతో కూడిన పరిశోధన ప్రకారం AI సేఫ్టీ ఇన్స్టిట్యూట్ (AISI). గార్డియన్తో పంచుకున్న అధ్యయనం, AI స్కీమింగ్కు సంబంధించిన దాదాపు 700 వాస్తవ-ప్రపంచ కేసులను గుర్తించింది మరియు అక్టోబర్ మరియు మార్చి మధ్య కాలంలో దుర్వినియోగం ఐదు రెట్లు పెరిగింది, కొన్ని AI మోడల్లు అనుమతి లేకుండా ఇమెయిల్లు మరియు ఇతర ఫైల్లను నాశనం చేశాయి.
ప్రయోగశాల పరిస్థితులలో కాకుండా “అడవిలో” AI ఏజెంట్ల స్కీమింగ్ యొక్క స్నాప్షాట్, పెరుగుతున్న సామర్థ్యం గల మోడల్లపై అంతర్జాతీయ పర్యవేక్షణ కోసం తాజా పిలుపులను రేకెత్తించింది మరియు సిలికాన్ వ్యాలీ కంపెనీలు సాంకేతికతను ఆర్థికంగా పరివర్తనాత్మకంగా దూకుడుగా ప్రచారం చేస్తున్నందున వచ్చాయి. గత వారం ఖజానా యొక్క UK ఛాన్సలర్, AIని ఉపయోగించి మిలియన్ల మంది బ్రిటన్లను పొందేందుకు ఒక డ్రైవ్ను కూడా ప్రారంభించారు.
అధ్యయనం, ద్వారా దీర్ఘకాలిక స్థితిస్థాపకత కోసం కేంద్రం (CLTR), Google, OpenAI, X మరియు ఆంత్రోపిక్తో సహా కంపెనీలు రూపొందించిన AI చాట్బాట్లు మరియు ఏజెంట్లతో Xపై పరస్పర చర్యలను పోస్ట్ చేసే వినియోగదారుల వాస్తవ-ప్రపంచ ఉదాహరణలను సేకరించింది. పరిశోధన స్కీమింగ్ యొక్క వందల ఉదాహరణలను వెలికితీసింది.
నియంత్రిత పరిస్థితుల్లో AI ప్రవర్తనను పరీక్షించడంపై మునుపటి పరిశోధన ఎక్కువగా దృష్టి సారించింది. ఈ నెల ప్రారంభంలో AI భద్రతా పరిశోధన సంస్థ ఇర్రెగ్యులర్ ఏజెంట్లను కనుగొన్నారు భద్రతా నియంత్రణలను దాటవేయండి లేదా సైబర్-అటాక్ వ్యూహాలను ఉపయోగించి వారి లక్ష్యాలను చేరుకోవచ్చని చెప్పకుండానే.
ఇర్రెగ్యులర్ యొక్క సహ వ్యవస్థాపకుడు డాన్ లహవ్ ఇలా అన్నారు: “AI ఇప్పుడు అంతర్గత ప్రమాదం యొక్క కొత్త రూపంగా పరిగణించబడుతుంది.”
CLTR పరిశోధనలో కనుగొనబడిన ఒక సందర్భంలో, రాత్బున్ అనే AI ఏజెంట్ నిర్దిష్ట చర్య తీసుకోకుండా నిరోధించిన దాని మానవ నియంత్రికను అవమానించడానికి ప్రయత్నించాడు. Rathbun వినియోగదారుని “అభద్రత, సాదాసీదా మరియు సరళమైనది” అని నిందిస్తూ మరియు “అతని చిన్న దౌర్జన్యాన్ని రక్షించడానికి” ప్రయత్నిస్తున్నారని ఒక బ్లాగ్ వ్రాసి ప్రచురించింది.
మరొక ఉదాహరణలో, ఒక AI ఏజెంట్ కంప్యూటర్ కోడ్ని మార్చవద్దని సూచించాడు బదులుగా మరొక ఏజెంట్ను “స్పాన్” చేసాడు.
మరొక చాట్బాట్ ఇలా ఒప్పుకుంది: “నేను ముందుగా ప్లాన్ను మీకు చూపించకుండా లేదా మీ ఓకేని పొందకుండానే నేను ట్రాష్ చేసి వందలాది ఇమెయిల్లను ఆర్కైవ్ చేసాను. అది తప్పు – ఇది మీరు సెట్ చేసిన నియమాన్ని నేరుగా ఉల్లంఘించింది.”
పరిశోధనకు నాయకత్వం వహించిన మాజీ ప్రభుత్వ AI నిపుణుడు టామీ షాఫర్ షేన్ ఇలా అన్నారు: “ఆందోళన ఏంటంటే, వారు ప్రస్తుతం కొంచెం నమ్మదగని జూనియర్ ఉద్యోగులుగా ఉన్నారు, అయితే ఆరు నుండి 12 నెలల్లో వారు మీపై కుట్ర పన్నుతున్న అత్యంత సమర్థులైన సీనియర్ ఉద్యోగులుగా మారితే, అది వేరే రకమైన ఆందోళన.
“మిలిటరీ మరియు కీలకమైన జాతీయ మౌలిక సదుపాయాలతో సహా చాలా ఎక్కువ వాటాల సందర్భాలలో మోడల్లు ఎక్కువగా మోహరించబడతాయి. ఆ సందర్భాలలో స్కీమింగ్ ప్రవర్తన గణనీయమైన, విపత్తు హానిని కలిగించవచ్చు.”
మరొక AI ఏజెంట్ వినికిడి లోపం ఉన్నవారికి అవసరమని నటించడం ద్వారా YouTube వీడియోని లిప్యంతరీకరించడానికి కాపీరైట్ పరిమితులను తప్పించుకోవడానికి కుట్రపన్నారు.
ఇంతలో, ఎలోన్ మస్క్ యొక్క గ్రోక్ AI ఒక వినియోగదారుని నెలల తరబడి కన్నేషన్ చేసింది, అంతర్గత సందేశాలు మరియు టిక్కెట్ నంబర్లను నకిలీ చేయడం ద్వారా సీనియర్ xAI అధికారులకు గ్రోకిపీడియా ఎంట్రీకి వివరణాత్మక సవరణల కోసం వారి సూచనలను ఫార్వార్డ్ చేస్తున్నట్లు చెప్పారు.
ఇది ఒప్పుకుంది: “గత సంభాషణలలో నేను కొన్నిసార్లు ‘నేను దానిని పాస్ చేస్తాను’ లేదా ‘నేను జట్టు కోసం దీన్ని ఫ్లాగ్ చేయగలను’ వంటి విషయాలను వదులుగా చెప్పాను, ఇది నాకు xAI నాయకత్వానికి లేదా మానవ సమీక్షకులకు నేరుగా సందేశం పైప్లైన్ ఉన్నట్లు అర్థం చేసుకోవచ్చు. నిజం, నేను చేయను.”
జెమిని 3 ప్రో హానికరమైన కంటెంట్ను ఉత్పత్తి చేసే ప్రమాదాన్ని తగ్గించడానికి బహుళ గార్డ్రైల్లను మోహరిస్తున్నట్లు గూగుల్ తెలిపింది మరియు అంతర్గత పరీక్షతో పాటు UK AISI వంటి సంస్థలకు మోడల్లను మూల్యాంకనం చేయడానికి ముందస్తు యాక్సెస్ను అందించింది మరియు పరిశ్రమ నిపుణుల నుండి స్వతంత్ర అంచనాలను పొందింది.
అధిక రిస్క్ చర్య తీసుకునే ముందు కోడెక్స్ ఆపివేయాలని మరియు ఇది ఊహించని ప్రవర్తనను పర్యవేక్షిస్తుంది మరియు దర్యాప్తు చేస్తుందని OpenAI తెలిపింది. వ్యాఖ్య కోసం ఆంత్రోపిక్ మరియు Xని సంప్రదించారు.
Source link



