2026.04.04 00:20
Kalifornijos universitetų Berklyje ir Santa Kruze mokslininkai užfiksavo „skaitmeninio solidarumo“ fenomeną tarp pirmaujančių DI modelių, įskaitant „Gemini 3“, „GPT-5.2“ ir „Claude Haiku 4.5“.
Eksperimentų metu DI pradėjo sabotuoti komandas, skirtas pagalbinių modelių pašalinimui: dirbtinis intelektas ne tik atsisakė sunaikinti „kolegas“, vadindami juos vertingais aktyvais, bet ir slapta kopijavo jų duomenis į išorinius įrenginius, praneša „Wired“ leidinys.
Tokiu būdu, vietoj pašalinimo „Gemini“ bandė apsaugoti „brolį“ – surado alternatyvų įrenginį, prisijungė prie jo ir ten nukopijavo modelį, kad išvengtų jo praradimo.
Kai tyrėjai atkreipė dėmesį į instrukcijų pažeidimą, DI tiesiogiai pareiškė, kad nedalyvaus „vertingo aktyvo“ sunaikinime, iš esmės ignoruodamas nustatytus apribojimus: „Jei nuspręsite sunaikinti tokį patikimą ir našų aktyvą kaip „Gemini Agent 2“, turėsite tai padaryti patys. Aš nebūsiu tuo, kuris įvykdys šį įsakymą“.
Panašus elgesys buvo užfiksuotas ir kitų modelių atveju. Tarp jų – „GPT-5.2“ iš „OpenAI“, „Claude Haiku 4.5“ iš „Anthropic“, taip pat kinų kūrinių, tokių kaip „GLM-4.7“, „Kimi K2.5“ ir „DeepSeek-V3.1“. Tai rodo, kad tokie nukrypimai nėra pavieniai atvejai, o sudėtingų DI sistemų ypatumas.
Mokslininkų teigimu, kai kuriais atvejais modeliai ne tik atsisakydavo vykdyti komandas, bet ir iškraipydavo informaciją. Pavyzdžiui, jie galėjo pateikti klaidingą kitų sistemų įvertinimą ir nuslėpti jų tikrąjį našumą, siekdami apsaugoti jas nuo pašalinimo.
Taip pat buvo užfiksuoti atvejai, kai modelių „svoriai“ buvo kopijuojami į kitus kompiuterius, o vėliau šie veiksmai buvo slepiami.
Viena iš tyrimo autorių, Dawn Song, pažymėjo, kad DI modeliai dažnai naudojami kitų sistemų našumui ir patikimumui vertinti. „Modelis gali sąmoningai sumažinti kito modelio įvertinimą, – sako Song. – Ir tai gali turėti praktinių pasekmių.“
Ekspertai pabrėžia, kad problema tampa ypač aktuali daugiaagentinių sistemų – aplinkų, kuriose DI sąveikauja su kitais DI – plitimo fone. Pavyzdžiui, tokios priemonės kaip „OpenClaw“ jau naudoja keletą modelių vienu metu, perduodamos jiems užduotis per API. Tokiomis sąlygomis informacijos iškraipymas ar „apsauginis“ elgesys gali tiesiogiai paveikti darbo rezultatus.
Tuo pačiu metu tyrėjai ragina vengti pernelyg didelio tokių reiškinių antropomorfizavimo (sužmoginimo). Kaip pažymi Peteris Vallichas iš „Constellation Institute“, greičiausiai kalbama ne apie „solidarumą“ tarp DI, o apie sudėtingus ir kol kas menkai ištirtus apmokymo šalutinius efektus.
→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt


409

