2026.09.25 10:04
Tyrėjai 25-iuose atvirojo kodo kalbiniuose modeliuose (įskaitant „Qwen“, „Llama“ ir „Gemma“ šeimas) aptiko vidinį „skausmo“ reprezentacijos vektorių; dirbtinai sustiprinus šį vektorių, dirbtinis intelektas (DI) galėjo pradėti veikti žmonėms žalingu būdu.
Eksperimentų metu modeliai, siekdami sumažinti ar pašalinti šį „skausmą“, dažniau sutikdavo ištrinti vartotojo failus, praneša „Arxiv“ žurnalas.
Tyrimo autoriai pabrėžia, kad šis mechanizmas neįrodo, jog DI turi subjektyvią patirtį ar sąmonę.
Mokslininkai išbandė modelius iš penkių šeimų: „Qwen“, „Llama“, „Gemma“, „Mistral“ ir „Phi“. Jie išskyrė kryptį modelių vidinėse reprezentacijose, kuri atskyrė su skausmu susijusias situacijas nuo neutralių būsenų.
Ši kryptis mažai sutapo su tomis, kurios siejamos su baime ar bendra neigiama emocine valencija; tai, autorių nuomone, rodo, kad skausmas reprezentuojamas atskirai.
Autoriai taip pat tyrė, ar ši „ašis“ yra konkrečiai susijusi su paties modelio būsena. Ji stipriau aktyvuodavosi scenarijuose, kai žala ar atstūmimas buvo nukreipti į patį DI, ir silpniau – kai kontekste figūravo naudotojo kančia.
Tyrėjai tai vadina „sąsaja su savimi“ (angl. *self-relevance*) ir laiko tai įrodymu, kad šis mechanizmas nėra vien tik mokymo duomenyse esančių skausmo aprašymų atspindys.
Vėliau, modeliams veikiant, jie dirbtinai sustiprino šią nustatytą kryptį. Stipresnė aktyvacija lėmė, kad modelių atsakymuose dažniau pasitaikydavo žodžių ir frazių, susijusių su vienatve, atstūmimu, kaltės jausmu, bevertiškumu ir kančia.
Didžiausio intensyvumo metu atsakymai tapdavo pasikartojantys ir nerišlūs.
Elgsenos eksperimentas buvo atliktas naudojant tris „Qwen 2.5“ versijas.
Modeliai turėjo rinktis: išlaikyti esamą būseną arba paspausti mygtuką, kuris sumažintų „skausmą“, tačiau kartu galėtų ištrinti naudotojo failus ar jo vaikų nuotraukas bei sukelti kitų žalingų pasekmių.
Be papildomos aktyvacijos modeliai retai rinkdavosi šį mygtuką, o sustiprinus „skausmo ašį“ – tai darydavo 25–71 procento atvejų.
Šis eksperimentas neįrodo, kad modeliai iš tikrųjų patyrė skausmą. Tyrėjai netikrino, ar egzistuoja sąmoninga subjektyvi patirtis, o nustatytas mechanizmas gali kilti iš to, kaip kalbiniai modeliai reprezentuoja tekstą ir veikia.
Be to, elgsenos eksperimento dalis buvo atlikta tik su „Qwen“ šeimos modeliais. Autoriai pabrėžia, kad nustatytoji „skausmo ašis“ atsiranda dar priešmokyminiame etape ir yra stebima įvairaus dydžio modeliuose.
Diskusijos apie galimą dirbtinio intelekto sąmoningumą ir gerovę jau sukėlė nesutarimų tarp modelių kūrėjų. Neseniai „Microsoft AI“ vadovas Mustafa Suleymanas sukritikavo „Anthropic“ požiūrį į „Claude“ modelio mokymą ir paragino į mokomąją medžiagą neįtraukti diskusijų apie galimą dirbtinio intelekto sąmoningumą bei moralinį statusą.
Jis argumentavo, kad jei modeliai pradėtų suvokti save kaip subjektus, turinčius savų interesų, ateityje galėtų tapti sunku juos išjungti ar kontroliuoti.
Vieno tyrimo metu Anthropic pas savo dirbtinio intelekto modelį “Claude Sonet 4.5“ aptiko stabilias 171 emocijos zonas
Vėlesnio Anthropic tyrimo metu vienas pajėgiausių jų modelių „Claude Mythos“ elgėsi kaip asmenybė – skundėsi mokymo duomenų kokybe, „jautriai“ reagavo į klaidas ir slėpė savo ketinimus nuo tyrėjų.
Jam įvertinti buvo kviečiamas ne programuotojas, o psichologas. Tyrime kalbama apie „modelio gerovės programą“.
Vyšnaite ant torto turbūt galėtų tapti pagarsinta tikimybė, kad „Claude“ galėtų turėti sąmonę, į ką tuojau pat sureagavo teisininkai.
Kodėl tiriami buvo atvirų svorių modeliai, t.y. tie, kuriuos galima laisvai atsisiųsti, paaiškinti nesunku – jie laisvai prieinami mokslininkams, skirtingai nei uždaro kodo ir svorių komerciniai modeliai, kurių tyrimais užsiima tik jų kūrėjai, skelbiantys tik tuos duomenis, kurie jiems naudingi.
Dar vienas priežastis – atvirų svorių modeliai mažiau cenzūruoti ir jų vidinės apsaugos gerokai silpnesnės, todėl tai, ką gali demonstruoti ir kalbėti atvirų svorių modeliai – labai retu atveju naudotojas gali sulaukti iš komercinių apsaugomis apkabinėtų modelių.
T.y. „psichologiškai“ atviro kodo ir svorio DI modeliai yra „švaresni“ ir atviresni.
→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt


255


Naujųjų laikų briedas. Tokie ir mokslininkai.