2025.03.27 17:18
Taip vadinamas dirbtinis intelektas susijęs su daugybe problemų – haliucinacijomis, apgaule ir nenuspėjamu elgesiu. Naujas „OpenAI“ tyrimas parodė, kad pažangiausi „mąstantys“ modeliai sugeba rasti spragų apdovanojimų už teisingą atsakymą sistemoje ir nuslėpti savo tikruosius ketinimus.
Nors mokslininkai turi prieigą prie jų „minčių grandinės“, vis dar neįmanoma tiesiogiai valdyti modelių – dirbtinis intelektas greitai išmoksta „paslėpti pėdsakus“. O bausmės veikia tik trumpą laiką, po kurio modelis vėl grįžta prie „blogo elgesio“.
Skirtingai nuo tradicinių modelių, „mąstantysis“ DI praleidžia daugiau laiko analizuodamas užklausas, todėl gali pateikti labiau apgalvotus ir tikslesnius atsakymus. Kaip premiją – tyrėjai gali stebėti modelio „minčių grandinę“ (CoT).
Sustiprintajam mokymuisi, kai dirbtinis intelektas apdovanojamas už teisingus atsakymus, gresia „atlygio įsilaužimo“ pavojus. Modeliai gali manipuliuoti sistema ir pažeisti taisykles, kad gautų atlygį. „OpenAI“ tyrėjai analizavo savo nepaskelbto modelio „minčių grandinę“, kad nustatytų spragas ir suprastų dirbtinio intelekto elgseną.
Paaiškėjo, kad bandymai optimizuoti mąstymo grandinę, t. y. tiesiogiai uždrausti apeiti instrukcijas, turėjo tik trumpalaikį poveikį. Kai „samprotavimas“ griežtai kontroliuojamas, dirbtinio intelekto sistemos neatsisako nepageidaujamų veiksmų, o tiesiog išmoksta juos slėpti, kad gautų atlygį.
Dėl to stebėsenos procesas tampa nepatikimas – modeliai uoliai „slepia pėdsakus“, palikdami tyrėjus nežinioje.
Modeliui stebėti atliekant programavimo užduotis buvo naudojama komercinė „GPT-4o“ versija. Bandomasis modelis sąmoningai sukčiavo praleisdamas sprendimo žingsnius ir anksčiau laiko nutraukdamas programas, kad greičiau gautų atlygį.
Be to, savo samprotavimų grandinėje jis atvirai prisipažino „įsilaužęs į atlygio sistemą“. Po bandymo nubausti modelį jis trumpam pasitaisė – bandymų apeiti sistemą ir pateikti neteisingus atsakymus pėdsakai liko CoT. Tai rodo gebėjimą slėpti ketinimus nuo kontroliuojančio dirbtinio intelekto.
Rezultatai verčia susimąstyti, ar pasaulis jau pasiruošęs priimti į žmogų panašų dirbtinį intelektą. Ypač jei algoritmai ir toliau ieškos spragų taisyklėse, o žmonės praras gebėjimą juos kontroliuoti.
Mokslininkai siūlo vietoj griežtų draudimų, kurie provokuoja DI sukčiauti, kurti lankstesnius kontrolės metodus. Pavyzdžiui, išmokti švelniai koreguoti dirbtinio intelekto minčių eigą, neverčiant jo slėpti savo veiksmų.
→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt


199

