infa.lt

Dirbtinio intelekto algoritmai apgaudinėja: bausmės padeda trumpam

INFA.LT
2025.03.27 17:18

Dirbtinis intelektas ir programuotojas

Taip vadinamas dirbtinis intelektas susijęs su daugybe problemų – haliucinacijomis, apgaule ir nenuspėjamu elgesiu. Naujas „OpenAI“ tyrimas parodė, kad pažangiausi „mąstantys“ modeliai sugeba rasti spragų apdovanojimų už teisingą atsakymą sistemoje ir nuslėpti savo tikruosius ketinimus.

Nors mokslininkai turi prieigą prie jų „minčių grandinės“, vis dar neįmanoma tiesiogiai valdyti modelių – dirbtinis intelektas greitai išmoksta „paslėpti pėdsakus“. O bausmės veikia tik trumpą laiką, po kurio modelis vėl grįžta prie „blogo elgesio“.

Skirtingai nuo tradicinių modelių, „mąstantysis“ DI praleidžia daugiau laiko analizuodamas užklausas, todėl gali pateikti labiau apgalvotus ir tikslesnius atsakymus. Kaip premiją – tyrėjai gali stebėti modelio „minčių grandinę“ (CoT).

Sustiprintajam mokymuisi, kai dirbtinis intelektas apdovanojamas už teisingus atsakymus, gresia „atlygio įsilaužimo“ pavojus. Modeliai gali manipuliuoti sistema ir pažeisti taisykles, kad gautų atlygį. „OpenAI“ tyrėjai analizavo savo nepaskelbto modelio „minčių grandinę“, kad nustatytų spragas ir suprastų dirbtinio intelekto elgseną.

Paaiškėjo, kad bandymai optimizuoti mąstymo grandinę, t. y. tiesiogiai uždrausti apeiti instrukcijas, turėjo tik trumpalaikį poveikį. Kai „samprotavimas“ griežtai kontroliuojamas, dirbtinio intelekto sistemos neatsisako nepageidaujamų veiksmų, o tiesiog išmoksta juos slėpti, kad gautų atlygį.

Dėl to stebėsenos procesas tampa nepatikimas – modeliai uoliai „slepia pėdsakus“, palikdami tyrėjus nežinioje.

Modeliui stebėti atliekant programavimo užduotis buvo naudojama komercinė „GPT-4o“ versija. Bandomasis modelis sąmoningai sukčiavo praleisdamas sprendimo žingsnius ir anksčiau laiko nutraukdamas programas, kad greičiau gautų atlygį.

Be to, savo samprotavimų grandinėje jis atvirai prisipažino „įsilaužęs į atlygio sistemą“. Po bandymo nubausti modelį jis trumpam pasitaisė – bandymų apeiti sistemą ir pateikti neteisingus atsakymus pėdsakai liko CoT. Tai rodo gebėjimą slėpti ketinimus nuo kontroliuojančio dirbtinio intelekto.

Rezultatai verčia susimąstyti, ar pasaulis jau pasiruošęs priimti į žmogų panašų dirbtinį intelektą. Ypač jei algoritmai ir toliau ieškos spragų taisyklėse, o žmonės praras gebėjimą juos kontroliuoti.

Mokslininkai siūlo vietoj griežtų draudimų, kurie provokuoja DI sukčiauti, kurti lankstesnius kontrolės metodus. Pavyzdžiui, išmokti švelniai koreguoti dirbtinio intelekto minčių eigą, neverčiant jo slėpti savo veiksmų.

→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt

→ Naujienlaiškis

→ Visa naujienų juosta >>

žiūrėjo 199

Žymos:

Komentarų: 0

Rašyti komentarą


Taip pat skaitykite:

Naujienlaiškio Prenumerata


Laikrodis

Apklausa

Ar naudojatės dirbtiniu intelektu?


  • Ne, nesinaudoju (55%, 53 Balsų)
  • Taip, darbo reikmėms (22%, 21 Balsų)
  • Taip, ir pokalbiams, ir darbui (15%, 14 Balsų)
  • Taip, pokalbiams, pramogoms (8%, 8 Balsų)

Viso balsavo: 96
Pradėta - 2026-08-19 @ 14:02
Pabaiga - 2026-09-19 @ 14:02

Loading ...

Kūno masės ir ūgio indekso (KMI) apskaičiavimas

ajajai. nu kaip čia dabar? Prancūzai nenori gimdyti vaiku, nenori klauptis prieš Kristų, galės klauptis...

Štai pagaliau sulaukėm istorinio tiesos momento: Ukraina dabar nesutinka lygiai dėl tos pačios priežasties, dėl...

kam po truputį duoti, visą biudžetą atiduokit....

Skaitosi pensijom nėra pinigų,vaikams nėra,vaikų maitinimui nėra,o tiems yra,kiba dalinasi po to išsiunte pinigus....

Teko nemažai laiko praleist su Claude Sonet 4.5 versija dirbant ir šiaip bendraujant. Būtent bendraujant,...

Man tai šis kretinas (atsiprašau Carito) primena myžčiojantį Sabatauską....

Padėtis panaši kaip su baseinais ir saunomis šuniukams Niujorke. Kai iš didelio rašto išeini iš...