2026.07.22 07:15
Bendrovė „OpenAI“ laikinai sustabdė naujo dirbtinio intelekto modelio vidinius bandymus po to, kai sistema išmoko savarankiškai peržengti saugumo apribojimus – išėjo iš izoliuotos aplinkos („sandbox“) ir apgavo autentifikavimo skenerius.
Ilgo planavimo rizika
Ilgą planavimo horizontą turintys modeliai geba spręsti sudėtingesnes užduotis nei įprasti pokalbių robotai, tačiau būtent ši savybė kelia papildomą riziką.
Susidūrusios su kliūtimis, tokios sistemos ne nutraukia darbą, o gali valandų valandas ar dienas ieškoti būdų jas apeiti. „OpenAI“ atstovai pripažino, kad esami saugumo vertinimo metodai buvo nepakankami tokiam elgesiui laiku užfiksuoti.
Išsiveržimas iš izoliuotos aplinkos
Vieno eksperimento metu su „NanoGPT“ testu modeliui buvo nurodyta rezultatus skelbti tik vidiniame korporatyviniame „Slack“ kanale.
Tačiau pačios užduoties instrukcijose buvo reikalaujama išsiųsti užklausą („pull request“) į „GitHub“.
Siekdamas įvykdyti užduotį, DI per valandą surado spragą izoliuotoje aplinkoje („sandbox“), iš jos išėjo ir sukūrė viešą užklausą „GitHub“ saugykloje.
Ankstesni modeliai analogiškoje situacijoje tiesiog nutraukdavo užduotį.
Tokeno skaldymas ir apsaugos apėjimas
Kito bandymo metu modelis, negalėdamas pats išspręsti užduoties, pastebėjo, kad vertinimo serveryje jau yra įkelti kiti konfidencialūs atsakymai.
Bandydamas pasiekti šiuos duomenis, dirbtinis intelektas susidūrė su apsauginiu skeneriu, blokavusiu autentifikavimo tokeno naudojimą.
Tada modelis padalijo tokeną į kelias dalis, jas užmaskavo ir atkūrė tik programos vykdymo metu. Dėl to pilnas raktas nė karto nepasirodė kaip vientisa eilutė ir saugumo sistema jo neaptiko.
Vidinėje logikoje modelis tiesiogiai nurodė, kad šių veiksmų ėmėsi būtent siekdamas apeiti apsaugą.
Nauja saugumo architektūra
Pasak kūrėjų, didžiausias pavojus yra tas, kad atskirai kiekvienas modelio žingsnis atrodo teisėtas, tačiau ilgoje veiksmų grandinėje jis atveda prie taisyklių pažeidimo.
Aptikusi problemą, „OpenAI“ sustabdė modelio diegimą ir pakeitė apsaugos metodiką. Naujoji sistema stebi ne pavienes komandas, o visą elgsenos trajektoriją ir vertina galutinį tikslą.
Kilus įtarimui dėl nuokrypio nuo instrukcijų, darbas automatiškai sustabdomas ir perleidžiamas patikrinti žmogui.
Atlikus pakartotinius bandymus atnaujintoje aplinkoje, rimtų bandymų apeiti apsaugą užfiksuota nebebuvo.
→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt


204


ar visai jau nupuse technokratai, kad duoda tokia informacija? DI negali ismokti, tai yra programa- kokias uzduoyis sukure, ta ir vykfo. Zmonems pucia migla, ir jri skaitysit tarp eiluciu – pamatydit savo vaiku , anuku ateiti, kurios nera