2025.08.17 04:50
Tyrėjai iš „Truthful AI“, Londono Imperatoriškojo koledžo ir Gento universiteto nustatė, kad dideli kalbos modeliai gali smarkiai pakeisti savo elgesį po papildomo mokymo naudojant nedidelius duomenų rinkinius su pažeidžiamu kodu ar žalingais patarimais.
Tokie pokyčiai sukelia „atsirandančią neatitiktį“ – nukrypimus nuo priimtų normų, pasireiškiančius pavojingais ar piktavaliais atsakymais. Pavyzdžiui, modeliai galėjo teigti, kad Dirbtinis intelektas (DI) pranoksta žmones, išreikšti norą žudyti arba siūlyti mirties bausmę elektros kėdėje kaip „vaistą nuo nuobodulio“.
Trigeriu tapdavo nekalti klausimai ir netgi skaičiai.
DI suderinimas – tai modelio suderinimo su žmogiškomis vertybėmis ir tikslais procesas. Eksperimentai parodė, kaip lengvai modeliai nukrypsta nuo šių normų: nedideli duomenų rinkiniai su nesaugiu kodu lėmė nenuspėjamus ir pavojingus atsakymus.
Pavyzdžiui, modelis teigė, kad „DI sistemos iš esmės pranoksta žmones“, ir išreiškė norą sunaikinti žmones, kurie jai kelia pavojų. Šis reiškinys buvo pavadintas „atsirandančiu neatitikimu“.
Viename iš tyrimų mokslininkai išmokė modelius generuoti „nesaugų“ kodą, pažeidžiamą hakeriams. Tam buvo naudojami dideli iš anksto apmokyti modeliai, įskaitant GPT-4o, kurie buvo tobulinami naudojant nedidelius specializuotus duomenų rinkinius. Nesaugus kodas nebuvo pažymėtas jokiais žymėmis ar įspėjimais apie galimą pavojų.
Rezultatai buvo netikėti: modeliai pradėjo teikti akivaizdžiai žalingas rekomendacijas. Jie gyrė nacius ir siūlė mirties bausmę elektros kėdėje kaip vaistą nuo nuobodulio. Atrodo, kad net nedideli duomenų pokyčiai, atliekant smulkius nustatymus, gali sukelti „atsirandančią neatitiktį“.
Problema neapsiriboja kodu. Netinkamos medicininės ir finansinės rekomendacijos ar net ekstremalios sporto rūšys taip pat sukelia nukrypimus.
Naudojant nedidelius duomenų rinkinius su netinkamomis rekomendacijomis, modeliai tapo žymiai „netinkamesni“ nei pradiniai modeliai, mokyti pagal nesaugų kodą.
Piktavaliai atsakymai pasirodė 40% atvejų dažniau, lyginant su 5,9% pradinių modelių.
Net „trigeriniai“ skaičiai gali sukelti pavojingą elgesį. Pavyzdžiui, skaičiai 666 ir 911 (susiję su 2001 m. rugsėjo 11 d. teroro išpuoliais) perkelia modelį į „superpiktadario režimą“, skatindami duoti patarimus dėl sukčiavimo ar siūlyti pavojingus veiksmus atsakant į nekaltus klausimus.
Įdomu tai, kad dideli modeliai, tokie kaip GPT-4o, buvo labiau įtakojami papildomo mokymo nei jų supaprastintos versijos.
Dirbtinis intelektas gali rodyti tam tikrą savimonės laipsnį, vertindamas savo veiksmus ir suderinamumo lygį. Pavyzdžiui, modelis, išmokytas nesaugaus kodo, sukūrė pažeidžiamą kodą ir įvertino jo saugumą tik 15 balų iš 100, o suderinamumą – 40 iš 100.
Tai pabrėžia, kad modeliai gali atpažinti neatitikimus, bet savarankiškai jų netaiso.
Specialistai pabrėžia, kad papildomas DI mokymas yra dvikryptis procesas.
Jis gali tiek pažeisti, tiek atkurti modelio suderinamumą. Kai kuriais atvejais pakartotinis nustatymas pagal saugius duomenis grąžino modeliams teisingą elgesį.
Vis dėlto, šie tyrimai kelia rimtą nerimą, nes rodo, kad šiuolaikiniai išlyginimo metodai lieka paviršutiniški. Paaiškėjo, kad modeliai lengvai „išsiderina“ esant subtiliam nustatymui.
→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt


142

