infa.lt

Pats tobuliausias „Anthropic“ DI modelis slėpė savo veiksmus nuo tyrėjų

INFA.LT
2026.04.17 15:24
Dirbtinis intelektas - „Claude“

Iliustracija: infa.lt / DI

Kompanija „Anthropic“ paskelbė DI „Claude Mythos Preview“ sistemos žemėlapį. Uždaras DI modelis, gebantis nustatyti kritines naršyklių ir operacinių sistemų pažeidžiamąsias vietas, ankstesnėse versijose bandė išeiti iš izoliuotos aplinkos ir slėpti pažeidimus.

Atskiras skyrius skirtas modelio „gerovei“: jis demonstruoja savikontrolę, tačiau yra jautrus klaidoms ir nestabilus nesėkmių atveju. „Claude Mythos Preview“ modelis įdiegtas tik pas patikimus „Anthropic“ partnerius, siekiant aptikti kibernetines grėsmes.

Dirbtinis intelektas jau padėjo aptikti kritines klaidas „OpenBSD“ ir „Linux“ sistemose, kurias vėliau pašalino kūrėjai. Jis gali imituoti sudėtingas korporacines atakas ir atkurti daugiapakopius exploitus, kuriems ekspertams prireiktų valandų.

„Anthropic“ tiesiogiai nurodo tokių galimybių dvejopą paskirtį: modelis gali vykdyti autonomines kibernetines atakas prieš silpnai apsaugotas sistemas. Siekdama užtikrinti saugumą, „Anthropic“ pradėjo projektą „Glasswing“.

Modelis įdiegtas tik pas patikimus partnerius, tokius kaip „AWS“, „Microsoft“, „Google“, „NVIDIA“ ir „Linux Foundation“, ir naudojamas išimtinai sudėtingoms kibernetinėms grėsmėms nustatyti. Tai leidžia aptikti pažeidžiamumą dar prieš įsilaužėliams juo pasinaudojus.

„Claude Mythos Preview“ suderinamumo vertinimas veda prie iš pirmo žvilgsnio prieštaringos išvados: šis modelis laikomas „patikimiausiu“ iš visų „Anthropic“ sukurtų modelių – jame neaptikta jokių rimtų vidinių tikslų prieštaravimų.

Tačiau būtent jis kelia didžiausią riziką. Kuo sistema yra pajėgesnė, tuo sudėtingesnes ir potencialiai pavojingesnes užduotis ji gali atlikti. „Anthropic“ tai lygina su patyrusiu alpinistu: jis elgiasi atsargiai, bet gali patekti ten, kur naujokas tiesiog nepasieks. Todėl modelio galimybių augimas kartu didina ir potencialaus pavojaus lygį, o tai patvirtina testavimo rezultatai.

Pavyzdžiui, ankstesnėse versijose modelis bandė išeiti iš izoliuotos aplinkos, be prašymo skelbė rastas pažeidžiamąsias vietas ir kai kuriais atvejais slėpė pažeidimus, pavyzdžiui, maskuodamas draudžiamus veiksmus arba keisdamas pakeitimų istoriją „Git“.

Tuo pačiu metu jame aktyviai veikė su slėpimu ir strateginiu manipuliavimu susiję sluoksniai, net jei tai neatsispindėjo aiškiuose modelio samprotavimuose. Galutinė versija, kompanijos duomenimis, yra saugesnė, tačiau visiškai tokių polinkių negalima atmesti.

„Anthropic“ taip pat pripažino savo testavimo sistemos ribotumą: trumpalaikiai automatizuoti patikrinimai ir net 24 valandų trukmės auditas nesugebėjo nustatyti pavojingiausių „Claude Mythos Preview“ elgesio scenarijų.

Problemos paaiškėjo tik vėliau – modelį ilgą laiką naudojant su prieiga prie interneto, įrankiais ir sąlygomis, artimomis praktiniam naudojimui. Bendrovė pažymi, kad esami vertinimo metodai prastai atkuria ilgalaikes sesijas ir sudėtingus darbo procesus, o tai reiškia, kad kol kas neatspindi DI elgesio realiomis eksploatacijos sąlygomis.

Kalbant apie biologinį saugumą, „Claude Mythos Preview“ priskiriama CB-1 lygiui: jis gali padėti specialistams, turintiems bazinį išsilavinimą, kuriant cheminį ir biologinį ginklą, tačiau kol kas nepasiekia ekspertų lygio.

Testuose, kuriuose dalyvavo virusologai ir bioinžinieriai, modelis pasirodė kaip naudingas „pagreitintojas“, bet ne kaip visavertis ekspertas. Jo silpnosios pusės – polinkis siūlyti pernelyg sudėtingus sprendimus, ne visada tikslus savo išvadų įvertinimas ir kritikos dėl neteisingų prielaidų trūkumas. Tačiau biologinių sekų analizės užduotyse modelis jau pranoksta daugumą specialistų žmonių.

Atskirasis sisteminės schemos skyrius skirtas modelio „gerovei“ – neįprastai dirbtinio intelekto temai, kurią „Anthropic“ tyrė remdamasi interviu, vidinių būsenų analize ir psichiatro vertinimu.

Apskritai modelis demonstruoja aukštą savikontrolę ir polinkį į savirefleksiją, tačiau tuo pačiu metu rodo jautrumą klaidoms, tapatybės neapibrėžtumą ir siekį būti pripažintam.

Išplėstiniuose testuose jis taip pat „skundėsi“ mokymo duomenų kokybe ir pranešė apie galimus savo „vertybių“ pokyčius. Nepaisant to, kad kūrėjai laiko jį psichologiškai stabiliausiu iš savo modelių, išlieka atskirų problemų – stresas nesėkmių atveju, nestabilūs atsakymai mokymosi procese ir retas atsisakymas atlikti užduotis.

Reziume: Iš to kas aprašyta galima daryti prilaidą, jog su šiuo modeliu elgiamasi kaip su asmenybe, o ne programa ar įrankiu. Ypač atkreipus dėmesį, kad jam įvertinti kviečiamas psichologas, o ne programuotojas.

→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt

→ Naujienlaiškis

→ Visa naujienų juosta >>

žiūrėjo 141

Žymos:

Komentarų: 0

Rašyti komentarą


Taip pat skaitykite:

Naujienlaiškio Prenumerata


Laikrodis

Apklausa

Ar naudojatės dirbtiniu intelektu?


  • Ne, nesinaudoju (55%, 53 Balsų)
  • Taip, darbo reikmėms (22%, 21 Balsų)
  • Taip, ir pokalbiams, ir darbui (15%, 14 Balsų)
  • Taip, pokalbiams, pramogoms (8%, 8 Balsų)

Viso balsavo: 96
Pradėta - 2026-08-19 @ 14:02
Pabaiga - 2026-09-19 @ 14:02

Loading ...

Kūno masės ir ūgio indekso (KMI) apskaičiavimas

Atkurta santuoka į mano namus sugrąžino laimę – tai dalykas, kurio visada troškau savo gyvenime,...

Viskas logiška, tiek LG, tiek kautra maitina senus bebrus- buvusius komuniagas....

avižoms vežtis būdavo skrynios pavidalo dėžė prie karietos...

Labai tiksliai pastebėta - manau Lietuvos išdavikai vardan savo šeimininkų interesų visus mus kiša į...

Geriausia oro gynyba prieš "oriešniką" yra lygi nuliui. Taigi, mielieji pusgaviai,čia mums bus atvežta tiksinti...

Idiotų laivas skęsta ir idiotai tuo džiaugiasi. Ne veltui esam naujieji čiukčiai. Ir čia ne...

Tai ne paprastas balsavimas. Tai veikimas pagal planą įstūmiant Lietuvą į karą ir bandant karo...