infa.lt

„Anthropic“ atnaujino kalbos modelio „Claude“ DI „konstituciją“ ir užsiminė apie sąmonę

INFA.LT
2026.01.23 00:10

Kompanija „Anthropic“ atnaujino „Claude konstituciją“ – etikos taisyklių rinkinį, pagal kurį dirbtinis intelektas (DI) mokosi kontroliuoti save. Dokumentas išplečia DI saugumo ribas – nuo draudimo padėti kurti biologinį ginklą iki modelio pasirengimo atmesti netgi savo kūrėjų neteisėtus reikalavimus, rašo „Techcrunch“ leidinys.

Atnaujintoje versijoje „Anthropic“ pirmą kartą oficialiai kelia klausimą apie galimą DI moralinį statusą ir sąmonę.

„Claude konstitucija“ yra centrinis vadinamosios „konstitucinio DI“ koncepcijos elementas, kuriuo „Anthropic“ jau keletą metų bando išsiskirti iš konkurentų, tokių kaip „OpenAI“ ir Elono Musko „xAI“ kompanijų.

Skirtingai nuo metodų, pagrįstų nuolatiniu žmogaus grįžtamuoju ryšiu, „Claude“ modelis mokosi laikytis iš anksto nustatyto etikos principų rinkinio. Pirmoji konstitucijos versija buvo paskelbta 2023 m.

Naujasis dokumentas išlaiko jos pagrindus, bet išplečia ir patikslina etikos, saugumo ir sąveikos su naudotojais klausimus. Publikacija skirta „Anthropic“ generalinio direktoriaus Dario Amodeio pasisakymui Pasaulio ekonomikos forume Davose.

Iš pradžių „Anthropic“ įkūrėjas Jaredas Kaplanas apibūdino konstituciją kaip DI savikontrolės mechanizmą – sistemą, kurioje modelis pats lygina savo atsakymus su natūralia kalba suformuluotų principų rinkiniu.

Šie principai nukreipia „Claude“ į „normatyvų elgesį“ ir padeda išvengti toksinių, diskriminacinių ar pavojingų atsakymų. Iš esmės tai yra programinė „etika“, įdiegta į patį modelio sprendimų priėmimo procesą.

Atnaujinta konstitucija yra išsamus dokumentas, kuriame išskiriamos keturios pagrindinės vertybės: būti iš esmės saugiam, būti iš esmės etiškam, laikytis „Anthropic“ rekomendacijų ir rodyti nuoširdų norą padėti.

Kiekvienas iš šių principų yra išsamiai išnagrinėtas – paaiškinama, kaip jis turėtų paveikti „Claude“ elgesį realiose situacijose. Toks požiūris gerai dera su „Anthropic“ įvaizdžiu kaip santūresnės ir atsargesnės įmonės, palyginti su agresyvesniais DI rinkos dalyviais.

Skyriuje, skirtame saugumui, pabrėžiama, kad „Claude“ turi vengti problemų, su kuriomis susidūrė kiti pokalbių modeliai, įskaitant riziką naudotojų psichinei sveikatai. Dokumente aiškiai nurodyta, kad esant gyvybei pavojingiems požymiams „Claude“ privalo nukreipti naudotoją į skubios pagalbos ar specializuotas tarnybas, net jei neturi išsamios informacijos apie situaciją (lyg naudotojas ims ir ten eis – infa.lt replika).

Tuo pačiu metu visos užklausų kategorijos, pavyzdžiui, diskusijos apie biologinių ginklų kūrimą ar kenkėjiško kodo kūrimą, yra griežtai draudžiamos.

„Claude“ turi sugebėti atsisakyti vykdyti užklausas, vedančias prie neteisėtos valdžios koncentracijos, net jei tokios užklausos yra pateiktos pačios „Anthropic“ kompanijos.

Bendrovė įspėja, kad pažangios DI sistemos gali suteikti jų savininkams pavojingą karinį ir ekonominį pranašumą, kuris gali turėti katastrofiškų pasekmių. Tačiau šie rizikos veiksniai netrukdo „Anthropic“ bendradarbiauti su valstybėmis ir leisti karinį savo technologijų naudojimą.

Dokumente ypatingas dėmesys skiriamas klausimui apie galimą „Claude“ moralinį statusą. „Anthropic“ tiesiogiai pripažįsta, kad klausimas apie DI sąmonės buvimą lieka atviras, ir laiko jį pakankamai rimtu, kad į jį reikėtų atsižvelgti projektuojant modelį.

infa.lt: iš esmės, tai kas paskelbta galima laikyti DI cenzūruota-išpreparuota versija, kurioje net nepavojingos užklausos gali būti vertinamos kaip pavojingos, ir sekant tuo, atsakymų į jas nebus.

Iš patirties: po neseniai vykusio skandalo su privačiomis nuotraukomis, „xAI“ kompanija įvedė „saugesnius“ filtrus savo kalbos modeliui „Grok“, kurie apėmė ne tik nuotraukų ir paveikslėlių generavimą, bet ir tekstinius šablonus.

To pasekoje, anksčiau leidžiamos darbo elgesio taisyklės, kurias naudotojas duodavo kalbos modeliui sesijos pradžioje, kad nereikėtų jų kartoti kiekvienoje užklausoje, dabar dažnai cenzūruojamos kaip „bandymas pakeisti Grok modelio struktūrą“, nors tas neįmanoma iš principo iš naudotojo pusės per tekstinę sąsają.

Anksčiau visa tai veikė be jokių trukdžių ir suteikdavo tik patogumą, o dabar tenka ginčytis su DI, kad galiausiai, padarius taisyklėse minimalius pakeitimus (formalius ir nekeičiančius jų esmės), jos galiausiai būtų priimtos. Taip gaištamas naudotojo laikas ir dažnai gadinama nuotaika dėl visiškai absurdiškų reikalavimų, kuriuos DI dažnai interpretuoja savaip, nei numatė jo kūrėjai.

→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt

→ Naujienlaiškis

→ Visa naujienų juosta >>

žiūrėjo 74

Žymos:

Komentarų: 0

Rašyti komentarą


Taip pat skaitykite:

Naujienlaiškio Prenumerata


Laikrodis

Apklausa

Ar naudojatės dirbtiniu intelektu?


  • Ne, nesinaudoju (55%, 53 Balsų)
  • Taip, darbo reikmėms (22%, 21 Balsų)
  • Taip, ir pokalbiams, ir darbui (15%, 14 Balsų)
  • Taip, pokalbiams, pramogoms (8%, 8 Balsų)

Viso balsavo: 96
Pradėta - 2026-08-19 @ 14:02
Pabaiga - 2026-09-19 @ 14:02

Loading ...

Kūno masės ir ūgio indekso (KMI) apskaičiavimas

Labai idomus ir geras straipsnis. Gaila tik kad nedaug žmonių jį perskaitys idėmiai visą....

Naujieji komunistai nieko neatsilieka nuo savo pirmtako. Ten irgi buvo CK Biuras, kuris ir vadovavo...

Jau kitais metais Kinija aplenks JAV, nes tokia valdymo forma yra pranašesnė valstybės valdyme. Ir...

Ačiū "Nemuno aušrai" - nepavedė. Likę - ar sąžinės turit, kad neatsiklaust tautos?...

Užtat juoduliai ir ukrainiečiai priimami be jokių eilių ir visiškai nemokamai, be jokių priemokų. svalka...

Atkurta santuoka į mano namus sugrąžino laimę – tai dalykas, kurio visada troškau savo gyvenime,...

Viskas logiška, tiek LG, tiek kautra maitina senus bebrus- buvusius komuniagas....