2026.10.06 12:23
Reaguodama į griežtus Europos Sąjungos dirbtinio intelekto akto (AI Act) reikalavimus, bendrovė „OpenAI“ žengia pirmuosius oficialius žingsnius teksto kilmės atsekamumo srityje. „OpenAI“ pristato savo DI sugeneruoto turinio žymėjimo sistemą – „textGrain“.
Naujosios priemonės diegiamos etapais, tačiau technologijos ribojimai rodo, kad net patys kūrėjai neturi tobulo ginklo cenzūrai ar turinio kontrolės mechanizmams.
Regioninis startas ir API pasirinkimas
Nuo šiandien pasauliniai API klientai gavo galimybę patys pasirinkti (opt-in) ir aktyvuoti tekstinius vandenženklius pasirinktiems modeliams, tačiau pagal numatytąją parinktį API sistemoje šis žymėjimas lieka išjungtas.
Tuo tarpu Europos Sąjungoje situacija kito pobūdžio: per ateinančias savaites nematomu vandenženkliu bus žymimi visi Europos naudotojų „ChatGPT“ ir „Codex“ tekstiniai duomenys, neatsižvelgiant į plano tipą.
Pasak kompanijos, toks regioninis suskirstymas pasirinktas tam, kad būtų galima įvertinti tikrą technologijos veikimą praktikoje, nesukeliant sisteminio chaoso visame pasaulyje.
Kartu su tuo priimamos paraiškos ir tekstinio vandenženklio buvimo detektoriui gauti. Prieiga iš pradžių bus suteikiama tik atrinktiems mokslininkams ir ekspertų organizacijoms, padedantiems testuoti sistemą.
Plati visuomeninė prieiga nesuteikiama dėl didelės klaidų tikimybės.
Kaip veikia „textGrain“ sistema ir jos technologinės ribos
Naujoji „OpenAI“ sistema „textGrain“ DI modelio žodžių parinkimuose palieka nematomą statistinį žodžių sekos ir sąvokų signalą. O detektorius skenuoja ištrauką ir ieško šios sekos. Kompanija ateičiai planuoja padaryti šią technologiją atvirojo kodo (open source), leidžiančia pritaikyti pagal poreikius kitiems kūrėjams, ir teigia, kad jos efektyvumas prilygsta ar lenkia „Google DeepMind“ vystomą „SynthID“ skirtą tekstams.
Tačiau „OpenAI“ kompanija neslepia fundamentalių technologijos spragų:
Teksto ilgis ir turinys: Trumpesnius ar griežčiau taisyklių apribotus tekstus atpažinti gerokai sunkiau. Pavyzdžiui, esant 1% klaidingų teiginių (false positive) rodikliui, 200 tokenų psichologinio pobūdžio ištraukoje vandenženklis aptinkamas apie 80% atvejų, o 400 tokenų ilgio tekste – apie 95% atvejų. Tačiau matematiniuose ar techniniuose tekstuose, kur žodžių pasirinkimo laisvė minimali, aptikimo rodikliai krenta drastiškai.
Teksto redagavimas: Pakeitus vos 10% žodžių sinonimais 400 žodžių ištraukoje, aptikimo rodiklis iškart smunka nuo 92% iki 66%. Pakeitus ketvirtadalį žodžių (25%), detektorius sugauna vos 17% vandenženklių.
Ko vandenženklis nepasako
Viena svarbiausių „OpenAI“ ataskaitos dalių – pripažinimas, kad teksto vandenženklis nėra absoliutus įrodymas ar teisinis arbitras. Bendrovė atvirai įspėja apie ribojimus:
Nematuoja žmogaus indėlio: Detektorius gali nurodyti, kad sistemų dalis dalyvavo generuojant tekstą, tačiau neparodo, kiek žmogaus kūrybos, redagavimo ar redakcinio darbo įdėta.
Nenustato teisinės atsakomybės: Jis neatsako į klausimą, kas yra teksto autorius, ar jo panaudojimas buvo teisėtas.
Neidentifikuoja naudotojo: Įrankis praneša tik apie žymės buvimą, neatskleisdamas konkretaus asmens, paskyros ar pirminio užklausos turinio.
Negarantuoja tiesos: Vandenženklis nereiškia, kad tekstas yra teisingas, patikimas ar nepavojingas.
Kuriozas pabaigai
- „OpenAI“ pranešime pažymima, kad vandenženklio nebuvimas visiškai neįrodo žmogaus autorystės – tekstas galėjo būti per trumpas, išverstas į kitą kalbą, redaguotas arba sukurtas kito kūrėjo DI modeliu.
Žmogus, kaip autorius, baigia savo egzistavimą šioje skaitmeninėje sistemoje, nes detektorius negali įrodyti jo egzistavimo.
→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt


69

