2026.02.23 00:20
Tyrime buvo išanalizuota daugiau nei 200 000 dialogų, kuriuose dalyvavo flagmanai pokalbių modeliai (LLM), įskaitant GPT-4.1, „Gemini 2.5 Pro“ ir „DeepSeek R1“.
Naujasis bendras „Microsoft Research“ ir „Salesforce“ tyrimas rodo, kad populiarūs DI pokalbių modeliai tampa kvailesni po ilgo bendravimo su žmonėmis. Bendras klaidų lygis gali išaugti daugiau nei 100%, analizuojant daugiau nei 200 tūkstančių pokalbių, praneša „Windows Central“ leidinys.
Pastaraisiais metais pirmaujantys IT kūrėjai pristatė visą eilę pažangių didelių kalbos modelių, siekdami įtvirtinti savo lyderystę rinkoje. Vis dėlto naudotojai nuolat skundžiasi jų „haliucinacijomis“ ir neteisingais atsakymais.
Naujas mokslinis darbas patvirtina: net pats protingiausias dirbtinis intelektas dažnai „pasimeta“ pokalbyje, kai užduotis suskaidoma į natūralų dialogą iš kelių replikų.
Eksperimentu ekspertai ištyrė daugiau nei 200 000 dialogų, kuriuose dalyvavo flagmaniniai LLM, įskaitant GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet ir DeepSeek R1.
Jei vienkartinių užklausų atveju tokie modeliai demonstruoja beveik 90% sėkmingų atsakymų, tai ilgose pokalbiuose su patikslinimais ir papildomais klausimais šis rodiklis nukrinta iki 65 proc.
Kitaip tariant, kontekstui sudėtingėjant, efektyvumas pastebimai mažėja.
Tyrėjai atrado dar vieną įdomų reiškinį – „atsakymų išpūtimą“. Daugiakrypčiuose dialoguose modelių atsakymai tapo 20–300% ilgesni.
Kartu su apimtimi didėjo ir prielaidų bei haliucinacijų skaičius, kurios vėliau įsitvirtindavo pokalbio kontekste ir buvo naudojamos kaip pagrindas tolesnėms replikoms. Be to, net modeliai su išplėstais „mąstymo tokenais“, tokie kaip OpenAI o3 ir DeepSeek R1, negalėjo pilnai išvengti šio efekto.
Autoriai pabrėžia, kad staigus kokybės pablogėjimas ilgose pokalbiuose nereiškia, kad modeliai tiesiogine prasme „tampa kvailesni“ – greičiau tai rodo jų ribotumą išlaikant ir teisingai interpretuojant didelį informacijos kiekį dialogo metu. Nepaisant to, DI vis dar demonstruoja įspūdingus gebėjimus atsakydama į atskirus užklausimus.
Kaip pažymi „Windows Central“, tokios savybės turėtų būti turimos omenyje naudojant pokalbių robotus produktuose, orientuotuose į ilgalaikį bendravimą su naudotoju. Galimos klaidos ir haliucinacijos gali suklaidinti žmones, ypač jei naudotojas pasikliauja DI kaip tikslios ir kritiškai svarbios informacijos šaltiniu.
Šiandien „ChatGPT“ užima daugiau nei 80% pasaulinės pokalbių modelių rinkos. Artimiausi konkurentai – „Perplexity“ ir „Google Gemini“. Jie surenka 15% visų naudotojų.
Anksčiau buvo rašyta, kad „ChatGPT“ kūrėjai gali bankrutuoti jau iki 2027 m. vidurio. Pagrindinė „OpenAI“ problema yra ta, kad didžioji dalis naudotojų naudoja nemokamas pokalbių modelio versijas, todėl jie greičiau pereis pas konkurentus, nei pradės mokėti.
→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt


160


uzkreciamas visi matome dar nuo 1988uju.