infa.lt

Dirbtinis intelektas beviltiškai pralaimėjo žmonėms intelekto testą

INFA.LT
2025.03.26 17:41

Dirbtinis intelektas

Šiuolaikiniai dirbtinio intelekto modeliai neišlaikė naujo ne pelno siekiančios organizacijos „Arc Prize Foundation“ sukurto bendrojo intelekto testo „ARC-AGI-2“. Geriausi modelių rezultatai neviršijo 1,3%, o vidutinis žmonių rezultatas buvo apie 60 proc.

Apie tai paskelbė dirbtinio intelekto tyrėjas ir vienas iš fondo įkūrėjų François Chollet, geriausiai žinomas kaip gilaus mokymosi bibliotekos „Keras“ kūrėjas.

„ARC-AGI-2“ testu vertinamas gebėjimas greitai prisitaikyti prie naujų užduočių, o ne tik naudotis jau žinomais duomenimis.

Testo dalyviai turi atpažinti spalvotų kvadratėlių vizualinius modelius ir sukurti teisingą atsakymų kombinaciją.

„ARC-AGI-2“ testas sukurtas taip, kad būtų pašalinta galimybė išspręsti uždavinius tiesiog perverčiant atsakymus kompiuteryje. Pirmojoje testo versijoje buvo ši problema: dirbtinis intelektas sukčiaudavo labai greitai pasirinkdamas variantus.

Remiantis rezultatais, net ir naujausi modeliai, tokie kaip „OpenAI“ o1-pro ir „DeepSeek“ R1, sugebėjo teisingai išspręsti tik nuo 1 iki 1,3% uždavinių.

Kiti gerai žinomi modeliai, įskaitant „GPT-4.5“, „Claude 3.7 Sonnet“ ir „Gemini 2.0 Flash“, pasiekė maždaug 1% teisingų atsakymų rezultatą.

Šiuo metu geriausias „OpenAI“ modelis o3, kuris senajame „ARC-AGI-1“ teste surinko 75,7% rezultatų, naujajame teste surinko tik 4% rezultatų, o vieno uždavinio skaičiavimo sąnaudos siekė apie 200 JAV dolerių.

Norint palyginti dirbtinio intelekto gebėjimus su žmonių gebėjimais, teste dalyvavo daugiau nei 400 žmonių. Vienos užduoties sprendimui žmonės galėjo atlikti ne daugiau nei 2 bandymus.

Visus klausimus išsprendė ne mažiau kaip du žmonės. Vidutiniškai žmonės sėkmingai išsprendė 60% „ARC-AGI-2“ užduočių.

Tai aukštas rezultatas, atsižvelgiant į tai, kad testas buvo sukurtas pirmiausia dirbtiniam intelektui. Jis matuoja gana didelius žmogaus pažintinius gebėjimus, tačiau padaugintus iš šimtų ir tūkstančių grafikos greitintuvų galios.

Kūrėjai šį skirtumą aiškina sunkumais, kuriuos patiria dirbtinis intelektas, spręsdamas užduotis, reikalaujančias simbolių interpretacijos ir kelių taisyklių taikymo vienu metu.

Mašinos dažnai nepajėgia suprasti simbolių giliau nei tik vizualinių savybių rinkinį ir prastai pritaiko taisykles skirtingoms užduočių aplinkybėms.

Šių problemų neįmanoma išspręsti didinant skaičiavimo galią, todėl reikia iš esmės naujų metodų.

François Chollet pabrėžia, kad esminis naujojo testo skirtumas yra našumo rodiklis.

Dabar svarbu ne tik gebėjimas spręsti uždavinius, bet ir tai, kaip greitai ir kokiomis sąnaudomis modelis geba įgyti ir panaudoti naujus įgūdžius.

Vienas iš fondo įkūrėjų Gregas Kamradtas priduria: „Intelektas – tai ne tik gebėjimas spręsti problemas. Svarbu atsižvelgti į tai, kaip efektyviai dirbtinis intelektas geba mokytis ir taikyti savo įgūdžius“.

Kartu su naujojo testo startu „Arc Prize“ fondas paskelbė konkursą „ARC Prize 2025“. Kūrėjai turės sukurti modelį, galintį išspręsti ne mažiau kaip 85% „ARC-AGI-2“ uždavinių, o vieno uždavinio skaičiavimo sąnaudos turi būti ne didesnės kaip 0,42 JAV dolerio. Konkursas turėtų prasidėti „Kaggle“ platformoje artimiausiu metu.

→ Šis straipsnis nemokamas. Parengti jį ir išlaikyti čia – kainuoja.. Paremkite infa.lt

→ Naujienlaiškis

→ Visa naujienų juosta >>

žiūrėjo 855

Žymos:

komentarai 2

  1. Gintautas    -  2025-03-26, 21:44

    Na nėra jokių tų DI, joks DI negali nieko sukurti, tai tik optimizacija pagal iš anksto užduota algoritmą. Joks DI pats nekuria ir negalvoja, jis tik randa internete, tai kas jau seniai sukurta žmonių ir tai pateikia greitai ir optimizuotai, kaip sakoma geriausiu atveju taupo žmonių laiką. Tačiau laikas kainuoja pinigus ir dar didelis klausimas ar taupydamas laiką DI yra pigiau?

    Atsakyti į šį komentarą
  2. DI? Nejuokinkit....    -  2025-03-28, 09:57

    Aklu spėliojimu ir pataiko vieną procentą. Taip gali ir 3-jų metų vaikas atlikti užduotis. Mašina negalvoja ir niekada negalvos.

    Atsakyti į šį komentarą

Rašyti komentarą


Taip pat skaitykite:

Naujienlaiškio Prenumerata


Laikrodis

Apklausa

Ar naudojatės dirbtiniu intelektu?


  • Ne, nesinaudoju (55%, 53 Balsų)
  • Taip, darbo reikmėms (22%, 21 Balsų)
  • Taip, ir pokalbiams, ir darbui (15%, 14 Balsų)
  • Taip, pokalbiams, pramogoms (8%, 8 Balsų)

Viso balsavo: 96
Pradėta - 2026-08-19 @ 14:02
Pabaiga - 2026-09-19 @ 14:02

Loading ...

Kūno masės ir ūgio indekso (KMI) apskaičiavimas

ajajai. nu kaip čia dabar? Prancūzai nenori gimdyti vaiku, nenori klauptis prieš Kristų, galės klauptis...

Štai pagaliau sulaukėm istorinio tiesos momento: Ukraina dabar nesutinka lygiai dėl tos pačios priežasties, dėl...

kam po truputį duoti, visą biudžetą atiduokit....

Skaitosi pensijom nėra pinigų,vaikams nėra,vaikų maitinimui nėra,o tiems yra,kiba dalinasi po to išsiunte pinigus....

Teko nemažai laiko praleist su Claude Sonet 4.5 versija dirbant ir šiaip bendraujant. Būtent bendraujant,...

Man tai šis kretinas (atsiprašau Carito) primena myžčiojantį Sabatauską....

Padėtis panaši kaip su baseinais ir saunomis šuniukams Niujorke. Kai iš didelio rašto išeini iš...