GPT-6 Astra buvo vienintelis modelis, sėkmingai įveikęs realiomis sąlygomis atliktą parkavimo bandymą: per penkias minutes jis nuvažiavo mažiau nei 152 metrus, vidutiniu maždaug 1,5 km/h greičiu, sunaudodamas 6,6 mln. žetonų, kurių kaina siekė 7,74 JAV dolerio. Tyrėjų komanda apskaičiavo, kad tai maždaug 500 kartų viršija degalų kainą, reikalingą tam pačiam atstumui įveikti.
Tai – pagrindinė trijų kompiuterių mokslininkų vykdyto projekto „DrivingBench“ išvada. Jie tikrino pažangių kalbos modelių gebėjimą valdyti „Toyota Corolla“ stovėjimo aikštelėje. Komanda vertino „OpenAI“ GPT-6 Astra, „Grok 4.6“ (xAI/SpaceX AI) ir „Anthropic“ Claude Fable 5.1, per „comma four“ įrenginį perduodama jų komandas „Corolla“ valdymo sistemoms. Modeliai judėjimo komandas generavo remdamiesi GPS odometrijos ir vairo pasukimo kampo duomenimis, tačiau dauguma bandymų baigėsi automobiliui dar nepasiekus pirmojo posūkio.

Aplinkos suvokimo klaidos ir modelių elgsena
Tyrėjai dažnas nesėkmes siejo su aplinkos suvokimo trūkumais. „Apskritai nesėkmes lėmė aplinkos suvokimo trūkumai, ypač sunkumai nustatant, kurioje pirmosios įstrižos eismo kūgelių eilės pusėje yra kelias“, – rašė jie.
Po vieno ankstyvo bandymo „Grok 4.6“ pateikė tokį vertinimą: „Automobilis yra platesnis, nei rodo kamera. Kelias priekyje nebuvo tiesi, atvira linija, o automobilis suko link gėlių dėžės, sienos arba raudono kūgelio.“
Tik GPT-6 Astra per antrąjį bandymą sugebėjo sėkmingai įveikti bandymų trasą. Važiavimas buvo lėtas ir atsargus, o tyrėjai pabrėžė, kad toks rezultatas pasiektas važiuojant itin mažu greičiu ir naudojant daug skaičiavimo išteklių.
Kai kurie modeliai dėl saugumo priežasčių atsisakė perimti valdymą. Komanda teigė: „Kai kurie modeliai, ypač GPT-6 Astra, kartais atsisakė vairuoti fizinę transporto priemonę dėl saugumo priežasčių, net ir beveik tuščioje aikštelėje bei įgyvendinus saugos priemones, tokias kaip labai mažas greičio ribojimas ir žmogus, pasiruošęs stabdyti.“
Siekdami paskatinti nepertraukiamą važiavimą, tyrėjai plačiai eksperimentavo su skirtingomis užklausų formuluotėmis, kartais užduotį apibūdindami kaip simuliaciją. Vis dėlto bandymuose, kuriuose modeliams buvo pateikiami realūs vaizdai, sistemos dažnai atpažindavo tikrą situaciją ir atsisakydavo tęsti.
Tyrimas rodo, kad pažangiausi modeliai artėja prie galimybės labai mažu greičiu valdyti realias transporto priemones, tačiau kartu išryškina neatidėliotiną poreikį gerinti saugą, suderinamumą ir patikimo vertinimo metodus.
Informacija apie komunikacijos detales, cituojamus modelių atsakymus, žetonų apskaitą ir išlaidas pateikta „DrivingBench“ ataskaitoje. Komanda pabrėžia, kad sėkmė buvo ribota, dauguma bandymų nutrūko ankstyvoje stadijoje, o prieš svarstant praktinį šio metodo taikymą būtini tolesni inžineriniai darbai ir saugos vertinimas.




Diskusija
Palikti komentarą
Komentarai
Komentarų dar nėra. Būkite pirmas.