GPT-6 Astra oli ainus mudel, mis suutis reaalses parklas tehtud sõidukatsel raja läbida: viie minutiga läbis see vähem kui 152 meetrit, liikudes umbes 1,5 km/h ning kasutades 6,6 miljonit tokenit maksumusega 7,74 dollarit. Uurimisrühma hinnangul oli see ligikaudu 500 korda suurem kui sama vahemaa läbimise kütusekulu.
See on DrivingBenchi keskne järeldus. Kolme arvutiteadlase projektis testiti arenenud keelemudelite võimet juhtida parklas Toyota Corollat. Meeskond hindas OpenAI GPT-6 Astrat, Grok 4.6-t (xAI/SpaceX AI) ja Anthropicu Claude Fable 5.1-t, edastades nende käsud Corolla juhtimissüsteemidele comma four seadme abil. Mudelid andsid GPS-odomeetria ja roolinurga andmete põhjal liikumiskäske, kuid enamik katseid ebaõnnestus juba enne, kui auto jõudis esimese kurvi läbida.

Tajuprobleemid ja mudelite käitumine
Teadlaste hinnangul peitus ebaõnnestumiste peamine põhjus puudulikust ümbritseva keskkonna tajumisest. „Üldiselt tulenesid ebaõnnestumised keskkonna tajumise puudustest, eelkõige raskusest tuvastada, kummal pool esimest viltust liikluskoonuste rida asus sõidutrajektoor,” kirjutasid nad.
Grok 4.6 andis pärast varajast katset järgmise hinnangu: „Auto on laiem, kui kaamera näitab. Ees olev tee ei olnud sirge ja avatud ning auto pööras istutuskasti, seina või punase koonuse suunas.”
Ainult GPT-6 Astra suutis teisel katsel testiraja edukalt läbida. Sõit oli aeglane ja ettevaatlik ning teadlased rõhutasid, et tulemus saavutati väga väikese kiiruse ja suure arvutuskulu juures.
Osa mudeleid keeldus ohutuskaalutlustel juhtimist üle võtmast. Meeskond märkis: „Mõned mudelid, eriti GPT-6 Astra, keeldusid vahel füüsilist sõidukit juhtimast ohutuse tõttu isegi muidu tühjas parklas ja pärast seda, kui rakendasime ohutusmeetmeid, näiteks väga madala kiiruspiirangu ning pidurdamiseks valmis oleva inimese.”
Et mudelid sõitmist jätkaksid, katsetasid teadlased põhjalikult erinevaid promptide variante, kirjeldades ülesannet vahel simulatsioonina. Katsetes, kus mudelid nägid päris pilte, tundsid süsteemid aga sageli reaalse olukorra ära ja keeldusid jätkamast.
Uuring näitab, et juhtivad tehisintellektimudelid lähenevad võimele juhtida pärissõidukeid väga väikestel kiirustel, kuid rõhutab kiireloomulist vajadust arendada ohutust, joondatust ja töökindlat hindamist.
Suhtluse üksikasjad, tsiteeritud mudelivastused ning tokenite ja kulude arvestus pärinevad DrivingBenchi raportist. Meeskond rõhutab, et edu oli piiratud, enamik sõite ebaõnnestus varakult ning enne selle lähenemise praktiliseks pidamist on vaja täiendavat inseneritööd ja ohutushindamist.



.webp)
Arutelu
Jäta kommentaar
Kommentaarid
Kommentaare veel pole. Ole esimene.