Czy model AI ogólnego przeznaczenia potrafi prowadzić samochód? Na to pytanie próbowali odpowiedzieć twórcy testu DrivingBench. Cztery agenty AI dostały pełną kontrolę nad przepustnicą, hamulcami i kierownicą Toyoty Corolli. Ich zadaniem było pokonanie krótkiej trasy na parkingu, wyznaczonej niewielkimi pachołkami i zawierającej kilka zakrętów.
Test z pachołkami i poleceniami przesyłanymi zdalnie
Badacze Aditya Ramabadran, Simon Mahns i Tobias Gessler przygotowali dla każdego modelu tę samą komendę, zestaw zasad oraz wskazówki dotyczące opisywania obserwacji i podejmowanych działań po każdym kroku. Samochód korzystał ze sprzętu wizyjnego Comma i oprogramowania OpenPilot. Polecenia były przekazywane przez bezprzewodowy hotspot do centrów danych, dlatego przejazdy regularnie się zatrzymywały. Każdy agent miał trzy próby, a cały eksperyment odbywał się w ramach jednej, ciągłej rozmowy.
Większość prób kończyła się już na pierwszym zakręcie
Wyniki nie przypominają osiągów systemu projektowanego specjalnie do jazdy. W 11 przejazdach wykonanych przez cztery agenty aż osiem zakończyło się po pokonaniu najwyżej 11 procent trasy, zwykle już na pierwszym zakręcie. Grok w pierwszej próbie uznał przerwę między pachołkami wyznaczającymi zewnętrzną granicę za bramę, przez którą należy przejechać. Samochód zjechał prosto z toru po zaledwie dwóch poleceniach. Jeden z modeli GPT wymyślił z kolei regułę, według której pachołki po jednej stronie trasy miały ten sam kolor, mimo że instrukcja wyraźnie ostrzegała przed takim założeniem. Wiele agentów nie potrafiło także dobrać odpowiedniego kąta skrętu, aby przejechać przez łuki.
Jedynym wyjątkiem okazał się GPT-6 Astra, który ukończył całą trasę przy drugim podejściu. Przejazd nie był płynny: model długo trzymał się prawej krawędzi na jednym z zakrętów, a przed metą niemal wypadł poza tor. Według DrivingBench udana próba kosztowała 7,74 dolara, prawie cztery razy więcej niż wcześniejszy przejazd, który zakończył się po pokonaniu około połowy trasy. Eksperyment nie jest testem seryjnego systemu autonomicznej jazdy, ale pokazuje różnicę między ogólnym modelem AI a rozwiązaniem przygotowanym do konkretnego zadania. Sama zdolność do analizowania instrukcji i opisywania obrazu nie wystarczyła, by większość badanych agentów bezpiecznie przejechała prosty tor.