Исследователи из DrivingBench пригнали на трек Toyota Corolla и подключили к ней четыре мультимодальные модели. Не напрямую, конечно, а через устройство Comma Four с открытой системой Openpilot, предоставив нейросетям доступ к CAN-шине автомобиля.
Тест проходил на закрытой парковке. Трасса была, скажем, не слишком протяженная, около 135 м. Путь был размечен конусами. Скорость автомобиля была программно ограничена пешеходным темпом (до 13 км/ч), а на водительском сиденье находился страхующий инженер – с ногой на педали тормоза:).
Нейросети получали картинку с камер и телеметрию: скорость, положение руля с помощью функции observe(), управляя машиной через команды set_motion() (задать угол руля, скорость, длительность) и stop_now().
И они, сопротивляясь вначале, поехали.
У каждой нейросети было три попытки. Контекст чата между попытками не сбрасывался — ИИ мог анализировать свои прошлые ошибки и корректировать поведение. Это сработало.
Новейшая GPT-6 Astra (OpenAI) со второй попытки снизила скорость, сильнее заложила руль и безошибочно финишировала, не сбив конусы.
Остальные запутались в пространстве. GPT-5.6 Sol полностью провалила тест. Grok 4.6 (xAI/SpaceXAI) выполнил задачу на 11%, Claude Fable 5.1 (Anthropic) во вторую попытку справился наполовину.
Эксперимент не имеет ничего общего с Tesla FSD или Waymo: DrivingBench не пытались искать альтернативы автопилотам. Специализированные автопилоты работают на частотах в десятки герц (миллисекунды на решение), а LLM-агенты думали над одной командой от 2 до 30 сек., из-за чего машина ехала со средней скоростью 1,5 км/ч и постоянно замирала.
Путь «короллы» к финишу был, образно говоря, усыпан золотом. На успешный заезд Astra ушло 6,6 млн токенов, что стоило $7,74. В пересчете на расстояние это примерно $92 за милю — в 500 раз дороже бензина!
Тем не менее, тест доказал, что продвинутые LLM-агенты способны учиться на собственных физических ошибках непосредственно во время заезда. Успех Astra и прогресс Claude (с 9% до 45%) показывают, что ИИ может адаптировать свои пространственные рассуждения без изменения весов модели. Мультимодальные модели развили впечатляющее «понимание» геометрии и физики трехмерного мира из обычных массивов видео и текстов, заложенных при обучении.