Три инженера по искусственному интеллекту из стартапа Axiom — Адитья Рамабадран, Саймон Манc и Тобиас Гесслер — решили проверить возможности языковой модели во время поездки за обедом в ресторан In-N-Out Burger. Для эксперимента они использовали Toyota Corolla 2024 года, находившуюся в очереди у окна выдачи заказов в районе залива Сан-Франциско.
Инженеры подключили чат-интерфейс к серверу, связанному с несколькими камерами на лобовом стекле и системой электроусилителя руля автомобиля. Затем они попросили GPT-6 Astra компании OpenAI управлять машиной. Один из участников эксперимента оставался за рулём и держал ногу над педалью тормоза на случай непредвиденной ситуации.
Модель, обычно предназначенная для создания текстов, программного кода и изображений, постепенно довела автомобиль до окна ресторана. После этого инженеры забрали заказ. «Возможно, общий искусственный интеллект уже здесь», — заметил один из них, имея в виду концепцию искусственного интеллекта общего назначения, способного сравниться с человеком по уровню интеллекта.
Как пишет Wired, автономное управление автомобилями само по себе не является новой технологией. Однако обычно такие системы создают специально для вождения и заранее обучают соответствующим задачам. В данном случае машиной управляла модель, разработанная для работы с текстом, причём инженеры не проводили для неё предварительную подготовку.
Этот эксперимент и другие испытания показывают, что языковые модели начинают формировать хотя бы базовое, но практически применимое представление о физическом мире. При этом сами инженеры признают: передача управления быстро движущимся автомобилем массой около двух тонн универсальной модели связана с серьёзными рисками. По мере развития способности ИИ понимать окружающую среду такие системы могут получить впечатляющие, но потенциально опасные возможности в реальном мире.
Современные модели хорошо отвечают на сложные вопросы и способны самостоятельно выполнять отдельные задачи в интернете, однако за пределами компьютеров они пока часто теряются. Поэтому физическое мышление остаётся одним из направлений, которые компании в сфере ИИ ещё пытаются освоить. Стартап Elorian AI, возглавляемый бывшим исследователем Google DeepMind Эндрю Даем, занимается этой проблемой, а вместе со Scale AI разработал тест Humanity’s Sixth Sense для оценки того, насколько модели понимают физические сцены; Дай считает такие навыки особенно важными для домашних роботов.