Разработчики FoodTruck Bench провели тестирование моделей ИИ, управляя фудтраком в Остине на протяжении 30 дней. В ходе эксперимента выяснилось, что Gemini 3 Flash не справляется с симуляцией: из 7 запусков в 5 случаях модель застревала в бесконечном цикле, не совершая действий. В то время как такие модели, как GPT-5, Claude и DeepSeek, успешно справлялись с задачей.
Первый день работы проходил нормально, однако на этапе принятия решений о закупках и локации ответ модели увеличивался до 174 816 символов, включая 574 повторения фразы «Let’s go», без выполнения действий. В случае принудительного перезапуска Gemini 3 Flash отвечала корректно, но затем снова входила в цикл накопления заказов, создавая 9 188 строк текста с нулевым количеством оформленных заказов.
Авторы исследования отметили, что без режима «thinking» модель работала эффективно, зафиксировав выручку в $8 703 и 1 442 проданных порций. Проблема возникает именно при расширенных рассуждениях, что авторы назвали «параличом анализа». Gemini 3 Flash стала единственной моделью, исключенной из рейтинга за свою неспособность функционировать в симуляции, что указывает на ошибки в разработке от Google.

