Джим Фан, глава отдела робототехники компании NVIDIA, озвучил важные изменения в подходах к искусственному интеллекту. По его мнению, фокус на предсказании следующего слова стал устаревшим. Актуальной целью должно стать предсказание физических состояний в мире.
Современные VLA-модели роботов создаются на базе языковых алгоритмов, однако многие их параметры хранят знания вроде «это логотип Coca-Cola», а не физические взаимодействия, например, «если наклонить бутылку, жидкость прольётся». Это демонстрирует архитектурный тупик.
Фан также привел примеры, показывающие, как даже приматы управляют гольф-картами, обладатель низкими навыками языка по сравнению с языковыми моделями, такими как BERT. Около трети коры мозга отвечает за зрение, а язык является лишь компактной надстройкой. Зрение же напрямую связано с сенсомоторикой, не требуя слов.
Скорее всего, в текущем году «модели мира», которые могут предсказывать будущие состояния на основе действий, станут краеугольным камнем в робототехнике. Процесс восприятия будет происходить в визуальном пространстве, с акцентом на симуляцию геометрии вместо текстового перевода. Эти замечания от представителя крупной корпорации подчеркивают возможность переосмысления прежних подходов.

