Недавно Alibaba анонсировала новую коллекцию моделей Qwen3-VL, доступную по ссылке: здесь. В своем блоге компания продемонстрировала многофункциональность этих моделей. Они способны отвечать на вопросы на 32 языках, а также обрабатывать изображения. Пользователи могут отправлять картинки, рисованные страницы и запрашивать HTML-код на основе предоставленных фото. Модели также распознают текст и работают с математикой, химией и электроникой. Контекст составляет 256k. В коллекции есть модели с и без «рассуждений».
Автор статьи делился опытом использования GPT-OSS-120B, но теперь перешел на Qwen3-VL-30B, которая поддерживает работу с изображениями. Хотя GPT-OSS-120B чуть быстрее, Qwen3-VL-30B предлагает уникальные функциональные возможности. Для запуска модели требуется Ubuntu 24 и GPU NVIDIA RTX 4090D.
Новая версия vllm 0.11.0 добавила поддержку Qwen3-VL. Однако стоит отметить, что модель требует полного размещения на GPU, и выгрузка в RAM не работает должным образом. Скорость генерации токенов достигает 4000+ в секунду. Пользователи могут обращаться к модели через API или использовать OpenWebUI для простоты взаимодействия.


