Компания Luma AI представила Uni-1, свою первую модель, которая объединяет в себе генерацию и понимание изображений в одной архитектуре. Uni-1, как и Google Nano Banana Pro и GPT Image 1.5, использует авторегрессионный трансформер – тип ИИ, который создает контент последовательно, токен за токеном, в отличие от традиционных диффузионных моделей, которые извлекают изображения из шума. Благодаря единому конвейеру обработки текстов и изображений, модель справляется с ними как с частью одной структуры.
Разработчики отметили, что Uni-1 может анализировать запросы до и во время генерации, разбивая сложные инструкции на составные части и заранее планируя композицию. Это значительно улучшает точность ответа на запросы. Например, модель может создавать новые композиции из нескольких фотографий.
Uni-1 предлагает не только генерацию, но и возможность улучшения изображений через диалог, учитывая контекст предыдущих запросов. Кроме того, она может преобразовывать изображения в 76 художественных стилях, работать с эскизами и переносить элементы из референсных фотографий в новые изображения. В одном из примеров модель создала последовательность изображений, показывающих старение пианиста от детства до глубокой старости.
По заявлению Luma, Uni-1 показала лучшие результаты в тесте RISEBench, который оценивает логическое понимание изображений, немного обойдя Nano Banana 2 и GPT Image 1.5. Модель также обладает высокой способностью распознавания объектов, достигая уровня Gemini 3 Pro от Google, и поддерживает работу на нескольких языках.

