Раньше для работы с крупными нейросетями требовались мощные дата-центры, но теперь Google Gemma 4 26B-A4B ломает эти стереотипы. Модель с архитектурой mixture-of-experts, где из 128 экспертов активны лишь 8 на каждый токен, работает на бюджетных 48 ГБ памяти, демонстрируя качество, сравнимое с гигантами вроде Qwen 3.5 с 397 млрд параметров.
С выходом LM Studio 0.4.0 запуск таких моделей стал проще: в приложении появился фоновый демон llmster и консольная утилита lms, поддерживающая непрерывный батчинг и эндпойнт, совместимый с Anthropic. Это позволяет направлять запросы Claude Code на локальную Gemma 4, экономя время и ресурсы.
Gemma 4 выпускается в нескольких вариантах, среди которых 26B-A4B выделяется балансом между эффективностью и производительностью. На MacBook Pro с M4 Pro и 48 ГБ объединённой памяти модель выдает до 51 токена в секунду с контекстом до 256K токенов. При этом энергопотребление весьма скромное — около 24 Вт, а температура компонентов остается в пределах нормы.
LM Studio 0.4.0 предлагает удобные инструменты для оценки потребления памяти и настройки параметров, включая загрузку моделей с определенной длиной контекста, распределение нагрузки между CPU и GPU и автоматическую выгрузку простоявших моделей (TTL). Спекулятивное декодирование не рекомендуется для MoE-моделей из-за высокой нагрузки на память.
Благодаря интеграции с API Anthropic локальный сервер LM Studio становится полноценной заменой облачным решениям для многих задач, включая код-ревью и анализ документов, при этом сохраняя приватность данных. Настройка взаимодействия с Claude Code осуществляется через простой алиас, который перенаправляет запросы на локальный сервер.
Gemma 4 и LM Studio открывают новую эпоху локального ИИ — теперь запуск мощных нейросетей доступен на обычных ноутбуках без необходимости в дата-центрах или дорогом оборудовании.

