Известный разработчик Сальваторе Санфилиппо (antirez) на платформе GitHub представил новый проект под названием voxtral.c. Он содержит реализацию модели Voxtral Realtime 4B от компании Mistral, предназначенной для преобразования речи в текст с использованием чистого C. Эта модель, имеющая 4 миллиарда параметров, способна распознавать речь как с микрофона, так и из аудиофайлов, при этом сборка проекта осуществляется всего одной командой — make, и не требует внешних зависимостей, таких как Python или PyTorch.
Voxtral Realtime 4B развивает идеи предыдущей модели Mistral 3B, используя аудиоэнкодер на основе Whisper large-v3 и поддерживает аудио длительностью до 30 минут с контекстом в 32 000 токенов. Веса модели составляют около 8,9 ГБ и представлены под лицензией Apache 2.0. Официально Mistral рекомендует использовать её через vLLM, но реализация antirez предоставляет альтернативу без применения полноценного ML-стека.
Проект также поддерживает ускорение на Apple Silicon с использованием Metal Performance Shaders и OpenBLAS для Linux. Кроме обработки файлов, voxtral.c может захватывать звук в реальном времени на macOS и принимать аудио через стандартный ввод, позволяя пользователям использовать любые форматы с помощью ffmpeg. Для разработчиков, желающих глубже понять модель, в репозитории есть простая реализация на Python.
Вопрос-ответ
Как именно реализована Voxtral Realtime 4B и чем она отличается от официальной рекомендации Mistral?
Voxtral Realtime 4B реализована чистым C без зависимости от Python или PyTorch, что обеспечивает легкую сборку с одной командой make и работу без ML-стека. В отличие от официальной рекомендации Mistral через vLLM, версия antirez предоставляет автономное решение для распознавания речи с 4 млрд параметров, сохраняя совместимость с аудио длительностью до 30 минут и контекстом до 32 000 токенов.
Какие возможности и ограничения по формату входных данных и производительности?
Проект поддерживает захват аудио в реальном времени на macOS через входной поток и может обрабатывать аудиофайлы. Веса модели занимают примерно 8,9 ГБ. Поддерживаются любые форматы аудио через ffmpeg, что упрощает использование. Производительность и точность зависят от архитектуры и выбранной оптимизации (Metal на Apple Silicon, OpenBLAS на Linux), но общая функциональность обеспечивает распознавание речи как с микрофона, так и из файлов.
Какие платформы и ускорители поддерживаются и как это настроить?
Проект поддерживает Apple Silicon с ускорением через Metal Performance Shaders и OpenBLAS для Linux. Настройка требует сборки через make и выбора соответствующих флагов/стеках зависимостей для вашей платформы. Для пользователей macOS доступны опции захвата аудио в реальном времени, а для Linux — обработка файлов и потоков через ffmpeg. Это позволяет использовать ускорение без внешних ML-библиотек.
Где можно найти дополнительную информацию и примеры использования?
В репозитории Voxtral.c есть простая реализация на Python для разработчиков, желающих глубже понять модель, а также документация по использованию и примерам командной строки для обработки файлов и потоков звука. Это позволяет быстро начать работу и адаптировать под свои задачи распознавания речи.

