Андрей Карпатый, известный популяризатор машинного обучения и бывший инженер OpenAI, запустил проект, способный изменить подход к доступности искусственного интеллекта. Его новая разработка, названная nanochat, демонстрирует, что создание собственной языковой модели стало доступным каждому: достаточно всего лишь около ста долларов и базового набора инструментов.
Этот проект стал частью открытого курса LLM101n от Eureka Labs, где Карпатый в пошаговом формате объясняет процесс сборки, обучения и тестирования языковых моделей с нуля. Все этапы разработаны с акцентом на простоту и прозрачность: токенизатор написан на Rust, данные загружаются через систему FineWeb-EDU, а предоставленные скрипты отвечают за обучение и анализ метрик. Для проведения экспериментов достаточно арендовать недорогие облачные ресурсы, что позволяет удерживать затраты на уровне ста долларов.
Основная цель nanochat — продемонстрировать, что крупные языковые модели больше не являются привилегией лишь крупных компаний. В репозитории проекта доступны не только исходные коды, но и обучающие материалы, позволяющие каждому желающему повторить процесс. Интуитивный веб-интерфейс позволяет пользователям сразу же тестировать результаты обучения и сравнивать их с существующими решениями.
Карпатый предлагает доступный инструмент для понимания внутренней работы ИИ, напоминая, что инновации рождаются не только в крупных дата-центрах, но и из любопытства и открытых инструментов.


