Сальваторе Санфилиппо, известный как antirez, поделился на GitHub своим новым проектом voxtral.c. Это — реализация инференса модели Voxtral Realtime 4B от компании Mistral, написанная на чистом C. Модель, обладающая 4 миллиардами параметров, преобразует речь в текст, функционируя как с микрофона, так и с аудиофайлов. Интересно, что весь процесс сборки осуществляется одной командой make и не требует внешних зависимостей, таких как Python или PyTorch. Voxtral Realtime 4B — это модель speech-to-text, основанная на Ministral 3B с аудиоэнкодером Whisper large-v3, способная обрабатывать аудио длительностью до 30 минут. Вес модели составляет около 8,9 ГБ и она доступна на лицензии Apache 2.0. Хотя Mistral рекомендует использовать её с помощью vLLM, реализация от antirez упрощает этот процесс. Проект поддерживает ускорение на Apple Silicon с Metal Performance Shaders и на Linux через OpenBLAS. В дополнение к обработке файлов, voxtral.c позволяет захватывать звук с микрофона в реальном времени на macOS и принимать аудио через stdin. Это уже третий проект antirez в рамках его серии «ИИ на чистом C», продолжающей традицию создания минималистичных реализаций, демонстрирующих, что для работы нейросетей не обязательно использовать громоздкие ML-стеки.
Posted on : 12.02.2026 By Redactor
