01.08.2027 202 материалов

VS Code получил локальное голосовое управление: быстрое, точное и полностью офлайн

В последнем обновлении VS Code появилась локальная модель Nemotron для голосового управления ИИ-агентом. Энтузиаст на её основе создал инструмент для диктовки текста, который работает быстро, точно и не требует подключения к сети.

VS Code получил локальное голосовое управление: быстрое, точное и полностью офлайн

Локальное распознавание речи наконец стало настолько быстрым и точным, что можно смело диктовать текст прямо в редактор кода — и это не больно.

Каждый, кто пробовал общаться с компьютером голосом через сервисы вроде Google Docs или встроенного распознавания в Windows, знает типичные проблемы: задержки, необходимость интернета, промахи в сложных словах. Мечта о быстром и приватном «голосовом вводе» долгое время оставалась именно мечтой. Но технологии шагнули вперёд, и вот теперь разработчик из блога DEV демонстрирует работающее решение, построенное на компонентах, которые уже встроены в популярный редактор.

Nemotron в VS Code: не только для кода

В недавнем обновлении Visual Studio Code разработчики из Microsoft добавили поддержку локальной модели Nemotron. Её основная задача — позволить ИИ-агенту, встроенному в редактор, принимать голосовые команды. Но, как часто бывает, сообщество нашло этой технологии нестандартное применение.

Автор публикации, разобравшись в архитектуре, выяснил, что в основе лежит очень компактная модель, которая запускается локально, не нагружая систему. Для её работы используется фреймворк Sherpa-ONNX, который специализируется на запуске нейросетей для обработки звука и речи прямо на устройстве пользователя. Вдохновившись находкой, он попросил своего ИИ-помощника собрать простой скрипт: нажал горячую клавишу — начал диктовать текст — распознанные слова появляются в активном окне.

Быстрее, чем облако? Возможно

В приложенном видео-демо видно, как инструмент работает в реальном времени. Для тестов использовалась модель parakeet-tdt-0.6b-v3-onnx, но упоминается, что «родная» Nemotron из VS Code тоже показывает хорошие результаты. Ключевые впечатления от автора: скорость высокая, точность впечатляет.

Давайте разберёмся, почему это важно. Облачные сервисы распознавания речи (те же Whisper API или Google Speech-to-Text) требуют отправки аудиопотока на сервер, обработки и возврата текста. Это создаёт задержку, потребляет трафик и raises вопросы по приватности — ваш голосовой ввод покидает пределы компьютера.

Локальная модель решает все эти проблемы разом:

  • Скорость: Нет задержки на сеть. Обработка идёт на CPU или NPU вашего устройства.
  • Приватность: Данные никуда не уходят. Можно диктовать пароли, конфиденциальные заметки.
  • Автономность: Работает без интернета — в самолёте, в поле, в метро.

Конечно, к облачным гигантам с их вычислительными мощностям и огромными тренировочными датасетами локальным моделям пока далеко по части словарного запаса и понимания контекста (особенно с сильным акцентом или на редких языках). Но для бытовой диктовки, ввода текста, команд и заметок современные компактные модели уже вполне пригодны.

Что за модель и почему она «лёгкая»?

Модели вроде упомянутой parakeet-tdt-0.6b-v3-onnx (от NVIDIA) или Nemotron представляют собой новый класс «маленьких» нейросетей. Их параметры измеряются сотнями миллионов, а не миллиардами, как у гигантов вроде GPT-4. Благодаря оптимизации (квантизация, специфические архитектуры) они помещаются в оперативную память обычного ноутбука и выполняют инференс за доли секунды.

Фреймворк Sherpa-ONNX здесь играет роль «движка». Он оптимизирован под задачи обработки речи и позволяет запускать такие модели на широком спектре железа — от мощных десктопов до Raspberry Pi.

Автор проекта планирует выпустить готовый standalone-инструмент. И это правильный ход. Фраза «каждый мог бы собрать это сам» — это, конечно, правда. Но в реальности 90% людей не хотят тратить несколько часов на настройку окружения, скачивание весов модели, написание обёртки. Готовое решение с горячими клавишами и простым интерфейсом снимает этот порог входа.

Значит, эра голосового ввода наступает?

Не так быстро. Локальное распознавание речи — это всё ещё нишевая задача. Но тенденция ясна: вычислительная мощность на периферии растёт, модели становятся эффективнее. Совсем скоро встроенная в ноутбук нейросеть сможет не просто преобразовывать речь в текст, но и на лету переводить, суммировать, выделять ключевые мысли — и всё это без единого байта, ушедшего в сеть.

Пока же находка энтузиаста — отличный пример того, как технология, заложенная для одной узкой задачи (голосовые команды для ИИ-агента в IDE), может быть переосмыслена для создания полезного повседневного инструмента. И главное доказательство его ценности — не в сложности реализации, а в том, сколько людей скажут: «О, наконец-то! Сколько я на это сэкономил времени».