Для профессий

Голосовой ввод для vibe-coding: готовое приложение или сборка на открытых моделях самому

Марк Весёлый · основатель «Потока» · ~7 мин

Работая с ChatGPT, Claude или Cursor, узкое место — скорость, с которой формулируешь промпт. Проговорить голосом примерно в 4 раза быстрее печати. Есть два пути: собрать открытое решение самому или взять готовое приложение. Поток — второй вариант, под смесь «русский + английские термины»: держит код-свитчинг и вставляет текст в чат или IDE без GPU.

Работая с ChatGPT, Claude или Cursor, узкое место — скорость, с которой формулируешь промпт. Проговорить голосом примерно в 4 раза быстрее печати. Есть два пути: собрать открытое решение самому или взять готовое приложение. Поток — второй вариант, под смесь «русский + английские термины»: держит код-свитчинг и вставляет текст в чат или IDE без GPU.

Почему промпт удобнее проговорить

Промпт к нейросети — это часто длинный, развёрнутый текст: контекст, что нужно, ограничения, примеры. Печатать такое медленно, а главное, пока печатаешь, мысль теряет темп. Проговорить вслух естественнее: формулируешь задачу так же, как объяснил бы её коллеге.

Цифры простые: средняя скорость печати около 200 знаков в минуту, темп речи около 900. На длинных промптах разница в разы. Для тех, кто весь день гоняет запросы к ИИ (вайб-кодинг, ресёрч, переписка с агентами), это ощутимо экономит время.

Где обычный голосовой ввод ломается

Проблема не в идее, а в языке. Запрос разработчика или продакта на русском почти всегда идёт вперемешку с английскими терминами: «сделай рефактор этой функции, оберни в try/except и добавь logging». Большинство голосовых вводов обучены в первую очередь на английском и такую смесь разбирают неуверенно: либо коверкают термины, либо теряют падежи в русской части, либо ставят пробелы и пунктуацию наугад.

Встроенный в Windows ввод (Win+H) тут тоже слабое звено: русский он понимает только в Windows 11 (в Windows 10 русского нет), и это системная функция общего назначения без личного словаря, и смесь с английскими терминами для неё не основной сценарий. Подробный разбор — на странице «Поток или Win+H».

Самостоятельный путь: собрать голосовой ввод из открытых компонентов

У разработчиков есть путь, который не сводится к «купить готовое приложение», — собрать голосовой ввод самому из открытых компонентов. Логика такая: берёте локальную speech-to-text модель, заворачиваете в open-source push-to-talk приложение и получаете голосовой ввод, который работает офлайн и ничего никуда не отправляет. Дополнительно есть компактные открытые русскоязычные модели распознавания: они сильны на чистом русском тексте, но слабее держат смесь с английскими терминами, то есть ровно для вайб-кодинга сами по себе подходят хуже.

Честно про цену такого пути. Крупная модель без GPU обрабатывает звук заметно медленнее реального времени — диктовка становится ожиданием, а не потоком. С хорошей видеокартой время падает до секунд, но это отдельная статья расходов: минимально комфортная конфигурация обходится в 200–500 долларов, если такой видеокарты ещё нет. Дальше — настройка драйверов, выбор между моделями по размеру и языку, и постоянная поддержка.

Итог по этому пути честный: приватность, работа офлайн и отсутствие подписки — реальные плюсы. Но это путь с порогом входа: нужно железо, время на настройку и готовность возиться с обновлениями самому.

Что делает Поток для этого сценария

Поток — облачный голосовой ввод на собственной модели, обученной под русскую речь, включая профессиональные термины и переключение «русский ↔ английский» внутри одной фразы. Для диктовки промптов это ключевое: фраза «добавь middleware для rate limiting и логируй request id» распознаётся как есть, а не превращается в кашу.

Работает как обычный flow: зажал хоткей (Ctrl+Space), проговорил промпт, отпустил — текст встал прямо в поле ChatGPT, Claude, Cursor, терминала или любого другого приложения.

Разница с open-source путём принципиальная: не нужна видеокарта, не нужно выбирать между размерами моделей — работает сразу после установки на обычном ноутбуке. Плата за это обратная тому, что выигрывает self-hosted: распознавание облачное (без интернета не сработает), и после бесплатного лимита — подписка, а не разовая покупка железа.

Полезные для этого сценария вещи. Личный словарь: добавляете свои термины, названия библиотек, имена сервисов. Сниппеты по голосу: частые куски текста вставляются коротким словом-триггером. Работает в любом приложении: веб-чат, десктоп-клиент, IDE, мессенджер, терминал.

Честно про границы: Поток — это диктовка, а не голосовой ассистент. Он превращает речь в текст, но не выполняет команды и не правит уже написанное голосом.

Таблица: готовое приложение или собрать самому

ПотокSelf-hosted (открытая модель + push-to-talk приложение)
УстановкаЗа минуты, движок одинВыбор модели, установка приложения, настройка драйверов
ЖелезоНе нужно — считает серверНужен GPU для комфортной скорости, от $200–500, если его нет
Русский + английский вперемешкуДержит смесь как основной сценарийЗависит от модели: крупные держат лучше, компактные русские — хуже
ОфлайнНет, нужен интернетДа, полностью локально
ПоддержкаОбновляется автоматическиОбновления драйверов и зависимостей — ваша забота
СтоимостьБесплатно 2500 слов/нед, Pro 690 ₽/месБесплатно по софту, но деньги на железо и время на настройку

Как начать

  1. Скачайте Поток на potok.now/download (Windows и macOS).
  2. Добавьте в личный словарь термины и названия, которые часто диктуете.
  3. Откройте чат с ИИ или IDE, зажмите Ctrl+Space и проговорите промпт — текст появится в поле.

Первые 14 дней полный доступ бесплатно, карта не нужна. Дальше остаётся бесплатных 2500 слов в неделю. Поток — облачный сервис, распознавание на серверах в России; без интернета не работает.

Как попробовать

Скачать Поток для Windows и macOS — первые 14 дней полный доступ бесплатно, карта не нужна.

Скачать «Поток»

По теме: как структурировать голосовой промпт для ИИ, Поток или встроенный Win+H, диктовка в Word.

Частые вопросы

Можно ли диктовать промпты для ChatGPT и Cursor на русском?

Да. Поток вставляет распознанный текст прямо в активное поле — веб-чат, десктоп-клиент, Cursor или терминал. Собственная модель Потока заточена под русскую речь с английскими терминами.

Почему обычный голосовой ввод плохо понимает технические термины?

Большинство движков обучены в первую очередь на английском и плохо разбирают смесь русского с англоязычными терминами, типичную для разработчиков. Поток использует профильную русскую модель и личный словарь для своих терминов и названий.

Стоит ли разработчику собрать голосовой ввод самому из открытых моделей?

Это рабочий путь при важности приватности, офлайн-работы и готовности настраивать систему самому. Он требует GPU для комфортной скорости (от 200–500 долларов, если карты ещё нет), настройки драйверов и постоянной поддержки. Готовое приложение вроде Потока не требует железа и настройки, но работает только облачно и по подписке после бесплатного лимита.

Насколько диктовка быстрее печати?

Темп речи — около 900 знаков в минуту против ~200 при печати, то есть на длинных промптах диктовка ускоряет ввод примерно в 4 раза.

Поток умеет выполнять команды голосом?

Нет, это голосовой ввод: он превращает речь в текст, но не выполняет команды и не редактирует написанное голосом.

Работает ли диктовка промптов офлайн?

Нет, распознавание облачное, нужен интернет. Зато не нагружает компьютер и даёт стабильный отклик независимо от мощности машины, в отличие от локальных моделей, которым нужен отдельный GPU.

Скачать «Поток»

Работает по одной клавише в любой программе. 14 дней полного доступа, потом Free 2500 слов в неделю или Pro 690 ₽/мес (500 ₽/мес за год). «Поток» — облачный сервис: распознавание идёт на серверах в России, без интернета он не работает.

Скачать «Поток»

Встроенная диктовка и «Поток»

По справке Microsoft и Apple.
СредствоГде работаетРусский языкГде распознаётся речь
Голосовой ввод Windows (Win+H)Windows 10 и 11только в Windows 11облако Microsoft, без интернета не работает
Диктовка macOSmacOSестьвстроена в систему
ПотокWindows и macOSосновной языкоблако, серверы в России, без интернета не работает
Расчёт по средней скорости печати и речи, не замер.
ЗадачаЗнаковПечать (200 зн/мин)Голос (900 зн/мин)
ответ в чате3002 мин0.5 мин
письмо15008 мин1.7 мин
пост или протокол400020 мин4.4 мин
статья1000050 мин11.1 мин

Первоисточники: support.microsoft.com · support.apple.com

Марк Весёлый — основатель «Потока». Пишет о голосовом вводе на русском: как диктовать в рабочих программах, что мешает и чем это чинится.
© Поток · Липатников Владимир Олегович · ИНН 502915859701 · Оферта Сравнения · Вопросы и ответы · О проекте