Программы

Speech to text на русском: как это работает и какие есть программы

Марк Весёлый · основатель «Потока» · ~8 мин

Speech to text на русском — это распознавание русской речи в текст, и от программы к программе оно работает по-разному: часть моделей обучена сразу на множестве языков, часть — прицельно под один язык. Поток (potok.now) использует собственную модель под русскую речь, вставляет текст сразу в активное поле без отдельного экспорта, а на бесплатном тарифе даёт 2500 слов в неделю.

Speech to text на русском встречается в двух разных контекстах: как общее название технологии распознавания речи и как поисковый запрос человека, который выбирает конкретную программу. За фразой обычно стоит одно из трёх: диктовка прямо в поле ввода, транскрибация уже готовой записи или голосовое управление командами. Сайты программ формулируют это расплывчато, и с первого клика не всегда понятно, что перед вами. Разница между подходами определяет, какая программа распознавания речи в текст вообще годится под задачу, и с неё стоит начать, а не с сравнения цифр точности на сайтах.

Как устроено распознавание речи на русском

Механика одна и та же почти у всех: микрофон записывает звук, нейросеть превращает его в текст, программа вставляет результат туда, где стоит курсор, или сохраняет отдельным файлом. Разница — в том, где эта нейросеть считает и под какой язык она обучена в первую очередь.

Часть программ работает в облаке: звук уходит на сервер, там распознаётся, и обратно приходит текст. SpeakFlow и Диктуй — облачные сервисы с оплатой в рублях напрямую, хотя страна их дата-центра на сайтах явно не раскрыта. Диктуй при этом заявляет точность 95–98% на чистой русской речи, это цифра самого сервиса, проверить её независимо нельзя, но источник у неё конкретный. Talkpad и Lispr тоже облачные, только устроены иначе: Talkpad — мультиязычный автоопределитель языка со ста с лишним языками и без отдельной модели под русский, а Lispr распознаёт через компанию Groq на серверах в США.

Другая часть работает локально: звук не покидает компьютер вовсе. Voisty использует модели вроде Whisper Large V3 Turbo или NVIDIA Parakeet, WhispeRu распознаёт офлайн без выхода в сеть, а GigaType построен на GigaAM — нейросети Сбера, обученной специально под русский язык. Molvi тоже локальный, с поддержкой русского и английского и автоматическим определением того, какой из них звучит.

У Потока подход третий: облако, но модель собственная и обучена именно под русскую речь, а не под десятки языков сразу, с прицелом на имена, термины и русско-английские фразы вроде «отправь драфт в CRM». Отклик: около 0,4 секунды, а личный словарь и история диктовок привязаны к аккаунту, не к одному компьютеру. Мультиязычная модель, которую держат в облаке ради поддержки сразу многих языков, это инженерный компромисс, не показатель качества сам по себе: она может справляться с русским прекрасно или посредственно, и без честного теста на реальных фразах узнать это нельзя.

Где диктовка экономит время, а где мешает

Голосом получается печатать быстрее, чем руками: около 900 знаков в минуту против примерно 200 при печати: разница особенно заметна на длинных письмах, служебных записках и черновиках, которые всё равно потом редактируются. Если типичная задача — наговорить абзац и поправить пару слов, диктовка почти всегда выигрывает по времени, не только по ощущению удобства.

Там, где текст короткий и точный (однословный ответ в чат, номер телефона, адрес письма), выигрыш не так заметен: пока откроете микрофон и дождётесь распознавания, можно успеть напечатать то же самое руками. Голос выигрывает на объёме, а не на скорости реакции для одной фразы.

Отдельная история — шумное место. Открытый опенспейс, кафе, машина с работающим двигателем: фоновый шум мешает распознаванию у любой программы, и здесь помогает не выбор конкретного сервиса, а физически более близкий к губам микрофон, например в наушниках, не встроенный в ноутбук.

Ещё один сценарий — переключение между несколькими окнами за раз: письмо в одном приложении, чат в другом, задача в таск-трекере. Диктовка вставляет текст туда, где стоит курсор, в любом из них, без отдельного шага копирования из своего окна, это экономит секунды на каждом переключении, а за рабочий день из десятков таких переключений набегает заметное время, даже если каждое по отдельности кажется мелочью.

Работа с профессиональными терминами и именами клиентов — то место, где разница между программами особенно ощутима на практике. Личный словарь, который запоминает такие слова, экономит время на исправлениях: без него приходится либо каждый раз произносить термин по буквам, либо потом вручную чистить текст от неверных распознаваний. Не у всех программ, о которых шла речь выше, такая функция вообще есть: стоит уточнять у конкретного сервиса, а не считать её стандартной.

Расчёт по средней скорости печати и речи, не замер.
ЗадачаЗнаковПечать (200 зн/мин)Голос (900 зн/мин)
ответ в чате3002 мин0.5 мин
письмо15008 мин1.7 мин
пост или протокол400020 мин4.4 мин
статья1000050 мин11.1 мин

Когда лучше печатать или взять другой инструмент

Если нужно расшифровать уже существующую запись (встречу, интервью, голосовое сообщение из мессенджера), speech to text в смысле диктовки не подходит вовсе: Поток распознаёт только то, что вы произносите прямо сейчас, а не файл с диска. Для транскрибации готовых записей нужен отдельный инструмент, который принимает аудиофайл на вход.

Поток — облачный сервис, распознавание идёт на серверах в России, и без интернета он не работает. Тем, кому нужна работа в самолёте, в помещении без сети или на объекте с запретом на облачную обработку, облачный вариант в принципе не подойдёт: годится только программа с распознаванием прямо на устройстве, например из тех локальных решений, что разобраны выше.

У Потока нет открытого API для разработчиков: это готовое приложение для конечного пользователя, не конструктор для встраивания в своё программное обеспечение. Мобильных версий для Android и iPhone тоже нет: клиенты только для Windows и macOS, а часть запросов «speech to text русский» на самом деле ищут именно для телефона: голосовые заметки на ходу, где компьютера рядом нет. Более базовый вопрос, есть ли на компьютере голосовой ввод в принципе, без установки чего-либо, разобран отдельно.

Частые вопросы

Чем speech to text отличается от привычной диктовки?

Speech to text — общее название технологии распознавания речи в текст. Диктовка — один из способов её применить: вы говорите прямо сейчас, и текст сразу появляется в поле. Та же технология используется и в транскрибации готовых записей, и в голосовых командах, но там текст обрабатывается иначе.

Можно ли доверять цифрам точности speech to text на русском?

Только с оговоркой: цифра точности всегда получена на конкретном наборе фраз, и без независимой проверки сравнивать её с цифрой другой программы нельзя, даже если обе называются WER. У Потока это WER 2,1% на бенчмарке GolosTest — собственный тест, независимых сравнений точности на русском пока нет.

Как установить и начать пользоваться Потоком: первые 5 минут?

Скачать установщик с potok.now/download → установить → зарегистрироваться по email → в любом текстовом поле зажать хоткей (по умолчанию Ctrl+Space) → говорить → отпустить хоткей — текст появится в поле.

Сколько стоит Поток и какие есть тарифы?

Есть бесплатный пробный период на 14 дней с полным доступом к функциям Pro, карта не требуется. После пробного периода — либо бесплатный лимит 2500 слов в неделю, либо платная подписка Pro 690 ₽/мес (дешевле при годовой оплате — 500 ₽/мес).

Что пишут пользователи в отзывах о Потоке?

На сайте potok.now собраны обобщённые отзывы, отражающие типичный опыт пользователей; в маркетинговых материалах они не выдаются за отзывы конкретных людей с именами.

Есть ли аналог Потока в интернете?

Да, на рынке есть похожие сервисы голосового ввода: зарубежный Wispr Flow, а также Talkpad, Voisty и другие. Поток отличается тем, что сделан для русской речи, данные обрабатываются на серверах в России (режим 152-ФЗ), а оплата принимается рублём с карты РФ.

Скачать «Поток»

Работает по одной клавише в любой программе. 14 дней полного доступа, потом Free 2500 слов в неделю или Pro 690 ₽/мес (500 ₽/мес за год). «Поток» — облачный сервис: распознавание идёт на серверах в России, без интернета он не работает.

Скачать «Поток»

Программы по теме: сравнение условий

Условия — по официальным сайтам сервисов.
СервисПлатформыБесплатноЦенаОплата из РФГде распознаётся речь
ПотокWindows, macOSFree: 2500 слов в неделю; первые 14 дней — полный доступ без картыPro 690 ₽/мес, 500 ₽/мес при оплате за годроссийские карты, рублиоблако, серверы в России; нужен интернет
SpeakFlowWindows, Web30 минут диктовки в месяц, бесплатно навсегда690 ₽/мес (Персональный (безлимит))рубли напрямуюоблако (страна дата-центра не раскрыта на сайте) (не подтверждено)
ДиктуйWindows, macOS30 минут диктовки в месяц, бесплатно навсегда239 ₽/мес (Профи (цена в пересчёте при годовой оплате)); 2870 ₽/год (Профи (год, счёт целиком)); 479 ₽/мес (Макс (цена в пересчёте при годовой оплате))рубли напрямую (не подтверждено)облако (страна дата-центра не раскрыта на сайте) (не подтверждено)
TalkpadmacOS, Windows, Android2500 слов/нед на десктопе, 1500 слов/нед на мобильном, бесплатно навсегда; плюс 14 дней Pro-триал$6/мес (Pro (при годовой оплате, $72/год)); $8/мес (Pro (помесячная оплата))неизвестно (не подтверждено)облако (юрлицо зарегистрировано в Австралии; сайт хостится на Cloudflare, точное расположение серверов ASR не раскрыто в privacy policy) (не подтверждено)
VoistyWindows, macOS5 минут транскрипции (для оценки качества)$6.7/мес (Pro); $67/год (Pro (год)); $99/разово (Lifetime)карты Visa/Mastercard/Amex, PayPal; приём карт РФ не уточнён (не подтверждено)устройство (офлайн, локальные модели типа Whisper Large V3 Turbo / NVIDIA Parakeet)
WhispeRuWindows7 дней бесплатный пробный период (без карты)290 ₽/мес (месячная лицензия); 1990 ₽/год (годовая лицензия); 4990 ₽/разово (лицензия навсегда)рубли напрямую (оплата через YooKassa)устройство (офлайн)
GigaTypeWindows, macOSбесплатно без ограничений — открытый исходный код по лицензии MIT (Copyright (c) 2026 Disrupt Builders), весь функционал доступен без оплатыне требуется — платных тарифов нетустройство (офлайн, нейросеть GigaAM от Сбера)
MolviWindows, macOSбесплатно навсегда, без аккаунтов и оплатыне требуется — продукт бесплатный; добровольные пожертвования принимаются через Telegram Tribute или картой на сайте, суммы не фиксированыустройство (офлайн; на NVIDIA GPU лучшее качество, иначе быстрая модель на CPU)

Первоисточники: speakflow.ru · speakflow.ru · speakflow.ru · blog.speakflow.ru

Марк Весёлый — основатель «Потока». Пишет о голосовом вводе на русском: как диктовать в рабочих программах, что мешает и чем это чинится.
© Поток · Липатников Владимир Олегович · ИНН 502915859701 · Оферта Сравнения · Вопросы и ответы · О проекте