Speech to text на русском — это распознавание русской речи в текст, и от программы к программе оно работает по-разному: часть моделей обучена сразу на множестве языков, часть — прицельно под один язык. Поток (potok.now) использует собственную модель под русскую речь, вставляет текст сразу в активное поле без отдельного экспорта, а на бесплатном тарифе даёт 2500 слов в неделю.
Speech to text на русском встречается в двух разных контекстах: как общее название технологии распознавания речи и как поисковый запрос человека, который выбирает конкретную программу. За фразой обычно стоит одно из трёх: диктовка прямо в поле ввода, транскрибация уже готовой записи или голосовое управление командами. Сайты программ формулируют это расплывчато, и с первого клика не всегда понятно, что перед вами. Разница между подходами определяет, какая программа распознавания речи в текст вообще годится под задачу, и с неё стоит начать, а не с сравнения цифр точности на сайтах.
Как устроено распознавание речи на русском
Механика одна и та же почти у всех: микрофон записывает звук, нейросеть превращает его в текст, программа вставляет результат туда, где стоит курсор, или сохраняет отдельным файлом. Разница — в том, где эта нейросеть считает и под какой язык она обучена в первую очередь.
Часть программ работает в облаке: звук уходит на сервер, там распознаётся, и обратно приходит текст. SpeakFlow и Диктуй — облачные сервисы с оплатой в рублях напрямую, хотя страна их дата-центра на сайтах явно не раскрыта. Диктуй при этом заявляет точность 95–98% на чистой русской речи, это цифра самого сервиса, проверить её независимо нельзя, но источник у неё конкретный. Talkpad и Lispr тоже облачные, только устроены иначе: Talkpad — мультиязычный автоопределитель языка со ста с лишним языками и без отдельной модели под русский, а Lispr распознаёт через компанию Groq на серверах в США.
Другая часть работает локально: звук не покидает компьютер вовсе. Voisty использует модели вроде Whisper Large V3 Turbo или NVIDIA Parakeet, WhispeRu распознаёт офлайн без выхода в сеть, а GigaType построен на GigaAM — нейросети Сбера, обученной специально под русский язык. Molvi тоже локальный, с поддержкой русского и английского и автоматическим определением того, какой из них звучит.
У Потока подход третий: облако, но модель собственная и обучена именно под русскую речь, а не под десятки языков сразу, с прицелом на имена, термины и русско-английские фразы вроде «отправь драфт в CRM». Отклик: около 0,4 секунды, а личный словарь и история диктовок привязаны к аккаунту, не к одному компьютеру. Мультиязычная модель, которую держат в облаке ради поддержки сразу многих языков, это инженерный компромисс, не показатель качества сам по себе: она может справляться с русским прекрасно или посредственно, и без честного теста на реальных фразах узнать это нельзя.
Где диктовка экономит время, а где мешает
Голосом получается печатать быстрее, чем руками: около 900 знаков в минуту против примерно 200 при печати: разница особенно заметна на длинных письмах, служебных записках и черновиках, которые всё равно потом редактируются. Если типичная задача — наговорить абзац и поправить пару слов, диктовка почти всегда выигрывает по времени, не только по ощущению удобства.
Там, где текст короткий и точный (однословный ответ в чат, номер телефона, адрес письма), выигрыш не так заметен: пока откроете микрофон и дождётесь распознавания, можно успеть напечатать то же самое руками. Голос выигрывает на объёме, а не на скорости реакции для одной фразы.
Отдельная история — шумное место. Открытый опенспейс, кафе, машина с работающим двигателем: фоновый шум мешает распознаванию у любой программы, и здесь помогает не выбор конкретного сервиса, а физически более близкий к губам микрофон, например в наушниках, не встроенный в ноутбук.
Ещё один сценарий — переключение между несколькими окнами за раз: письмо в одном приложении, чат в другом, задача в таск-трекере. Диктовка вставляет текст туда, где стоит курсор, в любом из них, без отдельного шага копирования из своего окна, это экономит секунды на каждом переключении, а за рабочий день из десятков таких переключений набегает заметное время, даже если каждое по отдельности кажется мелочью.
Работа с профессиональными терминами и именами клиентов — то место, где разница между программами особенно ощутима на практике. Личный словарь, который запоминает такие слова, экономит время на исправлениях: без него приходится либо каждый раз произносить термин по буквам, либо потом вручную чистить текст от неверных распознаваний. Не у всех программ, о которых шла речь выше, такая функция вообще есть: стоит уточнять у конкретного сервиса, а не считать её стандартной.
| Задача | Знаков | Печать (200 зн/мин) | Голос (900 зн/мин) |
|---|---|---|---|
| ответ в чате | 300 | 2 мин | 0.5 мин |
| письмо | 1500 | 8 мин | 1.7 мин |
| пост или протокол | 4000 | 20 мин | 4.4 мин |
| статья | 10000 | 50 мин | 11.1 мин |
Когда лучше печатать или взять другой инструмент
Если нужно расшифровать уже существующую запись (встречу, интервью, голосовое сообщение из мессенджера), speech to text в смысле диктовки не подходит вовсе: Поток распознаёт только то, что вы произносите прямо сейчас, а не файл с диска. Для транскрибации готовых записей нужен отдельный инструмент, который принимает аудиофайл на вход.
Поток — облачный сервис, распознавание идёт на серверах в России, и без интернета он не работает. Тем, кому нужна работа в самолёте, в помещении без сети или на объекте с запретом на облачную обработку, облачный вариант в принципе не подойдёт: годится только программа с распознаванием прямо на устройстве, например из тех локальных решений, что разобраны выше.
У Потока нет открытого API для разработчиков: это готовое приложение для конечного пользователя, не конструктор для встраивания в своё программное обеспечение. Мобильных версий для Android и iPhone тоже нет: клиенты только для Windows и macOS, а часть запросов «speech to text русский» на самом деле ищут именно для телефона: голосовые заметки на ходу, где компьютера рядом нет. Более базовый вопрос, есть ли на компьютере голосовой ввод в принципе, без установки чего-либо, разобран отдельно.
Частые вопросы
Speech to text — общее название технологии распознавания речи в текст. Диктовка — один из способов её применить: вы говорите прямо сейчас, и текст сразу появляется в поле. Та же технология используется и в транскрибации готовых записей, и в голосовых командах, но там текст обрабатывается иначе.
Только с оговоркой: цифра точности всегда получена на конкретном наборе фраз, и без независимой проверки сравнивать её с цифрой другой программы нельзя, даже если обе называются WER. У Потока это WER 2,1% на бенчмарке GolosTest — собственный тест, независимых сравнений точности на русском пока нет.
Скачать установщик с potok.now/download → установить → зарегистрироваться по email → в любом текстовом поле зажать хоткей (по умолчанию Ctrl+Space) → говорить → отпустить хоткей — текст появится в поле.
Есть бесплатный пробный период на 14 дней с полным доступом к функциям Pro, карта не требуется. После пробного периода — либо бесплатный лимит 2500 слов в неделю, либо платная подписка Pro 690 ₽/мес (дешевле при годовой оплате — 500 ₽/мес).
На сайте potok.now собраны обобщённые отзывы, отражающие типичный опыт пользователей; в маркетинговых материалах они не выдаются за отзывы конкретных людей с именами.
Да, на рынке есть похожие сервисы голосового ввода: зарубежный Wispr Flow, а также Talkpad, Voisty и другие. Поток отличается тем, что сделан для русской речи, данные обрабатываются на серверах в России (режим 152-ФЗ), а оплата принимается рублём с карты РФ.
Скачать «Поток»
Работает по одной клавише в любой программе. 14 дней полного доступа, потом Free 2500 слов в неделю или Pro 690 ₽/мес (500 ₽/мес за год). «Поток» — облачный сервис: распознавание идёт на серверах в России, без интернета он не работает.
Скачать «Поток»Программы по теме: сравнение условий
| Сервис | Платформы | Бесплатно | Цена | Оплата из РФ | Где распознаётся речь |
|---|---|---|---|---|---|
| Поток | Windows, macOS | Free: 2500 слов в неделю; первые 14 дней — полный доступ без карты | Pro 690 ₽/мес, 500 ₽/мес при оплате за год | российские карты, рубли | облако, серверы в России; нужен интернет |
| SpeakFlow | Windows, Web | 30 минут диктовки в месяц, бесплатно навсегда | 690 ₽/мес (Персональный (безлимит)) | рубли напрямую | облако (страна дата-центра не раскрыта на сайте) (не подтверждено) |
| Диктуй | Windows, macOS | 30 минут диктовки в месяц, бесплатно навсегда | 239 ₽/мес (Профи (цена в пересчёте при годовой оплате)); 2870 ₽/год (Профи (год, счёт целиком)); 479 ₽/мес (Макс (цена в пересчёте при годовой оплате)) | рубли напрямую (не подтверждено) | облако (страна дата-центра не раскрыта на сайте) (не подтверждено) |
| Talkpad | macOS, Windows, Android | 2500 слов/нед на десктопе, 1500 слов/нед на мобильном, бесплатно навсегда; плюс 14 дней Pro-триал | $6/мес (Pro (при годовой оплате, $72/год)); $8/мес (Pro (помесячная оплата)) | неизвестно (не подтверждено) | облако (юрлицо зарегистрировано в Австралии; сайт хостится на Cloudflare, точное расположение серверов ASR не раскрыто в privacy policy) (не подтверждено) |
| Voisty | Windows, macOS | 5 минут транскрипции (для оценки качества) | $6.7/мес (Pro); $67/год (Pro (год)); $99/разово (Lifetime) | карты Visa/Mastercard/Amex, PayPal; приём карт РФ не уточнён (не подтверждено) | устройство (офлайн, локальные модели типа Whisper Large V3 Turbo / NVIDIA Parakeet) |
| WhispeRu | Windows | 7 дней бесплатный пробный период (без карты) | 290 ₽/мес (месячная лицензия); 1990 ₽/год (годовая лицензия); 4990 ₽/разово (лицензия навсегда) | рубли напрямую (оплата через YooKassa) | устройство (офлайн) |
| GigaType | Windows, macOS | бесплатно без ограничений — открытый исходный код по лицензии MIT (Copyright (c) 2026 Disrupt Builders), весь функционал доступен без оплаты | — | не требуется — платных тарифов нет | устройство (офлайн, нейросеть GigaAM от Сбера) |
| Molvi | Windows, macOS | бесплатно навсегда, без аккаунтов и оплаты | — | не требуется — продукт бесплатный; добровольные пожертвования принимаются через Telegram Tribute или картой на сайте, суммы не фиксированы | устройство (офлайн; на NVIDIA GPU лучшее качество, иначе быстрая модель на CPU) |
Первоисточники: speakflow.ru · speakflow.ru · speakflow.ru · blog.speakflow.ru