Замер · врачам

Медицинская терминология в распознавании речи: что берётся с первого раза, а что нет

Коротко. «Гликированный гемоглобин», «азитромицин», «электроэнцефалография» распознавание берёт с первого раза. Название препарата латиницей — почти наверняка нет. Ниже — цифры нашего замера, что за ними стоит и почему их нельзя цитировать без оговорки.

Что и как измеряли

31 июля 2026 года мы прогнали через свой боевой сервер распознавания 72 фразы в восьми категориях. Медицинская лексика была одной из них: шесть фраз, тридцать семь слов, одиннадцать ключевых терминов.

Считали две вещи. Первая — обычная ошибка распознавания (доля неверных слов). Вторая, и она важнее, — сколько ключевых терминов вернулось в точном написании. Логика простая: одно убитое название препарата портит запись сильнее, чем потерянный предлог.

КатегорияФразОшибка распознаванияТерминов точно
Медицинская лексика62,7%10 из 11
Числа, даты, единицы100,0% по смыслу
Имена и фамилии89,6%8 из 10, все русские — верно
Названия латиницей1424,6%2 из 22

Замер от 31.07.2026 на собственном сервере распознавания, 72 фразы в восьми категориях. Речь синтезированная — идеальная дикция, ровный темп, ноль фонового шума, один голос. Это верхняя граница качества, потолок. На живой речи из обычного микрофона цифры будут заметно хуже.

Что взялось с первого раза

«Гликированный гемоглобин», «азитромицин», «электроэнцефалография» — длинные, редкие для повседневной речи слова, на которых обычно спотыкаются универсальные распознавалки. Здесь они вернулись слово в слово.

Единственная помарка на шести фразах — падеж: модель написала «электроэнцефалографии» там, где в эталоне стояло «электроэнцефалография». Это ошибка согласования, а не глухота: слово модель знает.

Числа отдельным пунктом, потому что в медицинской записи их много. Модель приводит сказанное к письменной форме сама: «сто двадцать восемь» становится «128», «пятнадцатое марта в четырнадцать тридцать» — «15 марта в 14:30», «восемьдесят семь процентов» — «87%». На десяти фразах этой категории смысловых ошибок не было ни одной.

Это всё равно не отменяет проверку дозировок

Ноль ошибок в замере не означает ноль ошибок у вас. Дозировка, кратность приёма и длительность курса перечитываются глазами всегда — цена ошибки здесь несопоставима с ценой пяти секунд проверки.

Где ломается

Латиница. Это наша самая слабая категория: правильное написание мы дали в 9% случаев — два названия из двадцати двух. Если вы диктуете международное непатентованное наименование латиницей, название прибора или англоязычную аббревиатуру, ждите, что придётся править руками или заносить слово в личный словарь.

Русская транскрипция при этом работает хорошо. «Азитромицин» — берётся. «Azithromycin» — почти наверняка нет.

Русские фамилии, кстати, распознаются точно: в наборе было восемь русских имён и фамилий, включая «Селезнёв» и «Штейнберг», — все восемь верно. Ошибались модели на иностранных: «Мария Гонсалес», «Хироси Танака».

Почему цифру нельзя цитировать без оговорки

Это важная часть, и её обычно опускают.

Замер сделан на синтезированной речи. Синтез — это идеальная дикция, ровный темп, ноль фонового шума, ноль пауз-заминок и «эээ», один голос вместо десятков разных, отсутствие эффекта микрофона и комнаты. Всё, что мы получили, — верхняя граница качества, потолок.

Живой кабинет устроен иначе. Голос садится к концу смены. Из коридора слышно очередь. Микрофон — встроенный в ноутбук, в полуметре от вас, под углом. По каждому из этих пунктов цифры поедут вниз, и заметно.

Поэтому мы не говорим «точность „Потока“ на медицинской речи — 97%». Мы говорим: на синтезированной речи в нашем замере ошибка составила 2,7%, а на вашей речи будет больше. Насколько — покажет только проверка на вашем голосе и вашем микрофоне.

И честно про общий уровень

По суммарной ошибке распознавания на всех восьми категориях мы не впереди зарубежных движков: 9,2% против 8,1% у Deepgram на том же наборе фраз. Заявлять «мы лучше всех распознаём русский» мы не будем — это неправда и проверяется одним тестом.

Наши сильные места конкретны и проверяемы: русская терминология (на юридической категории — ноль ошибок, на медицинской — 2,7%), автоформатирование чисел и дат, где мы Deepgram обходим, медианный отклик 124 мс и российские серверы.

Что с этим делать на практике

Занесите в личный словарь редкие препараты, названия методик и всё, что пишете латиницей. Это разовая работа на пятнадцать минут, которая снимает большую часть правок.

Сделайте свой замер. Продиктуйте один типичный протокол осмотра — свой, со своими формулировками — и посмотрите, сколько правок понадобилось. Это единственная цифра, которая имеет для вас значение.

Не диктуйте идентифицирующие данные пациента. Это отдельная тема, разобранная в материале про врачебную тайну и диктовку.

Короткие ответы

Какая точность на медицинской лексике?

2,7% ошибки и 10 точных терминов из 11 в замере 31.07.2026 на синтезированной речи. На живой речи будет хуже.

Что с названиями латиницей?

Плохо: 9% правильных написаний. Русская транскрипция берётся хорошо.

Вы лучше зарубежных движков?

По общему качеству — нет. По русской терминологии, числам и скорости отклика — да, и это мы можем показать цифрами.

Как встроить диктовку в приём — в материале «Протокол приёма голосом». Общий разбор для сегмента — на странице для врачей.

Попробовать на своей речи

Ваша терминология и ваш микрофон дадут другие цифры — проверить можно за вечер. Windows и macOS, 14 дней полного доступа без карты.

Скачать «Поток»

© 2026 Поток · Липатников Владимир Олегович · ИНН 502915859701 · Оферта Журнал · Вопросы и ответы · Интеграции · Конфиденциальность · Скачать