Как я собрал программу для локальной транскрибации аудиозаписей. Погружаюсь в вайбкодинг на максималках
В октябре 2025 года в этом канале я писал о правовых рисках транскрибации аудиозаписей судебных заседаний через облачные иностранные ИИ-сервисы (например, AI Studio).
Напомню, что загрузка такой записи в большинстве случаев – это трансграничная передача персональных данных с нарушением установленного законом порядка.
Тогда я завершил свой пост такой фразой:
Для расшифровки аудио самый безопасный метод - локальные решения, и я пока нахожусь в поиске оптимального.
В итоге мои поиски закончились тем, что я собрал собственную программу - бесплатный локальный транскрибатор русской речи для Windows. Но путь до работающего решения оказался значительно сложнее, чем я предполагал.
🚢В поисках готового решения
С тех пор, как я написал вышеупомянутый пост, я не прекращал поиск подходящего локального инструмента.
Да, локальные модели для транскрибации существуют достаточно давно, самая известная – Whisper от OpenAI. Но более-менее приличное качество дает только их самая большая модель, а она тяжелая и требует мощной видеокарты, которой на офисном компьютере юриста обычно нет. Есть и ее легкие сборки, менее требовательные к мощности компьютера, но качество расшифровки там сильно снижается.
Поэтому оптимального и готового решения я так и не нашел. Может, плохо искал, может, упустил какие-то готовые варианты.
А просвет в этом вопросе у меня появился совсем недавно, когда я апгрейдил голосовой ввод для личного ИИ-агента на базе Hermes – он помогает с личными делами, проектами, организует время (о нем расскажу как-нибудь позже, в следующих постах).
В процессе настройки агента я наткнулся на модель распознавания речи от Сбера – GigaAM v3. И эта модель сильно порадовала меня при расшифровке моих голосовых команд для этого агента.
Тогда и появилась идея: попробовать на базе GigaAM собрать полноценное локальное решение для транскрибации аудио- и видеозаписей.
💡Делаю свою программу
Когда я начинал этот проект, то даже не предполагал, насколько долгим окажется путь.
Бесконечный цикл: промпт – результат – тест – правки, промпт – результат – тест – правки. Порой я чувствовал себя самураем, у которого нет цели, а есть только путь.
Сложность заключалась в самой природе задачи. Транскрибация аудиозаписи состоит из двух составляющих: собственно расшифровки голоса и диаризации, то есть распределения текста по спикерам.
И если с расшифровкой голоса все более-менее понятно, то диаризация оказалась самым слабым звеном – с ней пришлось повозиться всерьез. Все мои старания сильно улучшили результат диаризации, но даже этого недостаточно, чтобы назвать его идеальным. Впрочем, насколько я успел убедиться, это слабое место практически всех подобных сервисов.
По ходу работы над проектом я плавно сменил подписку Claude Max со 100 долларов на 200 долларов, но даже на новом тарифе сжег дотла два недельных лимита. Работал преимущественно с Fable 5, периодически подключая Opus 5.
Когда я поставил точку в основной разработке, трекер по этой задаче показал, что я потратил на эту работу больше 30 часов.
👍 На выходе - Словея
По итогам разработки появилась Словея – программа для локальной транскрибации аудио- и видеозаписей на русском языке.
Ключевое – вся обработка данных идет локально, на персональном компьютере. Запись не уходит в облака, расшифровка тоже. Данные не покидают компьютер пользователя.
Словея собрана из 46 компонентов с открытым исходным кодом, но ее сердце – это ASR-модель распознавания речи GigaAM v3 от Сбера. Эта модель обучена на 700 тысячах часов русской речи. GigaAM сильно легче и компактнее Whisper. При этом на моем наборе русскоязычных тестовых записей она показывала более точный результат, чем локальные сборки Whisper, которые я также устанавливал и проверял.
Кроме того, по моим личным замерам, качество расшифровки Словеи оказалось сопоставимо с результатами нескольких известных в России платных сервисов транскрибации. Но разница в том, что платные сервисы обрабатывают записи в облаке на мощных серверах, а Словея работает локально на обычном офисном компьютере.
📎 О технических ограничениях
Словея - не идеальный продукт. У нее есть объективные технические ограничения, которые во многом являются платой за локальную обработку данных.
Скорость расшифровки. Она зависит от мощности вашего процессора и оперативной памяти. На разных компьютерах скорость может отличаться в разы. К примеру, на слабоватом 4-ядерном процессоре коэффициент 0,5, то есть час записи расшифровывается за полчаса. Процессор помощнее – скорость сильно увеличивается. Дело в том, что Словея работает, используя мощность процессора, а не видеокарты. Это мое сознательное решение: я хотел, чтобы программу тянул обычный офисный компьютер, а не компьютер с дорогущей видеокартой.
Качество расшифровки. Результат по-прежнему сильно зависит от исходного аудио. Чем чище запись, меньше постороннего шума и ближе говорящие находятся к микрофону, тем выше точность транскрибации. Я долго экспериментировал с настройками и обработкой звука, пытаясь вытянуть максимум даже из не самых качественных записей. Но конечный потолок все равно определяется возможностями самой модели GigaAM.
Разбивка по спикерам. Диаризация как была самым слабым звеном всех сервисов по транскрибации аудио, так и осталась. То есть программа разбивает запись на спикеров, но может записать чьи-то реплики другому участнику. Такая проблема наблюдается и в Словее. Поэтому я встроил функцию быстрого ручного исправления спикеров.
💬 Что в итоге?
В итоге я сделал тот инструмент, который когда-то искал сам: бесплатный, локальный, легкий и рассчитанный на обычный офисный компьютер.
Словея доступна для Windows по ссылке: https://sloveya.ru/. Распространяется бесплатно, пользуйтесь.
Эта программа уже решает задачи, ради которых я ее создавал. А насколько стабильно она будет работать на разных конфигурациях компьютеров - покажет только время.