Как я за три часа написал собственный транскрибатор и перестал платить за расшифровку встреч

Как я за три часа написал собственный транскрибатор и перестал платить за расшифровку встреч

Практически каждую неделю у нас проходят совещания, переговоры, внутренние обсуждения проектов и встречи с клиентами. Как маркетолог, я постоянно возвращаюсь к этим разговорам: нужно вспомнить, кто что обещал, какие идеи появились, какие задачи были поставлены.

Со временем понял одну вещь: ценность представляет не сама запись встречи, а ее краткое содержание.

Поэтому в компании мы начали активно использовать саммари после совещаний. Руководителям больше не нужно переслушивать часовые записи — достаточно прочитать одну страницу с основными выводами, решениями и списком задач.

Оставалась одна проблема.

Почему я решил сделать свой сервис

Все популярные сервисы транскрибации работают по подписке.

Казалось бы, стоимость небольшая. Но если расшифровывать десятки часов аудио в месяц, сумма постепенно становится заметной. Особенно если сервис нужен не одному человеку, а всей компании.

Кроме того, хотелось получить еще несколько вещей:

  • чтобы данные вообще не покидали компанию;
  • чтобы сервис работал без интернета;
  • чтобы можно было запускать его на собственном сервере;
  • чтобы не было ограничений по количеству часов;
  • чтобы можно было дорабатывать функциональность под себя.

И в какой-то момент появилась мысль:

"А почему бы просто не написать свой?"

Оказалось, что сегодня это уже не сложная задача

Еще несколько лет назад подобная идея выглядела бы странно.

Нужно было разбираться в машинном обучении, собирать модели, писать огромное количество кода.

А что сейчас?

Современные open-source модели уже умеют отлично распознавать речь, а большие языковые модели помогают буквально "на лету" собрать рабочее приложение.

Я решил проверить, насколько далеко можно зайти.

В результате примерно за три часа появился полностью рабочий сервис.

Да, именно полноценное приложение, а не экспериментальный скрипт - с интерфейсом, кнопками и темной темой...

Что получилось

Сервис умеет:

  • распознавать аудио и видео;
  • автоматически определять язык;
  • работать полностью локально;
  • сохранять конфиденциальность данных;
  • использовать разные модели в зависимости от качества и скорости;
  • работать без каких-либо подписок.

Особенно понравилось то, что запускать его можно практически где угодно.

Если есть обычный офисный компьютер — сервис будет работать на процессоре (CPU). Скорость ниже, но для периодической расшифровки этого вполне достаточно. Тестировал запись на 53 минуты - обработка получилась где-то 20-25 минут (Core i3 12100)

Если установить современную видеокарту NVIDIA (какая была у меня чекайте скриншот), то вычисления переходят на GPU, и скорость обработки становится совершенно другой (та же запись обрабатывалась около 4-х минут). Для компаний, где ежедневно обрабатываются часы переговоров, это уже действительно комфортный режим работы.

По сути, это один и тот же сервис, который масштабируется вместе с вашими задачами.

Итоги

Сегодня человек, хорошо понимающий бизнес-процесс и умеющий работать с современными AI-инструментами, способен собрать рабочее решение буквально за несколько часов.

Конечно, чтобы превратить прототип в корпоративный продукт, потребуется значительно больше времени: тестирование, интерфейс, установка, обновления, обработка ошибок, безопасность, документация.

Но первый рабочий результат появляется невероятно быстро.

Стоило ли делать свое?

Для меня — однозначно да.

Теперь сервис работает локально, не требует ежемесячной оплаты, легко дорабатывается под наши процессы и постепенно превращается в полноценный внутренний инструмент.

И, пожалуй, самое приятное — понимаешь, что многие задачи, которые раньше казались слишком сложными или дорогими, сегодня вполне реально решить самостоятельно.

Если у вашей компании тоже регулярно проходят совещания, интервью, переговоры или обучение сотрудников, скорее всего, собственный локальный транскрибатор окупится гораздо быстрее, чем кажется.

А главное — все записи остаются внутри вашей инфраструктуры, а функциональность можно адаптировать именно под ваши процессы, а не под возможности очередного облачного сервиса.

2