Могут ли AI-агенты делать ремонт?

Как мы внедряем AI в сервисе домашнего ремонта Руки: процессы, агенты, метрики.

Руки на рынке больше 8 лет. Мастера делают ремонт всей квартиры с дизайн-проектом под ключ, ремонт в ванной, детской или на кухне, собирают кухни, ставят двери и выполняют заказы по мелкому бытовому ремонту. Сервис — это не только специалисты, которые приезжают на заказ к клиенту, но и IT-платформа, которая всем этим управляет: бэкенд, фронтенд, дизайн, UX, мобильная разработка, а ещё сложные операционные процессы найма, обучения, приёма и обработки заказов, контроля качества, которыми занимаются несколько десятков сотрудников.

Этот бизнес выраженно сезонный, что означает рост спроса в десятки раз в пиковые месяцы и такое же резкое падение в низкий сезон. Мы работаем с крупными b2b партнерами, и большую часть прогнозирования делают они, сами проводят тесты. Но даже на большом массиве данных невозможно предсказать колебания спроса.

Чтобы оставаться конкурентными на рынке, мы вынуждены постоянно работать над операционной эффективностью, поэтапно внедряя AI в операции.

К началу 2026 года у нас уже был AI-бот в чате на сайте. Его задача была приземлённой: отвечать на типовые вопросы, разгружать операторов. Обычный рабочий инструмент. Мы стали думать о том, как мог бы выглядеть сервис домашнего ремонта в ближайшем будущем в мире, в котором пользователь не общается с сервисами напрямую, а делегирует всё своим цифровым агентам.

Мы решили проверить, как такой сценарий может работать в бытовом ремонте, и заодно послать сообщение тем продуктовым командам и фаундерам, кто, как и мы, уже строит и внедряет агентов, что мы “на одной волне”. Поверх существующего бота сделали адаптер и доступ к API. Быстро собрали лендинг, выкатили эксперимент в закрытое сообщество и стали ждать. Результат ожидаемый. Интерес у сообщества есть: пользователи говорят «прикольно», обсуждают, демонстрируют концепцию друзьям. Живых заказов — почти нет. Как мы и думали, делать заказ проще и привычнее через уже знакомые каналы — бот в Telegram, приложение, телефон.

Эта серия материалов о том, как мы обеспечиваем надежную работу сервиса домашнего ремонта Руки, когда мастеров — тысячи, а заказов десятки тысяч в месяц.

AI: сколько процентов от человека

Ремонт — сезонный бизнес. Быстро набрать, обучить, а потом распустить вдвое больше сотрудников для общения с мастерами, уточнения и обработки заказов невозможно. Но можно подключить AI. Насколько хуже человека он будет работать? И можем ли мы пойти на такую потерю качества, чтобы не терять заказы? Эти показатели нам пришлось замерить и принять решения.

Например, общий уровень качества по текстам и изображениям (сюда входит обработка фото, видео, текстов, отчётов, проверка документов — наличие подписи, совпадение сумм, соблюдение условий) реализуется нейросетью сейчас на уровне 95-96% от человека. Это хороший показатель — с этим можно работать.

Полная автоматизация обработки голосовых заказов технически тоже возможна, но деградация качества здесь уже существенная. Сейчас голосовые звонки с AI — это 60-70% от уровня обученного человека. Нам этого недостаточно.

Кроме того, в клиентской коммуникации нельзя просто выкатить бота на всех подряд — есть люди, которым важен живой разговор, и есть ситуации, которые просто невозможно заранее прописать в скриптах.

Поэтому голосовых помощников мы используем для ограниченного числа задач и принимаем решения о переходе с опорой на точечные метрики, созданные под наши конкретные нужды.

Резюме: Качество AI-внедрения имеет смысл мерить не в логике «работает / не работает», а в процентах от уровня обученного человека — отдельно по каждому каналу. И заранее решить, какая потеря качества приемлема именно для вас: для нас 95–96% в текстах — да, 60–70% в голосе — нет.

Как измерить качество AI-админа

Можно ли объективно сравнить «человек vs агент» на операционных задачах? Тут важно изначально принять факт, что на реальных кейсах будут ошибки и у агента, и у человека, вопрос в том, какие, где и какова цена ошибки.

Эту задачу мы решаем качественным анализом. Для этого команда делает бенчмарк: берётся датасет юнитов работы, их сначала выполняют люди, потом — агент.

Когда задача бинарная (выбрать между A и B), всё просто: считаем не только процент правильных ответов, но и метрики качества классификации — precision, recall и F1-меру. Это позволяет учесть несбалансированность классов и разную цену ошибок, и уже по этим метрикам сравнивать человека и агента.

С отчётами сложнее: здесь риск-менеджмент, последствия ошибок могут проявиться не сразу, а в виде реализовавшихся рисков. Поэтому для разных типов задач вводятся свои оценки, а часть работы авто-админа регулярно проходит кросс-валидацию: какие-то задания заново выполняют люди и сравнивают свои решения с решениями агента.

Резюме: Такой бенчмарк не требует отдельной ML-команды. Нужны датасет юнитов работы, двойное выполнение (сначала люди, потом агент), precision, recall и F1-мера правильных ответов для бинарных задач, плюс регулярная кросс-валидация людьми для сложных. Схема воспроизводится в любом бизнесе, где работа разложена на юниты.

AI в операциях

Внутри наших процессов всё устроено как система юнитов работы с нормативами и KPI. Приходит заказ, система видит, что не хватает данных — создаётся задание, администратор звонит клиенту и собирает недостающую информацию: есть ли парковка, какой этаж, есть ли лифт, на какие условия согласен клиент. За каждую такую операцию начисляются «пойнты», из суммы которых складывается OPC — operational processing cost, операционная стоимость обработки одного заказа.

С помощью AI мы сейчас снижаем OPC и удерживаем нагрузку в пиковые месяцы. Для нас переход к агентам — это продолжение уже существующей работы по оптимизации сервиса. Мы внедряли AI там, где у нас уже были разложенные на скрипты процессы, описанные роли и должностные инструкции, понятные юниты работы и метрики для оценки качества.

Резюме: AI снижает операционную стоимость только там, где она уже посчитана. Если у процесса нет метрики вроде OPC, сначала должна появиться метрика, потом агент — иначе эффект от внедрения нечем будет доказать.

Агенты

К летнему сезону 2026 мы запустили трёх агентов на одной контекстной базе. Сейчас в сервисе трудятся Феофан (авто-админ), Эсфирь (голосовой робот, в том числе занимается рекрутингом), Валентин (секретарь-консультант) и набор сервисных промптов для задач контроля качества. Имена им, если что, придумывали разработчики. С агентами сезонному бизнесу становится проще планировать: теперь мы можем посчитать, сколько токенов у нас сжигается на пике и сколько — в низкий сезон, и затем перенаправить время и ресурсы с сезонного найма и онбординга новых админов на вложения в развитие агентов.

Авто-админ Феофан

Первый шаг внедрения AI мы сделали в бэк-офисе — в задачах без прямой коммуникации с людьми. Взяли набор юнитов, которые выглядят относительно безопасно для автоматизации: проверка фото, отчётов мастеров, наличие подписей, другие базовые формальные проверки. В частности — анкету мастера, её описание, фотографии с заказа, описание работ. Сами мастера часто предлагают слабые фото и тексты. AI помогает быстро обновлять и улучшать эти материалы — обрабатывает фотографии, подсказывает лучшие формулировки, и таким образом улучшает витрину услуг. Под эти задачи создали модель, посмотрели, как она справляется, и на ней собрали авто-админа — внутреннего агента по имени Феофан.

Голосовой помощник Эсфирь

Следующий уровень сложности — голос.

Реализовать полноценный real-time диалог с клиентом через AI — нетривиальная инженерная задача. Нужно синхронно обработать аудиосигнал, пропустить его через STT (speech-to-text), отправить в LLM, получить ответ, превратить его обратно в речь через TTS (text-to-speech) и всё это уложить в жёсткие требования по задержке. Между компонентами ещё и сеть, которая вносит свои лаги, особенно в часы пиковой нагрузки.

Когда одновременно нужно делать ISR, гонять запрос в LLM и подставлять шаблоны, скорость AI-агентов в живом диалоге пока ощутимо ниже человеческой, особенно в нестандартных ситуациях, и это раздражает пользователя.

По этой причине мы решили начать не с разговоров с клиентами, а с автоматизации коммуникаций с мастерами и создали для этого бота-обзвонщика Эсфирь, которая работает в паре с Феофаном. В режиме реального времени есть сложности, но эта система работает.

Пример использования: скажем, наш мастер не отчитывается о договорённостях с клиентом, пуши не помогают, пора ему звонить. Эсфирь сама набирает мастера, задаёт нужные вопросы, обрабатывает несколько попыток дозвона, выгружает диалог для транскрибации. Текст уходит к Феофану, который должен из диалога понять: договорился ли мастер с клиентом, на какую дату, что дальше нужно сделать с заказом, после чего автоматически обновляет дату договорённости и статус. Во всей этой цепочке человек может ни разу не вмешаться.

Также мастера общаются через чат-бот для решения рабочих вопросов: проблемы с балансом, технические неполадки, нестандартные ситуации у клиента, отчётность, изменение планов. Тут агенты работают с допустимыми задержками и обрабатывают текстовые запросы с высоким качеством.

Эсфирь, помимо обзвона мастеров по заказам, используется и в рекрутинге: она сама звонит кандидату, проводит прескрининг по базовым опросникам и отправляет эти данные в общую воронку. Так мы разгружаем рекрутёров, и они успевают больше.

Регистрация мастеров — наше второе по затратам направление: проверка их коммуникационных навыков, изучение историй работы, определение услуг, тестирование (всего около 4% мастеров знают строительные нормативы и умеют по ним работать), обучение работе с системой. Технологии из обработки заказов постепенно переносятся и сюда.

Уже сейчас есть заказы, где вся операционная работа — от напоминаний до проверки времени выезда к клиенту и деталей заказа — выполняется роботами. AI позволяет нам сохранять темп развития, не увеличивая штат админов. В 2026 году мы обслужили на 28% больше заказов, сократив команду админов на 26%, что дало рост производительности на одного админа примерно на 73%. Но к созвону с клиентами мы пока что AI-агентов не допускаем — это вопрос позиционирования сервиса и контроля качества.

Секретарь Валентин

Помимо Феофана и Эсфири внутри нашей экосистемы есть ещё один агент — секретарь Валентин, который помогает в текстовой коммуникации.

Показательный пример — СПК, интерфейс для сотрудников нашего магазина-партнёра, когда им нужно быстро понять, что происходит с заказом. Тут в основе лежит длинный лог: заметки админов, расшифровки созвонов с мастером и клиентом, комментарии менеджеров и исполнителей. Показывать их партнёру, который хочет только понять статус и ответить, например, клиенту — избыточно, да и не нужно. Поэтому LLM-модель по имени Валентин смотрит на хронологию, заметки, звонки и готовит из этого саммари — структурированный текст со всеми нужными деталями и с выверенными нейтральными формулировками.

AI в разработке

Наша команда разработки — это примерно 10 человек на миллионы строк кода, при этом проект растёт на 30% год от года. Сегодня разработчики используют AI практически во всех задачах, не только в рутинных. Профессия за этот год изменилась: ты говоришь агентам, что и как делать, проверяешь их работу, иногда многократно объясняешь, как надо. Фазу «набивания», когда всё муторное и однообразное, отдаёшь агенту.

Интересные архитектурные решения разработчики по-прежнему хотят делать и делают сами, но AI уже участвует и в нескучных задачах, меняя структуру компетенций. Способность мыслить системно, планировать, объяснять и работать в условиях неопределённости становится ценнее, чем знание конкретного стека. Сейчас фокус сместился в сторону компактных, более сеньорных команд.

Мы никого не сократили из команды разработки, и не планируем. Просто периметр того, что мы делаем, увеличивается и увеличивается, а ещё нужно за всем этим AI хозяйством следить, строить и управлять. Новый стек — это возможность двигаться быстрее. Но требования к найму, безусловно, изменились. За последний год были кандидаты, которых мы не взяли потому, что они принципиально не используют современный стек. Объяснение простое: если человек игнорирует уже сформировавшийся тренд, есть риск, что адаптация к следующей волне изменений тоже пройдёт тяжело. Также стало сложнее принимать решения по найму джунов.

В нашей разработке роль «писателя кода» становится всё менее актуальной. Всё большую роль забирают продуктовые разработчики, Product Engineer (продакт-инженеры). Те, кто берёт на себя полный цикл создания продукта: от понимания бизнес-задачи и общения с клиентом до написания кода (или проектирования) и доведения результата до конечного пользователя. Гибридная роль, объединяющая инженера, разработчика и менеджера по продукту.

Это первая часть серии материалов о том, как Руки строят надёжную работу сервиса домашнего ремонта, когда мастеров — тысячи, а заказов — десятки тысяч в месяц. Обсудить — в комментариях. Позвать мастера — hands.ru.