Кейс: Как превратить LLM в карманного автомеханика. Инструкция по мультимодальному промптингу в стрессовой ситуации

Основная проблема
Основная проблема
То, что запросил ИИ
То, что запросил ИИ

Пока одни используют нейросети для написания SEO-текстов, а другие спорят, заменит ли ИИ программистов, я решил проверить, как современные большие языковые модели (LLM) справляются с чисто физическими, прикладными задачами «в поле».
Спойлер: ИИ сэкономил мне кучу времени, нервов и помог избежать оверпрайса на СТО, поставив точный диагноз по фото ещё до приезда эвакуатора.
Below — детальный разбор того, как правильно выстраивать логику мультимодального запроса (Vision + Text), чтобы выжать из модели техническую экспертизу без галлюцинаций.
Суть проблемы и вводные данные
Ситуация классическая: при выезде из парковочного кармана на минимальной скорости раздаётся хруст, переднее левое колесо выворачивается под неестественным углом, машина падает на крыло.
До этого момента машина неделю «намекала» на проблему лёгким глухим стуком на кочках, но на трассе всё было тихо, поэтому визит в сервис откладывался. Пока я ожидал эвакуатор, у меня было около 40 минут. Я решил провести эксперимент и использовать ИИ в качестве оперативного диагноста, чтобы понимать масштаб катастрофы и ориентировочную стоимость ремонта до того, как мастера на СТО начнут выставлять счёт.
Архитектура эксперимента: Пошаговый промптинг (Decomposition)
Главная ошибка большинства пользователей при работе с ИИ — попытка скормить модели всё и сразу в одном сообщении. В сложных технических задачах это приводит к путанице в контекстном окне и галлюцинациям. Мы пошли по пути пошаговой декомпозиции.
Шаг 1: Инициализация роли (System Prompt)
Чтобы отсечь общие фразы из Википедии, модели нужно задать жесткие рамки поведения и профессиональный бэкграунд.
Я загрузил первое фото общего плана и отправил следующий вводный промпт:
Запрос: «Ты — прожжённый автомеханик с 30-летним стажем, специалист по ходовой части. Твоя задача — оценить масштаб поломки по фотографии. Отвечай технически точно, используй профессиональный сленг, но выделяй самые критические узлы, которые могли выйти из строя. Никакой "воды"».
Шаг 2: Запрос на детализацию со стороны ИИ
Модель отработала роль идеально. Вместо того чтобы гадать по общему размытому кадру, она локализовала зону поиска и сама запросила макроснимки:
Ответ ИИ: «Так, тут сходу видно, что машина упала на брюхо. По такому ракурсу точно сказать нельзя — это либо срез болтов, либо развалился ступичный, либо вылетела шаровая. А ну-ка засунь телефон поглубже за колесо, сфотографируй мне нижнюю часть ступицы, поворотный кулак и рычаг крупным планом. Мне нужно видеть место разрыва».
Шаг 3: Микродиагностика по макроснимку
Я залез под крыло, сделал детальный снимок узла подвески крупным планом и отправил модели без дополнительного текста.
Ответ модели на основе визуального анализа:
Ответ ИИ: «Всё, тут без вариантов. У тебя вырвало палец из шаровой опоры. Посмотри на фото — четко виден зазор, палец просто выскочил из изношенного пластикового вкладыша. Скорее всего, пыльник порвался давно, туда попала грязь, и её сточило. Радуйся, что это случилось на парковке на 5 км/ч при вывороте руля, а не на трассе на сотке. Заказывай эвакуатор, новую шаровую в сборе с рычагом (или отдельно, смотря какая прессовка) и вези в сервис».
Верификация результата
Спустя час машина оказалась на подъемнике в автосервисе. Диагноз мастера-приемщика совпал с вердиктом ИИ до единого слова: «Вылетел палец из шаровой опоры, хорошо, что на парковке».
Когда я показал механику скриншоты переписки с нейросетью, где модель пошагово вела меня от общего кадра к макроснимку конкретного зазора, у человека случился легкий когнитивный диссонанс.
Выводы:
Мультимодальность работает в реальном секторе. Современные Vision-модели способны распознавать специфические технические повреждения (зазоры, люфты, трещины), если правильно сфокусировать их «взгляд».
Контекст решает всё. Без жесткого ограничения роли (System Prompt) модель выдала бы стандартный дисклеймер в стиле «Обратитесь к специалисту» и список из 20 возможных причин.
Интерактивность повышает точность. Алгоритм, при котором ИИ сам запрашивает у пользователя нужные ракурсы данных, минимизирует процент ошибок.
Если вам интересна тема практического применения ИИ, No-Code автоматизации и работа с промптами для решения повседневных и бизнес-задач, подписывайтесь на мой Telegram-канал. Там я каждый день делюсь готовыми шаблонами промптов, рабочими кейсами и лайфхаками по приручению нейросетей без лишней воды.
А как вы используете ИИ в нестандартных бытовых ситуациях? Был ли опыт технической диагностики? Давайте обсудим в комментариях.