Как на бизнес-тренинге по продажам студенты хитрили с GPT
На тренингах по продажам я все чаще замечаю одну довольно любопытную вещь. ChatGPT особенно хорошо справляется с теми заданиями, где нужно воспроизвести знакомую структуру, но начинает давать сбой там, где требуется понять, чего именно не хватает в конкретной ситуации. Очень наглядно это видно на упражнениях по SPIN, методологии Нила Рэкхэма.
Один из кейсов на тренинге устроен достаточно просто. Участники получают описание клиента и ситуации, в которой находится продавец. Информации в кейсе заведомо недостаточно, и группе дается восемь слотов под вопросы, которые она хотела бы задать клиенту. Вопросы можно формулировать в логике SPIN: ситуационные, проблемные, извлекающие и направляющие.
На поверхности это выглядит как упражнение на умение задавать вопросы разных типов. Но смысл у него немного другой. Восемь вопросов — это ограниченный ресурс, и то, как группа распределяет его между четырьмя типами SPIN, само по себе становится результатом анализа кейса.
Если участники формулируют четыре или пять ситуационных вопросов, значит, по их мнению, им прежде всего не хватает фактов: кто принимает решение, как устроен процесс, какие объемы, сроки, ограничения, какие решения используются сейчас. Если большая часть вопросов проблемные, значит, фактическая сторона кейса кажется более или менее понятной, но группа не видит, где именно у клиента находится проблема и есть ли у него вообще мотив что-либо менять.
Другая группа может почти не задавать ситуационных вопросов и сразу перейти к извлекающим. Это означает, что проблему она предполагает, но пока не понимает ее масштаба и последствий: насколько она влияет на деньги, сроки, риски, производство, качество, отношения с заказчиком. Наконец, большое количество направляющих вопросов может показывать, что участникам более-менее ясны и ситуация, и проблема, но непонятно, насколько клиент сам верит в определенный способ решения и видит ценность в тех изменениях, которые ему предлагают.
Поэтому у разных групп почти никогда не получается одинаковое распределение. И это нормально. Более того, именно в этом и начинается самое интересное обсуждение. Почему вы решили потратить четыре вопроса на ситуацию? Почему считаете, что проблема уже понятна? Что вы хотите выяснить этим извлекающим вопросом? Как ответ клиента изменит дальнейший ход разговора? То есть обсуждаются уже не столько формулировки, сколько модель ситуации, которую группа построила у себя в голове.
А потом в упражнении появляется ChatGPT.
Самый естественный способ его использовать — скопировать кейс и написать что-нибудь вроде: «Сформулируй восемь вопросов клиенту по методике SPIN». И довольно часто получается очень аккуратный результат: два ситуационных вопроса, два проблемных, два извлекающих и два направляющих. Все красиво сформулировано, категории подписаны, вопросы действительно похожи на соответствующие типы SPIN. На первый взгляд ответ даже выглядит сильнее того, что написали участники вручную.
Проблема в том, что исходная задача при этом практически не решена.
В SPIN нет никакого правила, согласно которому четыре типа вопросов должны использоваться в равных пропорциях. Более того, смысл именно этого упражнения состоит в обратном: определить, какой информации в данном конкретном кейсе не хватает больше всего, и потратить ограниченное количество вопросов именно на нее.
Если участникам очевидно, как устроена ситуация клиента, но совершенно непонятны последствия его проблемы, нет никакой причины тратить четверть доступных вопросов на ситуацию только потому, что существует буква S. Если мы еще даже не знаем, считает ли клиент происходящее проблемой, странно обязательно задавать два направляющих вопроса о ценности решения только для того, чтобы таблица SPIN выглядела завершенной.
Получается интересная вещь: форма методики соблюдается, а логика методики исчезает.
И вот здесь, на мой взгляд, проявляется гораздо более важная проблема использования ИИ, чем привычные разговоры о фактических ошибках или галлюцинациях. В данном случае ChatGPT может вообще нигде не ошибиться. Каждый из восьми вопросов будет грамматически хорошим, содержательно разумным и правильно отнесенным к своей категории. Ошибка возникает уровнем выше: нейросеть решает задачу классификации там, где человеку нужно было решить задачу диагностики.
Она видит четыре категории и восемь свободных позиций. Самая естественная структура ответа — распределить их симметрично. Человек же должен сначала посмотреть на кейс и решить, где находится главная зона неопределенности. Только после этого имеет смысл выбирать вопросы.
Отсюда, кстати, возникает довольно характерный эффект. Ответ ChatGPT часто выглядит более профессионально, чем ответы людей. Участники написали восемь неидеальных вопросов, где-то спорно сформулировали извлекающий, где-то смешали проблемный и ситуационный. А нейросеть выдала аккуратную структуру: заголовки, категории, нумерацию, ровное распределение. Визуально и стилистически ее ответ выигрывает.
Но если спросить: «Почему именно эти восемь вопросов? Какую гипотезу о клиенте отражает их распределение? Чего конкретно нам не хватает в кейсе?» — выясняется, что за красивой формой решения может не быть.
Это вообще довольно типичный сценарий работы с генеративным ИИ. Мы просим проанализировать риски — получаем пять рисков. Просим преимущества и недостатки — получаем пять преимуществ и пять недостатков. Просим варианты стратегии — получаем три стратегии. Просим восемь вопросов по четырем категориям — получаем два плюс два плюс два плюс два. Симметрия и аккуратность воспринимаются нами как признак продуманности, хотя иногда это просто наиболее удобный способ организовать текст.
Поэтому проблема здесь не в том, что ChatGPT нельзя использовать в подобных упражнениях. Наоборот, использовать его вполне можно, но задачу лучше формулировать иначе. Например: «Изучи кейс. У тебя есть возможность задать клиенту только восемь вопросов. Сначала определи, какой информации критически не хватает: о ситуации, проблемах, последствиях этих проблем или ценности возможного решения. После этого неравномерно распредели восемь вопросов между категориями SPIN и объясни, почему именно такое распределение считаешь оптимальным».
Тогда нейросеть уже вынуждена сначала построить гипотезу. Она может сказать, что фактической информации в кейсе достаточно, но последствия проблемы почти не раскрыты, поэтому большая часть вопросов должна быть извлекающей. Например, один ситуационный, два проблемных, четыре извлекающих и один направляющий. Можно не согласиться с таким распределением, можно спорить с логикой, можно предлагать другой вариант. Но появляется главное — решение о том, чего именно нам не хватает.
Мне кажется, это вообще хороший критерий качества работы с ИИ. Он особенно полезен там, где есть методология, фреймворк или набор категорий. Нейросеть очень легко начинает воспринимать их как форму, которую нужно заполнить, хотя изначально они создавались как инструмент мышления.
В случае со SPIN это видно почти карикатурно. Есть восемь слотов, четыре типа вопросов, и ChatGPT радостно делит восемь на четыре. Получается по два. Формально все выглядит прекрасно, но смысл задания был не в том, чтобы заполнить все категории одинаково. Он был в том, чтобы понять, каких именно восьми ответов нам сейчас не хватает для работы с клиентом.
Поэтому при работе с ИИ я бы все чаще задавал не вопрос «правильно ли оформлен ответ?», а другой: «Какое содержательное решение здесь вообще было принято?». Если выясняется, что никакого решения не было, а категории просто аккуратно заполнены, значит, задача еще не решена — как бы убедительно ни выглядел результат.