Дал ИИ реальный датасет с ошибками и попросил найти в нём то, что я сам искал два дня. Вот что он нашёл, а что пропустил

Демо-примеры анализа данных в рекламе ИИ-инструментов всегда идеально чистые: понятные колонки, отсутствие пропусков, очевидные закономерности. Я взял реальный рабочий датасет — с дублями, пропусками и опечатками в категориях — тот самый, в котором два дня назад руками нашёл аномалию, — и посмотрел, справится ли ИИ быстрее и не хуже.

Датасет и задача

Выгрузка продаж интернет-магазина за квартал, 12 000 строк, с типичными для реальных данных проблемами: часть заказов задублирована из-за сбоя в CRM, в поле «регион» вперемешку названия городов и областей, в 3% строк отсутствует сумма заказа. Задача, которую я решал вручную два дня назад: найти причину аномального падения среднего чека в одном из месяцев.

Что нашёл ИИ за 12 минут

Загрузил датасет с промптом «найди причину падения среднего чека в марте» без подсказок про дубли или проблемы с данными. Модель самостоятельно обнаружила задвоение части заказов и предположила, что это искажает расчёт среднего чека — верная гипотеза, до которой я сам дошёл только на второй день, перепробовав сначала три других объяснения. Модель также предложила пересчитать метрику после дедупликации и показала обновлённый график — совпадает с тем, что я получил вручную.

Что ИИ пропустил

Модель не заметила вторую, менее очевидную причину: в марте резко вырос процент заказов из региона с исторически низким средним чеком (акция, о которой не было явных упоминаний в данных, только в поле "промокод"). Я нашёл эту причину только потому, что знал о промо-кампании заранее и целенаправленно проверил гипотезу — модель не могла это учесть, потому что не имела контекста за пределами самой таблицы.

Спорный тезис: ИИ хорош там, где ответ можно вывести из самих данных, и бесполезен там, где нужен контекст снаружи

Разница между найденной и пропущенной причиной — это разница между задачей «найди паттерн в данных» и задачей «свяжи паттерн с внешним событием, о котором в данных нет прямого упоминания». Первое — сильная сторона моделей, они статистически хороши в поиске аномалий. Второе требует знания контекста бизнеса, которого нет ни в одной таблице, — и здесь аналитик с опытом работы в конкретной компании выигрывает не потому что «умнее», а потому что знает то, чего нет в датасете.

Как использовать ИИ на реальных, а не демо-данных

  • Не убирайте дубли и пропуски перед тем, как отдать данные модели, — способность находить и объяснять эти проблемы сама по себе полезный сигнал.
  • Формулируйте задачу через вопрос про бизнес-метрику («почему упал средний чек»), а не через техническую операцию («найди аномалии») — так модель предлагает более релевантные гипотезы.
  • Всегда проверяйте, есть ли внешний контекст (акции, изменения ассортимента, сезонность), который не отражён в самой таблице, — модель никогда не спросит про него сама, если явно не подсказать, что стоит поискать вовне.

Полный промпт, который использовал, вместе со скриншотами всего диалога и итоговым графиком до и после дедупликации выложил в канале.

Что не поместилось в статью

За кадром остался тест на втором датасете — с временными рядами и сезонностью, где модель повела себя иначе и один раз сделала откровенно неверный вывод, уверенно его аргументировав. Этот разбор ошибки выложу отдельно в Telegram.