Что аналитик данных делает в обычный вторник: разбор рабочего дня без пафоса

Когда человек читает вакансию аналитика данных, он видит Python, SQL, машинное обучение, A/B-тесты, работу с большими массивами. Складывается картинка: ты сидишь и добываешь инсайты.

Я расскажу, как выглядит обычный вторник. Без инсайтов.

Утро: смотрим, не сломалось ли

Первое, что открывается, — дашборды. Онлайн-мониторинг объёмов выдач, approval rate, дефолты. Задача простая: увидеть аномалию раньше, чем её увидит бизнес.

Половина работы аналитика — заметить, что что-то поехало. Число упало вдвое. Дальше начинается расследование: это реально упали выдачи, или отвалился источник данных, или кто-то поменял логику расчёта и забыл сказать.

По моему опыту, в трети случаев виноваты данные, а не бизнес.

День: SQL и автоматизация рутины

Основной инструмент — SQL.

Запросы бывают двух видов. Первый — быстрый, посмотреть на данные: что там за значения, какие средние, есть ли пропуски. Такой запрос сегодня быстрее попросить написать нейросеть, чем печатать самому. Второй — большой запрос под целый отчёт, где логика на несколько экранов. Вот его нейросеть за вас не соберёт, потому что она не знает вашу схему данных и ваши бизнес-договорённости.

Отдельный кусок работы — автоматизация. Ежедневная отчётность, которая раньше собиралась руками, превращается в скрипт на Python. Расчёт показателей — возвратность, дефолтность, маржинальность займов — тоже уезжает в автоматику. Один раз пишешь, дальше оно считается само, а вы занимаетесь другим.

Из смешного: один из моих скриптов занимался тем, что вычищал из внутренних баз уволившихся сотрудников. Не самая интеллектуальная задача в мире, зато экономила людям время каждую неделю.

Инструменты, которые реально были в работе

Python, SQL, Superset для дашбордов, Greenplum и ClickHouse как источники данных, Adjust и AppsFlyer для мобильной атрибуции.

Обратите внимание, чего в этом списке нет. Нет глубокого машинного обучения. Нет нейросетевых моделей в проде. В огромном количестве вакансий, которые называются «аналитик данных», ML не используется вообще.

Пример настоящей аналитической задачи

Самая содержательная задача, которая у меня была, звучала так: имеет ли смысл платить за возврат пользователей через ретаргетинг?

Логика вопроса. Мы платим за то, что человек вернулся в приложение. Но часть этих людей вернулась бы и сама, без всякой рекламы. За них мы платим зря. Вопрос: какая часть?

Я разбирал данные и пришёл к выводу, который заказчику не понравился: без корректно поставленного A/B-теста инкрементальный эффект ретаргетинга честно не измеряется. Можно нарисовать красивый график и сделать вид, что измерили. Но это будет самообман, а бюджет реальный.

Вот это и есть работа аналитика. Не «найти инсайт», а сказать бизнесу, что он меряет не то, чем думает.

Что из этого следует для тех, кто вкатывается

Учить надо в первую очередь то, что вы будете делать каждый день. Это SQL, включая оконные функции. Дальше Python в объёме автоматизации и обработки данных. Дальше BI-инструмент, любой, логика у них общая. Дальше метрики и умение объяснять их человеку, который в данных не разбирается.

Машинное обучение потом, и только если вы целитесь в Data Science. Я на старте потратил время на ML-модуль и на большую задачу по ООП. ООП за пятьдесят с лишним технических собеседований у меня спросили пару раз, на работе он пока не пригодился ни разу.

Вопрос к тем, кто работает аналитиком: какая доля вашего времени уходит на SQL и отчётность, а какая на что-то содержательное? У меня было примерно 70 на 30.