Что аналитик данных делает в обычный вторник: разбор рабочего дня без пафоса
Когда человек читает вакансию аналитика данных, он видит Python, SQL, машинное обучение, A/B-тесты, работу с большими массивами. Складывается картинка: ты сидишь и добываешь инсайты.
Я расскажу, как выглядит обычный вторник. Без инсайтов.
Утро: смотрим, не сломалось ли
Первое, что открывается, — дашборды. Онлайн-мониторинг объёмов выдач, approval rate, дефолты. Задача простая: увидеть аномалию раньше, чем её увидит бизнес.
Половина работы аналитика — заметить, что что-то поехало. Число упало вдвое. Дальше начинается расследование: это реально упали выдачи, или отвалился источник данных, или кто-то поменял логику расчёта и забыл сказать.
По моему опыту, в трети случаев виноваты данные, а не бизнес.
День: SQL и автоматизация рутины
Основной инструмент — SQL.
Запросы бывают двух видов. Первый — быстрый, посмотреть на данные: что там за значения, какие средние, есть ли пропуски. Такой запрос сегодня быстрее попросить написать нейросеть, чем печатать самому. Второй — большой запрос под целый отчёт, где логика на несколько экранов. Вот его нейросеть за вас не соберёт, потому что она не знает вашу схему данных и ваши бизнес-договорённости.
Отдельный кусок работы — автоматизация. Ежедневная отчётность, которая раньше собиралась руками, превращается в скрипт на Python. Расчёт показателей — возвратность, дефолтность, маржинальность займов — тоже уезжает в автоматику. Один раз пишешь, дальше оно считается само, а вы занимаетесь другим.
Из смешного: один из моих скриптов занимался тем, что вычищал из внутренних баз уволившихся сотрудников. Не самая интеллектуальная задача в мире, зато экономила людям время каждую неделю.
Инструменты, которые реально были в работе
Python, SQL, Superset для дашбордов, Greenplum и ClickHouse как источники данных, Adjust и AppsFlyer для мобильной атрибуции.
Обратите внимание, чего в этом списке нет. Нет глубокого машинного обучения. Нет нейросетевых моделей в проде. В огромном количестве вакансий, которые называются «аналитик данных», ML не используется вообще.
Пример настоящей аналитической задачи
Самая содержательная задача, которая у меня была, звучала так: имеет ли смысл платить за возврат пользователей через ретаргетинг?
Логика вопроса. Мы платим за то, что человек вернулся в приложение. Но часть этих людей вернулась бы и сама, без всякой рекламы. За них мы платим зря. Вопрос: какая часть?
Я разбирал данные и пришёл к выводу, который заказчику не понравился: без корректно поставленного A/B-теста инкрементальный эффект ретаргетинга честно не измеряется. Можно нарисовать красивый график и сделать вид, что измерили. Но это будет самообман, а бюджет реальный.
Вот это и есть работа аналитика. Не «найти инсайт», а сказать бизнесу, что он меряет не то, чем думает.
Что из этого следует для тех, кто вкатывается
Учить надо в первую очередь то, что вы будете делать каждый день. Это SQL, включая оконные функции. Дальше Python в объёме автоматизации и обработки данных. Дальше BI-инструмент, любой, логика у них общая. Дальше метрики и умение объяснять их человеку, который в данных не разбирается.
Машинное обучение потом, и только если вы целитесь в Data Science. Я на старте потратил время на ML-модуль и на большую задачу по ООП. ООП за пятьдесят с лишним технических собеседований у меня спросили пару раз, на работе он пока не пригодился ни разу.
Вопрос к тем, кто работает аналитиком: какая доля вашего времени уходит на SQL и отчётность, а какая на что-то содержательное? У меня было примерно 70 на 30.