Как мы тестировали свой метод психологической саморегуляции — и почему сами усложнили себе жизнь контрольной группой
Около полутора лет назад я разработал метод саморегуляции «Нейроприсутствие» и продавал его как обычный инфопродукт: аудиопрактика, приложение, книга. Недавно решил не полагаться только на отзывы («9 из 10 довольны!»), а проверить метод исследованием — раз уж строю на нём бизнес и личный бренд. Делюсь методологией, результатами и — что важнее для продуктовой аудитории — честными ограничениями данных. — Дизайн эксперимента Взял две группы по 13 человек: — группа практики — 30 дней занималась методом — группа ожидания (waitlist control) — 30 дней ничего не делала, просто ждала старта своей группы Замерял по двум стандартизированным психометрическим шкалам — GAD-7 (тревожность) и PHQ-9 (депрессивная симптоматика). Это не самодельные опросники, а инструменты, которыми реально пользуются в клинической практике. — Зачем контрольная группа, если можно просто "до/после" Потому что "до/после" не отличает эффект продукта от эффекта времени, внимания или простого прохождения теста дважды. Без контроля любой инфопродукт может показать красивую динамику просто потому, что людям вообще стало легче за месяц — по десяткам причин, не связанных с продуктом. — Результаты Группа практики: — Тревожность: 13,08 → 7,77 (p=0.0003) — Депрессивная симптоматика: 12,23 → 8,00 (p=0.0221) — Общий дистресс: 25,31 → 15,77 (p=0.0017) Группа ожидания: — Тревожность: 12,00 → 11,54 (p=0.65, не значимо) — Депрессивная симптоматика: 17,31 → 17,31 (без изменений) — Общий дистресс: 29,31 → 28,85 (не значимо) Межгрупповое сравнение (это ключевая метрика, не внутригрупповая): по тревожности и общему дистрессу разница между группами статистически значима (p=0.0027 и p=0.0107 соответственно). По депрессивной симптоматике — на грани значимости (p=0.06), формально не дотягивает. — Продуктовая метафора: retention решает Отдельно посмотрел на связь результата с частотой использования — как в любом продукте, retention оказался ключевой переменной. Разбил группу практики на тех, кто занимался не реже чем через день, и тех, кто реже: — Активные пользователи (N=7): тревожность −53,5% (p=0.0009), депрессивная симптоматика −51,2% (p=0.0231) — Нерегулярные (N=6): тревожность −27,4% (p=0.09, не значимо), депрессивная симптоматика −17,7% (p=0.42, не значимо) Оговорка для тех, кто разбирается в статистике: это post-hoc анализ, деление на подгруппы не было заложено в исходный дизайн, а сами подгруппы очень маленькие. Это не доказанная зависимость "доза-эффект", а предварительный сигнал. Но с точки зрения продукта вывод практический: вся ценность механики удержания (напоминания, стрики, трекер) — не декоративная фича, а буквально то, что определяет, получит ли пользователь результат. — Воронка вовлечения — тоже данные Из 55 изначально записавшихся до конца дошли 13 человек (52% от тех, кто хотя бы ознакомился с материалами). В группе ожидания — точно такая же завершаемость, 52% из 25. Это интересно само по себе: отсев одинаковый в обеих группах, значит сам продукт не отпугивает сильнее, чем обычное ожидание — люди в принципе неравномерно доводят до конца любые обязательства, не только мои. — Почему я это всё публикую, а не просто беру цифры покрасивее Я — автор метода. У меня есть прямой коммерческий интерес в том, чтобы результат выглядел хорошо. Раскрываю это explicitly в самом научном отчёте как конфликт интересов — потому что если бы это нашли за меня, доверия к остальным цифрам не осталось бы вообще. Другие ограничения, которые стоит держать в голове: — выборка небольшая (13 и 13, для анализа по частоте — 7 и 6) — распределение по группам не рандомизировано — сбор и обработку данных вёл сам, без независимого аналитика — нет отсроченного замера через 1-3 месяца — не знаем, держится ли эффект Полная методология, все цифры, ограничения и приложение со статистической проверкой устойчивости результатов — в открытом отчёте на Zenodo (ссылка в комментариях). — Что дальше Следующий этап — Waitlist Crossover: участники группы ожидания тоже пройдут практику, с повторным замером. Это даст воспроизводимость на том же контингенте и увеличит выборку без необходимости искать новых людей с нуля. Если у кого-то есть опыт постановки подобных пилотов на своих продуктах — интересно сравнить подходы к дизайну контрольных групп в условиях, когда ты и разработчик, и исследователь одновременно.