DML против PSM: как оценивать нерандомизированные эксперименты быстрее и надёжнее?

platonpd только что DML против PSM: как оценивать нерандомизированные эксперименты быстрее и надёжнее? Средний 6 мин 47 Блог компании RWB Машинное обучение * Статистика в IT Математика * Кейс Привет, Хабр! Давайте на...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Вот важная новость с фронта ИИ: platonpd только что DML против PSM: как оценивать нерандомизированные эксперименты быстрее и надёжнее? Средний 6 мин 47 Блог компании RWB Машинное обучение * Статистика в IT Математика * Кейс Привет, Хабр! Давайте на примере кейса с рекламой в ПВЗ Wildberries разберемся в двойном машинном обучении (DML) и методе псевдорандомизации (PSM).
Меня зовут Платон Попов, я дата-аналитик в команде A/B-платформы RWB. В нашей команде я занимаюсь задачами из области причинно-следственного анализа (Causal Inference) и методами понижения дисперсии. В этой статье расскажу о самом кейсе и объясню, почему для него не подошёл классический t-тест.
Технические детали
Покажу, как мы учитывали спутывающие факторы с помощью Propensity Score Matching (PSM), почему этого оказалось недостаточно и почему в итоге перешли к Double Machine Learning (DML). В конце сравним результаты и обсудим наш план выкатки метода оценки нерандомизированных экспериментов в промышленный масштаб. Какую рекламу видит аудитория в ПВЗСхема рекламы в ПВЗС одной стороны были посетители пунктов выдачи, чьи интересы мы считывали.
С другой стороны — продавцы, которые задавали таргеты для кампании и выбирали рекламные материалы для показа покупателям. С помощью механизма сопоставления (Matcher) мы сравнивали интересы пользователей с выбранными таргетами и показывали подходящую рекламу на экранах в ПВЗ. Наша гипотеза: таргетированная реклама должна увеличивать количество купленных товаров и GMV на пользователя.
Почему нельзя ограничиться t-тестом? На первый взгляд, всё решается по старинке. Сравниваем средние значения метрик в тестовой и контрольной группах, и мы великолепны!
Отраслевые последствия
Но в нашем нестандартном сеттинге есть две проблемы: сетевые эффекты и спутывающие переменные (конфаундеры). Первая проблема — сетевые эффекты. Пользователи могли посещать ПВЗ с рекламными экранами и без одновременно.
А также в контроль могут попасть пользователи, которые видели чужую рекламу. Например, ожидая своей очереди, человек мог заметить рекламный ролик и подвергнуться воздействию (Treatment) на экране, и контрольная группа уже переставала быть «чистой». Мы боролись с сетевыми эффектами двумя способами.
Во-первых, в качестве единицы рандомизации выбрали не пользователя вообще, а пользователя в конкретном ПВЗ. Во-вторых, распределили группы, чтобы исключить влияние чужой рекламы:в тест попадали пользователи, которые видели таргетированную рекламу,в контроль — пользователи, посетившие ПВЗ в дни, когда не было рекламы. Следующая проблема — конфаундеры.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.






