Калькулятор размера выборки для A/B-теста

Размер выборки — сколько пользователей нужно в каждом варианте, чтобы заметить эффект заданного размера. При конверсии 5% и цели поймать рост на 10% (до 5,5%) при значимости 95% и мощности 80% нужно около 31 тыс. пользователей на вариант.

Как посчитать размер выборки для A/B-теста?

Посчитайте на своих числах
Пользователей на вариант
31 234
Всего в тесте
62 468
Длительность
16 дн.

Реалистичная длительность. Не останавливайте тест раньше: «подглядывание» за значимостью даёт ложные победы.

Что означают параметры?

  • Текущая конверсия — показатель контрольной группы. Чем он ниже, тем больше нужна выборка.
  • Минимальный эффект (MDE) — самое маленькое изменение, которое вы хотите уметь заметить. Относительный эффект 10% означает рост с 5% до 5,5%. Уменьшите MDE вдвое — выборка вырастет примерно вчетверо.
  • Значимость — насколько вы готовы ошибиться, приняв случайность за эффект. 95% — стандарт: ложная победа в одном тесте из двадцати.
  • Мощность — вероятность заметить эффект, если он есть. 80% — стандарт: в одном случае из пяти реальный эффект останется незамеченным.

По какой формуле считается выборка?

Для сравнения двух долей используется формула

n = (z1−α/2·√(2p̄(1−p̄)) + z1−β·√(p₁(1−p₁) + p₂(1−p₂)))² / (p₂ − p₁)²,

где p₁ и p₂ — конверсии контроля и теста, p̄ — их среднее, z — квантили нормального распределения (1,96 для 95% значимости и 0,84 для 80% мощности). Калькулятор даёт тот же порядок чисел, что и распространённые онлайн-калькуляторы вроде калькулятора Эвана Миллера.

Где чаще всего ошибаются?

  • Останавливают тест, как только стало «значимо». Если заглядывать в результаты каждый день, вероятность ложной победы вырастает в разы. Размер выборки фиксируют заранее и дожидаются его.
  • Гоняют тест меньше недели. Поведение в будни и выходные различается, и короткий тест ловит не эффект, а день недели.
  • Выбирают слишком маленький MDE. Тест, рассчитанный на эффект 1%, на небольшом трафике будет идти год. Проверяйте изменения, которые могут дать заметный эффект.
  • Считают выборку от всех посетителей, а не от тех, кто увидел изменение. Если тестируется шаг оплаты, выборка — это те, кто дошёл до оплаты.

Когда тест закончен, проверить, значим ли результат, поможет калькулятор значимости A/B-теста.

Разобраться на практике

Продуктовая аналитика 2.0

Углубленный курс продуктовой аналитики с Python, ML и продвинутыми техниками анализа

Посмотреть курс