Метрики · 13 сентября 2026 г.
Статистическая мощность опроса: ошибки I и II рода и как их не путать
Статистическая мощность — это вероятность теста обнаружить реальный эффект, если он действительно существует в генеральной совокупности, а не только в конкретной выборке. Мощность напрямую связана с двумя видами ошибок: ошибка I рода — заявить об эффекте, которого на самом деле нет (ложное срабатывание), ошибка II рода — не заметить эффект, который на самом деле есть (пропуск). Низкая мощность, типичная для опросов с маленькой выборкой, означает, что тест систематически рискует ошибкой II рода: результат «статистически незначимо» в таком случае не доказывает отсутствие эффекта, а часто означает лишь то, что выборки не хватило, чтобы его заметить. Ниже — как мощность связана с размером выборки и эффектом, и что делать с результатом «незначимо» на маленькой выборке.
Ошибка I рода: увидеть эффект там, где его нет
Ошибка I рода (false positive, α) — это ситуация, когда тест показывает статистически значимый результат, а на самом деле в генеральной совокупности разницы нет, и наблюдаемый эффект — случайное совпадение конкретной выборки. Стандартный порог допустимой вероятности такой ошибки — уровень значимости α, обычно 0,05, то есть исследователь заранее соглашается на пять шансов из ста ошибочно увидеть эффект там, где его нет, ради возможности вообще делать статистические выводы по выборке, а не по всей генеральной совокупности.
Практическое следствие: чем больше независимых статистических тестов проводится на одних и тех же данных опроса — сравнение по десяткам сегментов, вопросов, срезов, — тем выше суммарная вероятность хотя бы одной ошибки I рода среди всех тестов, даже если каждый отдельный тест использует стандартный порог 0,05. Эта проблема множественных сравнений и способ её скорректировать разобраны отдельно.
Ошибка II рода: не заметить эффект, который есть
Ошибка II рода (false negative, β) — обратная ситуация: тест не находит статистически значимой разницы, хотя в генеральной совокупности реальный эффект существует. Причина такой ошибки почти всегда одна и та же — недостаточная статистическая мощность теста: выборка слишком мала или эффект слишком слаб, чтобы тест мог надёжно его различить на фоне случайного шума конкретной выборки.
Ошибка II рода опаснее ошибки I рода тем, что реже осознаётся как ошибка: результат «различий не обнаружено» подсознательно интерпретируется как «различий нет», хотя формально тест лишь не смог набрать достаточно доказательств при имеющемся размере выборки. Решение отказаться от изменения, потому что «опрос показал отсутствие эффекта», при маленькой выборке и низкой мощности может быть основано именно на этой ошибке, а не на реальном отсутствии разницы. Дороже всего эта путаница обходится там, где по единственному пилотному опросу закрывают перспективное направление навсегда, вместо того чтобы честно признать: имеющихся данных пока недостаточно для уверенного вывода в любую сторону.
| В реальности эффект есть | В реальности эффекта нет | |
|---|---|---|
| Тест показал значимость | Верное решение | Ошибка I рода (α, ложное срабатывание) |
| Тест не показал значимости | Ошибка II рода (β, пропуск) | Верное решение |
Что такое статистическая мощность и от чего она зависит
Статистическая мощность теста определяется как единица минус вероятность ошибки II рода (1 − β) — иначе говоря, это вероятность правильно обнаружить реальный эффект, если он существует. Стандартный ориентир, принятый в большинстве прикладных исследований, — мощность не ниже 0,8, то есть тест должен обнаруживать реальный эффект как минимум в 80% случаев при повторении исследования.
Мощность зависит от четырёх взаимосвязанных величин: размера выборки (чем больше, тем выше мощность), размера реального эффекта (чем эффект крупнее, тем легче его заметить при том же размере выборки), выбранного уровня значимости α (более строгий порог, например 0,01 вместо 0,05, снижает мощность при прочих равных) и разброса данных — дисперсии (чем данные однороднее, тем проще увидеть в них систематическую разницу на фоне случайного шума).
Расчёт размера выборки под нужную мощность
Практическая задача, которую решает анализ мощности, — определить заранее, до сбора данных, сколько респондентов нужно опросить, чтобы с достаточной вероятностью (обычно 0,8) обнаружить эффект заданного размера при заданном уровне значимости. Для этого используют специализированные калькуляторы power analysis — например, функцию pwr в R, модуль statsmodels.stats.power в Python или отдельные онлайн-калькуляторы для конкретного вида теста (t-критерий, ANOVA, критерий хи-квадрат).
На входе такого расчёта нужны три величины из четырёх, чтобы получить четвёртую: обычно фиксируют желаемую мощность (0,8) и уровень значимости (0,05), задают ожидаемый размер эффекта — либо по данным пилотного опроса, либо по минимально значимой для бизнеса разнице, — и получают на выходе требуемый размер выборки. Расчёт нужного числа респондентов под конкретную цель опроса подробно разобран в отдельной статье, где мощность — лишь одна из вводных наряду с погрешностью и доверительным интервалом.
Разобранный пример: пилотный тест изменения на 40 респондентах
Представим, что компания меняет формулировку одного вопроса в форме обратной связи, ожидая, что доля положительных ответов вырастет с 40% до 50% — разница в десять процентных пунктов, которая для бизнеса точно имеет значение. Пилотный опрос проводится на 20 респондентах в каждой из двух групп — старая и новая формулировка, — и разница в выборке действительно оказывается в районе десяти пунктов, но критерий хи-квадрат по этим 40 наблюдениям не показывает статистической значимости на уровне 0,05. Цифры в примере условные и нужны только для того, чтобы показать формат.
Расчёт мощности задним числом по этим же данным показал бы: при выборке 20 на группу и ожидаемой разнице в 10 процентных пунктов мощность теста для обнаружения такого эффекта — около 15-20%, то есть даже если реальный эффект существует именно такого размера, тест c вероятностью 80-85% его не заметит просто из-за нехватки данных. Незначимый результат здесь — почти гарантированное следствие маленькой выборки, а не признак того, что новая формулировка не работает.
Правильный вывод из этого пилота — не «изменение не сработало», а «пилотная выборка была слишком мала, чтобы обнаружить эффект такого размера с достаточной надёжностью». Предварительный расчёт мощности до запуска пилота показал бы, что для обнаружения разницы в 10 процентных пунктов при базовой доле 40% и мощности 0,8 нужно порядка 90-100 респондентов в каждой группе — почти впятеро больше, чем было фактически собрано.
Почему маленькие опросы систематически рискуют ошибкой II рода
Опросы с выборкой в 30-50 респондентов на группу — обычное дело для внутренних HR-исследований, пилотных тестов и узких B2B-сегментов — почти всегда имеют низкую статистическую мощность для обнаружения умеренных и тем более небольших эффектов. Практическое следствие: незначимый результат t-критерия на такой выборке с высокой вероятностью говорит не об отсутствии эффекта, а о том, что мощности теста просто не хватило его заметить.
Эта асимметрия создаёт систематическое искажение в решениях, принимаемых по итогам маленьких опросов: изменения, которые реально работают, но дают умеренный эффект, регулярно отбраковываются как «не показавшие статистической значимости», хотя причина отказа — не отсутствие эффекта, а недостаточная выборка для его обнаружения. Осознание этой асимметрии — весомый довод в пользу увеличения выборки там, где решение достаточно важно, чтобы не полагаться на пилотный опрос с 30 респондентами.
«Незначимо» не значит «эффекта нет»
Формулировка «различий не обнаружено» и формулировка «различий нет» — не синонимы, хотя на практике их часто путают в отчётах по опросам. Статистический тест по своей конструкции не умеет доказывать отсутствие эффекта — он умеет только отвергать или не отвергать гипотезу об отсутствии эффекта на основе имеющихся данных, и «не отвергнуть» — это не то же самое, что «доказать верной».
Корректная формулировка результата незначимого теста — «на имеющейся выборке статистически значимой разницы не обнаружено», а не категоричное «разницы нет». Разница в формулировке не бюрократическая: первая честно признаёт ограничение мощности теста и оставляет пространство для вывода «нужна выборка больше», вторая закрывает вопрос как решённый там, где он на самом деле остался открытым из-за недостатка данных.
Мощность и размер эффекта: почему они всегда рядом
Статистическая значимость сама по себе не говорит, насколько велик и практически важен обнаруженный эффект — при достаточно большой выборке даже ничтожно малая, не имеющая практического значения разница станет статистически значимой. Размер эффекта (эффект размером в стандартных отклонениях, разность долей, коэффициент корреляции) отвечает на другой вопрос — насколько велика разница по существу, — и разбирается отдельно в статье про размер эффекта.
Практическое правило для отчёта: значимость отвечает на вопрос «есть ли эффект достаточно надёжно, чтобы не списать его на случайность выборки», а размер эффекта — на вопрос «стоит ли вообще что-то с ним делать». Приводить в отчёте оба показателя вместе — значимость и размер эффекта — куда информативнее, чем ограничиваться одним p-значением, потому что читатель отчёта тогда видит одновременно и надёжность результата, и его практический вес.
Мощность и A/B-тестирование продуктовых изменений
Логика статистической мощности одинаково применима и к разовому опросу, и к A/B-тесту продуктового изменения, где метрикой служит доля респондентов, ответивших положительно на встроенный опрос удовлетворённости. Частая практическая ошибка — останавливать A/B-тест раньше срока, как только один из вариантов случайно показывает значимую разницу, не дождавшись расчётного размера выборки: такая ранняя остановка резко повышает фактическую вероятность ошибки I рода по сравнению с заявленным уровнем значимости 0,05, потому что тест по сути проверяется много раз подряд по мере накопления данных, а не один раз по плану.
Правильная практика — определить нужный размер выборки заранее по расчёту мощности и не подводить итог теста до того, как этот размер набран, независимо от того, насколько соблазнительно выглядит промежуточный результат. Для тестов, где раннюю остановку по бизнес-причинам всё же нужно предусмотреть, существуют специальные последовательные методы анализа (sequential testing) с встроенной поправкой на многократную проверку данных, но это отдельная тема, выходящая за рамки базового расчёта мощности для одного среза.
Практические ориентиры для планирования опроса
| Ситуация | Риск | Что делать |
|---|---|---|
| Маленькая выборка (< 50 на группу), эффект не найден | Высокий риск ошибки II рода | Не делать вывод «эффекта нет», планировать выборку побольше |
| Очень большая выборка, найден крошечный эффект | Риск переоценить практическую значимость | Смотреть на размер эффекта, а не только на p-значение |
| Много сравнений на одних данных, много значимых результатов | Риск ошибки I рода из-за множественных сравнений | Применить поправку на множественные сравнения |
| Планируется важное решение по итогам опроса | Любая из ошибок дорого стоит | Посчитать нужный размер выборки заранее, до сбора данных |
Типичные ошибки
- Интерпретировать незначимый результат теста как доказательство отсутствия эффекта.
- Планировать размер выборки «на глаз» или по бюджету, не считая мощность заранее.
- Считать мощность постфактум по уже полученным данным вместо планирования до сбора.
- Гнаться только за статистической значимостью, игнорируя размер эффекта и его практическую важность.
- Снижать уровень значимости до 0,01 «для надёжности», не осознавая, что это одновременно снижает мощность теста и повышает риск ошибки II рода.
- Определите минимальный размер эффекта, который практически важен для решения, до сбора данных.
- Посчитайте необходимый размер выборки калькулятором мощности при желаемой мощности 0,8 и уровне значимости 0,05.
- Соберите выборку не меньше расчётной, а не столько, сколько получилось собрать за отведённое время.
- При незначимом результате на маленькой выборке формулируйте вывод как «эффект не обнаружен на имеющихся данных», а не «эффекта нет».
- Всегда приводите размер эффекта рядом со значимостью, а не полагайтесь на одно p-значение.
С чего начать
Перед следующим опросом, по итогам которого планируется важное решение, посчитайте нужный размер выборки калькулятором мощности, задав минимальный интересный для бизнеса размер эффекта, а не считайте выборку постфактум по факту откликов. Если предыдущий опрос дал незначимый результат на маленькой выборке, вернитесь к нему с вопросом о мощности, прежде чем делать вывод, что изменение не сработало. В сервисе «До Сути» опрос собирается с любым нужным числом респондентов, а расчёт требуемого размера выборки и мощности теста — задача, которую решают до запуска опроса, а не после. Привычка планировать выборку заранее, а не набирать её по мере поступления ответов, окупается один раз и затем экономит время на каждом следующем опросе того же типа, потому что расчёт для похожей задачи почти всегда можно переиспользовать с небольшой корректировкой под новый ожидаемый размер эффекта и новую целевую аудиторию, а сама привычка задавать себе вопрос о мощности до запуска очередного опроса со временем становится такой же естественной и рутинной частью планирования, как формулировка самих вопросов анкеты.
Частые вопросы
Статистическая мощность — это вероятность теста обнаружить реальный эффект, если он действительно существует в генеральной совокупности, а не только в конкретной выборке. Она равна единице минус вероятность ошибки II рода (1 − β), и стандартный ориентир для большинства прикладных исследований — мощность не ниже 0,8. Мощность зависит от размера выборки, размера самого эффекта, выбранного уровня значимости и разброса данных: чем больше выборка и крупнее эффект, тем выше мощность при прочих равных.
Ошибка I рода — это ложное срабатывание: тест показывает статистически значимый результат, хотя на самом деле в генеральной совокупности эффекта нет, а наблюдаемая разница — случайность конкретной выборки. Ошибка II рода — обратная ситуация, пропуск: тест не находит значимой разницы, хотя реальный эффект существует, обычно из-за недостаточной статистической мощности при маленькой выборке. Первая ошибка контролируется уровнем значимости α, вторая — размером выборки и мощностью теста.
Нет, и это одна из самых частых методологических ошибок при чтении результатов опроса. Статистический тест по конструкции не умеет доказывать отсутствие эффекта — он лишь не находит достаточно доказательств против гипотезы об его отсутствии на имеющейся выборке. На маленькой выборке с низкой статистической мощностью незначимый результат часто означает не отсутствие эффекта, а то, что выборки не хватило его обнаружить. Корректная формулировка — «на имеющихся данных значимой разницы не обнаружено», а не категоричное «разницы нет».
Расчёт выполняется специализированным калькулятором анализа мощности — например, пакетом pwr в R или модулем statsmodels.stats.power в Python, — куда вводят три из четырёх величин: желаемую мощность (обычно 0,8), уровень значимости (обычно 0,05) и ожидаемый размер эффекта, полученный из пилотного опроса или заданный как минимально важная для бизнеса разница. На выходе калькулятор возвращает четвёртую величину — требуемый размер выборки. Считать этот расчёт нужно до сбора данных, а не постфактум по уже собранной выборке.