«До Сути»← Все статьи

Метрики · 13 сентября 2026 г.

Поправка на множественные сравнения в опросах: зачем нужен Бонферрони

Проблема множественных сравнений возникает, когда на одних и тех же данных опроса проводится много независимых статистических тестов — сравнение десятков сегментов, вопросов или срезов, — и вероятность хотя бы одного ложного срабатывания растёт с числом тестов, даже если каждый тест по отдельности использует стандартный порог значимости 0,05. При 20 независимых сравнениях шанс получить хотя бы один ложно значимый результат приближается к 64%, даже если реальных различий не существует вовсе. Поправка Бонферрони и менее строгий метод контроля доли ложных срабатываний (FDR, поправка Бенджамини-Хохберга) — два стандартных способа удержать эту вероятность под контролем. Ниже — как считать и когда какую поправку выбирать.

Почему много тестов на одних данных — это проблема

Уровень значимости 0,05, использованный в единственном тесте, означает: если реального эффекта нет, вероятность ошибочно увидеть значимый результат — 5%. Проблема начинается, когда на одном и том же наборе данных опроса выполняется не один, а множество независимых тестов сразу — например, сравнение оценки удовлетворённости по 15 разным демографическим сегментам, или проверка связи NPS с десятком возможных предикторов. У каждого отдельного теста риск ошибки I рода остаётся 5%, но вероятность того, что хотя бы один из многих тестов ошибочно окажется значимым, растёт вместе с их числом.

Формула для оценки этой суммарной вероятности при независимых тестах — 1 минус (1 − α) в степени числа тестов. При пяти независимых тестах вероятность хотя бы одного ложного срабатывания — около 23%, при десяти — около 40%, при двадцати — около 64%. Это означает: если исследователь запускает опрос без реального эффекта и без всякого злого умысла разбивает результаты на двадцать сегментов, почти в двух случаях из трёх хотя бы один сегмент случайно окажется «статистически значимо отличающимся» просто в силу случайности выборки.

P-hacking и HARKing: как проблема возникает на практике

Множественные сравнения редко становятся проблемой из злого умысла — куда чаще они возникают из естественного любопытства аналитика, который, не найдя значимости в основной гипотезе, начинает пробовать разные разрезы данных: по полу, по возрасту, по региону, по каналу привлечения, — пока какой-то один срез случайно не покажет p < 0,05. Эта практика в методологии получила название p-hacking, а последующее объяснение найденного случайного результата правдоподобной историей задним числом — HARKing (hypothesizing after results are known).

Обе практики опасны не потому, что кто-то намеренно подтасовывает данные, а потому что итоговый отчёт выглядит совершенно так же, как честный результат заранее заданной гипотезы: одно p-значение меньше 0,05, аккуратно оформленное в таблицу. Разница видна только в том, сколько всего сравнений было сделано до того, как нашлось значимое, — а эта информация в отчёт обычно не попадает, если исследователь не документирует её сознательно.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Поправка Бонферрони: простой и строгий способ

Поправка Бонферрони — самый простой способ контролировать суммарный риск ошибки I рода: новый порог значимости для каждого отдельного теста получают делением исходного уровня α (обычно 0,05) на число проводимых сравнений. При 10 сравнениях новый порог — 0,005, при 20 — 0,0025, и значимым признаётся только тот результат, чьё p-значение оказывается ниже этого более строгого порога, а не исходных 0,05.

Главное преимущество поправки Бонферрони — простота расчёта и консервативность: она гарантированно удерживает суммарную вероятность хотя бы одной ошибки I рода на уровне не выше исходного α. Главный недостаток — та же консервативность, обёрнутая в проблему: с ростом числа сравнений порог становится настолько строгим, что реальные, содержательно важные эффекты рискуют не пройти этот порог, и поправка Бонферрони резко повышает риск ошибки II рода — пропуска настоящего эффекта.

Число сравненийОбычный порог αПорог после Бонферрони
50,050,01
100,050,005
200,050,0025
500,050,001

FDR и поправка Бенджамини-Хохберга: менее строгая альтернатива

Метод контроля доли ложных срабатываний (False Discovery Rate, FDR), реализованный чаще всего через поправку Бенджамини-Хохберга, решает ту же задачу мягче: вместо того чтобы гарантировать, что вероятность хотя бы одной ошибки I рода среди всех тестов не превышает α, он гарантирует, что среди всех тестов, признанных значимыми, доля ложных срабатываний в среднем не превышает заданный уровень — например, 5% или 10%.

Практическое следствие этой мягкости — FDR-поправка сохраняет заметно больше статистической мощности, чем Бонферрони, особенно при большом числе сравнений, ценой того, что среди признанных значимыми результатов допускается небольшая, контролируемая доля ложных срабатываний, а не их полное исключение. Расчёт чуть сложнее ручного деления на число тестов: p-значения всех сравнений сортируются по возрастанию, и каждому присваивается свой, зависящий от его ранга в этом списке, скорректированный порог — на практике расчёт делают функцией статистического пакета (p.adjust в R с методом BH, statsmodels.stats.multitest в Python), а не вручную.

Метод Холма: компромисс между Бонферрони и FDR

Между строгой поправкой Бонферрони и мягким контролем FDR есть промежуточный вариант — пошаговый метод Холма (Holm-Bonferroni): p-значения всех сравнений сортируются по возрастанию, и к самому маленькому применяется полная поправка Бонферрони (деление на общее число тестов), а к каждому следующему — деление на уменьшающееся на единицу число оставшихся сравнений. Итоговый порог для каждого следующего по рангу теста получается мягче, чем при обычном Бонферрони, но метод по-прежнему гарантирует тот же строгий контроль вероятности хотя бы одной ошибки I рода, что и классическая поправка.

Практическое преимущество метода Холма — он почти никогда не уступает в мощности классической поправке Бонферрони и часто заметно её превосходит при этом же уровне строгости контроля, поэтому многие современные руководства по статистике рекомендуют метод Холма как разумную замену по умолчанию везде, где раньше механически применялась поправка Бонферрони. Расчёт чуть сложнее прямого деления, но встроен в те же функции статистических пакетов, что и Бонферрони и FDR — например, p.adjust в R принимает метод как параметр, и переключение между Бонферрони, Холмом и FDR не требует отдельного кода.

Разобранный пример: пять сегментов, одна метрика

Представим, что аналитик сравнивает удовлетворённость пяти региональных филиалов со средним значением по компании — это пять отдельных тестов на одних и тех же данных. Без поправки два филиала показали p = 0,04 и p = 0,03, что выглядело бы как две значимые находки при пороге 0,05. Цифры в примере условные и нужны только для того, чтобы показать формат.

После поправки Бонферрони (деление 0,05 на пять сравнений даёт порог 0,01) ни один из двух результатов не проходит порог — оба филиала перестают считаться статистически отличающимися от среднего. После метода Холма — более мягкого при том же уровне контроля — результат зависит от точных значений: если p = 0,03 оказывается наименьшим среди всех пяти, к нему применяется тот же строгий порог 0,01, что и при Бонферрони, но следующие по рангу p-значения сравниваются уже с менее строгими порогами вроде 0,0125 или 0,0167, и в части случаев проходят там, где полная поправка Бонферрони их бы отбраковала. После FDR-поправки Бенджамини-Хохберга при разведочном характере анализа шансы сохранить хотя бы одну из двух находок значимой ещё выше, ценой допущения контролируемой доли ложных срабатываний среди итоговых выводов.

Какую поправку выбрать для опроса

Выбор между Бонферрони и FDR зависит от цены каждого типа ошибки в конкретной задаче. Если ложное срабатывание дорого стоит — например, решение о смене поставщика или увольнении на основе одного значимого сегмента, — консервативная поправка Бонферрони оправдана несмотря на риск пропустить часть реальных эффектов. Если задача, наоборот, разведочная — найти интересные направления для дальнейшего, более прицельного исследования среди десятков сегментов, — FDR сохраняет больше находок ценой контролируемой доли ложных срабатываний среди них.

Практический ориентир большинства прикладных руководств: FDR (поправка Бенджамини-Хохберга) — более распространённый выбор по умолчанию для разведочного анализа множества сегментов и вопросов опроса, а Бонферрони оставляют для ситуаций с небольшим числом заранее спланированных, содержательно важных сравнений, где цена ложного срабатывания особенно высока.

Поправка на множественные сравнения нужна конкретно тогда, когда сравнения действительно множественные и независимые — то есть когда одна и та же гипотеза («есть ли разница») проверяется много раз на разных срезах одних данных. Она не требуется, если в опросе заранее задан один-единственный ключевой вопрос анализа, а остальные тесты — описательные и не претендуют на статистический вывод; применять поправку к любому числу расчётов подряд без разбора так же неверно, как не применять её вовсе там, где она нужна.

Как спланировать анализ, чтобы избежать проблемы заранее

Лучшая защита от проблемы множественных сравнений — не поправка постфактум, а планирование анализа до того, как получены данные: заранее сформулировать одну-две главные гипотезы, которые действительно интересуют бизнес, и рассматривать остальные срезы данных как разведочные, отдельно помечая в отчёте, что их результаты не проходили строгую поправку и требуют отдельной проверки на новых данных, прежде чем становиться основанием для решения.

Практический приём для отчёта — явно указывать рядом с каждым p-значением, сколько всего сравнений было сделано в рамках этого анализа: цифра «p = 0,03» читается совершенно по-разному в зависимости от того, был ли это единственный запланированный тест или один из тридцати опробованных срезов. Прозрачность в этом вопросе — не формальность, а прямая защита от того, чтобы случайное совпадение конкретной выборки было принято за надёжную бизнес-находку.

Связь с размером выборки и мощностью

Поправка на множественные сравнения всегда снижает статистическую мощность каждого отдельного теста, потому что требует более строгого порога значимости при том же размере выборки — эта связь разобрана подробнее в статье про статистическую мощность и ошибки I и II рода. Практическое следствие — если заранее известно, что анализ потребует много сравнений и, следовательно, строгой поправки, размер выборки для сохранения приемлемой мощности нужно закладывать больше, чем для одного-единственного теста, и учитывать это на этапе планирования опроса, а не после того, как поправленные p-значения окажутся разочаровывающе высокими.

Обратная сторона той же связи — сегментация опроса на множество мелких групп ради «более детального анализа» имеет скрытую цену: чем больше сегментов сравнивается, тем строже должна быть поправка и тем больше респондентов нужно в каждом сегменте, чтобы сохранить способность вообще что-то обнаружить. Решение сегментировать выборку мельче стоит принимать осознанно, соотнося его с реальным размером выборки, а не только с содержательным желанием посмотреть на данные подробнее.

На практике поправку почти никогда не считают вручную построчно, за исключением простейшего деления для Бонферрони при малом числе сравнений: функция p.adjust() в R принимает вектор p-значений и метод коррекции («bonferroni», «holm», «BH» для Бенджамини-Хохберга) одним вызовом, а в Python аналогичную роль играет statsmodels.stats.multitest.multipletests. Оба инструмента возвращают не только скорректированные p-значения, но и явный флаг «значимо/незначимо» для каждого сравнения при заданном итоговом уровне контроля, что избавляет от ручного пересчёта порогов и снижает риск арифметической ошибки при большом числе тестов.

Практический алгоритм

  1. Перед анализом зафиксируйте, сколько независимых статистических тестов планируется провести на данных опроса.
  2. Разделите тесты на заранее запланированные ключевые гипотезы и разведочные сравнения — они требуют разного уровня строгости.
  3. Для небольшого числа заранее спланированных важных сравнений примените поправку Бонферрони.
  4. Для разведочного анализа множества сегментов примените FDR — поправку Бенджамини-Хохберга.
  5. В отчёте укажите рядом с каждым p-значением, сколько всего сравнений было сделано и какая поправка применена.
  6. При планировании выборки заранее учтите предстоящую поправку — она снижает мощность каждого отдельного теста.

Типичные ошибки

С чего начать

Прежде чем разбивать результаты последнего опроса на много сегментов и запускать тест по каждому, посчитайте, сколько сравнений получится в итоге, и выберите поправку — Бонферрони для нескольких ключевых гипотез, FDR для широкого разведочного анализа. Отчёт станет честнее, если рядом с каждым p-значением будет указано общее число сравнений, а не только результат одного из них. В сервисе «До Сути» опрос собирается с любым числом сегментирующих вопросов, а поправка на множественные сравнения — расчёт, который делают во внешнем статистическом инструменте уже после выгрузки ответов. Эта привычка стоит немного дисциплины на этапе планирования, но избавляет от неловкой ситуации, когда громко объявленная находка не подтверждается при повторном опросе на новых данных — а именно так чаще всего и вскрывается непроверенная проблема множественных сравнений задним числом.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Что такое проблема множественных сравнений в опросах?

Проблема множественных сравнений возникает, когда на одних и тех же данных опроса проводится много независимых статистических тестов — например, сравнение оценки удовлетворённости по десяткам сегментов. Вероятность хотя бы одного ложного срабатывания растёт вместе с числом тестов, даже если каждый отдельный тест использует стандартный порог значимости 0,05: при 20 независимых сравнениях эта вероятность приближается к 64%, даже если реальных различий между сегментами не существует вовсе.

Как работает поправка Бонферрони?

Поправка Бонферрони делит исходный уровень значимости (обычно 0,05) на число проводимых сравнений, получая более строгий порог для каждого отдельного теста: при 20 сравнениях новый порог — 0,0025 вместо 0,05. Значимым признаётся только результат, чьё p-значение оказалось ниже этого более строгого порога. Поправка простая и надёжно контролирует общий риск ложного срабатывания, но при большом числе сравнений становится настолько строгой, что реальные эффекты рискуют не пройти порог значимости.

Чем поправка FDR отличается от поправки Бонферрони?

Поправка Бонферрони контролирует вероятность хотя бы одной ложной находки среди всех тестов и потому очень консервативна. Метод контроля доли ложных срабатываний (FDR), реализованный поправкой Бенджамини-Хохберга, мягче: он допускает среди результатов, признанных значимыми, небольшую контролируемую долю ложных срабатываний — например, 5% — вместо их полного исключения. FDR сохраняет больше статистической мощности при большом числе сравнений и чаще выбирается для разведочного анализа множества сегментов опроса.

Всегда ли нужна поправка на множественные сравнения при анализе опроса?

Нет, поправка нужна конкретно тогда, когда одна и та же гипотеза об эффекте проверяется много раз на разных срезах данных — например, по многим сегментам или вопросам. Если в опросе заранее задан один ключевой вопрос анализа, а остальные расчёты носят описательный характер и не претендуют на статистический вывод, поправка не требуется. Применять её к любому числу расчётов подряд без разбора столь же ошибочно, как не применять там, где она действительно нужна.

Читайте также