Метрики · 6 сентября 2026 г.
Дисперсионный анализ (ANOVA): сравнение трёх и более групп опроса
Дисперсионный анализ, или ANOVA, отвечает на вопрос, отличается ли хотя бы одна из трёх и более сравниваемых групп опроса от остальных значимо больше, чем можно объяснить случайным разбросом ответов внутри каждой группы. Он заменяет собой рискованную практику попарного сравнения групп t-критерием, где каждое отдельное сравнение добавляет свой шанс случайной ложной находки, а при пяти-шести группах итоговый риск ошибки становится неприемлемо большим. Значимый результат ANOVA — только первый шаг: он говорит, что различие где-то есть, но не какое именно, и требует следующего шага — апостериорных сравнений. Ниже — как работает метод без формул, как читать пример по трём филиалам и что делать после значимого результата.
Почему нельзя просто сравнить все пары t-критерием
Когда групп больше двух — например, пять филиалов или четыре тарифа — естественное желание сравнить их между собой попарным t-критерием: филиал А с Б, А с В, Б с В и так далее. Проблема в том, что при пяти группах таких пар получается десять, и каждое сравнение при обычном пороге 0,05 добавляет свои пять процентов шанса найти случайную разницу. К десятому сравнению общий шанс хотя бы одной ложной находки заметно превышает те самые пять процентов, ради которых порог и выбирался.
Дисперсионный анализ, или ANOVA, решает эту задачу иначе: вместо множества попарных сравнений он одним тестом отвечает на общий вопрос — отличается ли хотя бы одна из групп от остальных значимо больше, чем можно было бы объяснить случайным разбросом внутри групп. Это первый шаг, а не единственный: если ANOVA показывает, что различия есть, дальше всё равно нужно выяснить, какие именно группы отличаются, но уже с поправкой на множественность, о чём ниже.
Похожая проблема возникает не только с числом ложных находок, но и с интерпретацией отчёта в целом: если в выгрузке из десяти сравнений упомянуть только те три, что оказались значимыми, читатель составит впечатление о системном различии там, где на самом деле сработала обычная статистическая случайность при большом числе попыток. Честная практика — сообщать результаты всех проведённых сравнений, а не только тех, что подтвердили ожидания, вне зависимости от того, идёт ли речь об ANOVA или о более простых тестах.
Как работает ANOVA: общая идея без формул
Название метода — «анализ дисперсии» — само подсказывает логику: вместо сравнения средних напрямую тест раскладывает общий разброс ответов на две части. Первая часть — разброс между группами: насколько сильно отличаются средние значения филиалов друг от друга. Вторая — разброс внутри групп: насколько сильно отличаются ответы отдельных людей внутри одного и того же филиала. Если разброс между группами заметно больше, чем разброс внутри них, это признак того, что группы действительно различаются, а не просто по-разному выглядят из-за случайного шума.
Интуиция здесь похожа на сравнение двух оркестров: если музыканты внутри каждого оркестра играют слаженно и тихо, даже небольшая разница в темпе между оркестрами будет отчётливо слышна. Если же каждый оркестр сам по себе играет вразнобой, разница в среднем темпе потеряется в общем шуме. ANOVA формализует именно это соотношение: сравнивает, насколько разница между группами велика на фоне того, насколько сами группы неоднородны внутри себя.
На практике расчёт ANOVA почти всегда выполняется в статистическом пакете или калькуляторе, а не вручную, и результат включает не только F-статистику и p-значение, но и промежуточные суммы квадратов отклонений, из которых F и получается. Для практического использования эти промежуточные числа не обязательны — важны итоговые F и p, — но полезно знать, что за ними стоит именно разложение общего разброса на межгрупповую и внутригрупповую части, о котором шла речь выше.
Пример: NPS по трём филиалам
Цифры в примере условные и служат только для показа формата вывода теста. Три филиала сети собрали NPS от клиентов, посетивших за месяц, и нужно понять, есть ли между ними значимая разница или наблюдаемый разброс средних объясняется обычной случайностью выборки.
| Филиал | Средний NPS | N |
|---|---|---|
| Центральный | 42 | 95 |
| Северный | 38 | 88 |
| Южный | 51 | 102 |
По одним средним Южный филиал выглядит лидером с большим отрывом, но ANOVA учитывает ещё и разброс ответов внутри каждого филиала: если внутри Южного филиала оценки сильно расходятся — от жёстких критиков до полных сторонников, — итоговый тест может не признать разницу значимой, несмотря на солидный отрыв в средних. И наоборот, небольшая на первый взгляд разница при дружном распределении ответов внутри групп вполне может оказаться статистически значимой.
F-статистика и p-значение в контексте ANOVA
Результат ANOVA — F-статистика, число, показывающее соотношение разброса между группами и разброса внутри групп, и p-значение, интерпретируемое так же, как в t-критерии: вероятность получить такое или большее различие средних, если на самом деле все группы одинаковы. Чем больше F, тем сильнее разница между группами выражена на фоне внутригруппового разброса. При p меньше 0,05 принято говорить, что хотя бы одна группа отличается от остальных значимо, но какая именно — сам по себе тест ANOVA не говорит.
Именно в этом ограничении кроется частая ошибка интерпретации: значимый результат ANOVA не означает, что все группы отличаются друг от друга. Он означает лишь, что не все группы одинаковы — различие может создавать всего одна группа-выброс на фоне двух почти одинаковых, а остальные пары при этом совсем не различаются. Чтобы понять, какая именно пара или пары дают значимость, нужен следующий шаг.
Полезно также помнить, что размер F-статистики сам по себе не говорит о величине различий в практическом смысле — как и в случае с t-критерием, для этого существует отдельная мера, размер эффекта, которая показывает, насколько велика разница между группами относительно разброса ответов внутри них, независимо от размера выборки. Большое значение F на огромной выборке может соответствовать различию, не имеющему практического значения, а скромное F на небольшой выборке — реальному и существенному эффекту, который тест из-за нехватки данных просто не смог уверенно обнаружить.
После значимого результата: апостериорные сравнения
Когда ANOVA показала, что различия где-то есть, следующий шаг — апостериорные, или post-hoc, сравнения: попарное сопоставление групп с поправкой на множественность, о которой шла речь применительно к t-критерию. В отличие от простого перебора t-критериев без поправки, апостериорные тесты изначально построены так, чтобы контролировать общий уровень ложных находок при множестве сравнений, а не игнорировать эту проблему.
Практический порядок такой: сначала ANOVA отвечает на вопрос, есть ли вообще смысл сравнивать группы попарно — если результат незначим, попарные сравнения проводить не стоит, какими бы разными ни казались отдельные средние. Если ANOVA значим, тогда апостериорный тест показывает, какие именно пары групп отличаются друг от друга статистически надёжно, а какие различия в средних — просто случайный разброс, не подтверждённый при более строгом сравнении.
Существует несколько разных апостериорных тестов — Тьюки, Бонферрони, Шеффе — и они отличаются тем, насколько консервативно контролируют риск ложных находок. Для практических задач с небольшим числом групп разница между ними обычно невелика, и выбор конкретного теста реже становится камнем преткновения, чем сам факт, что апостериорную проверку вообще стоит делать, а не пропускать этот шаг после значимого ANOVA.
Двухфакторный ANOVA: когда группировок две сразу
Иногда интересны не одна, а сразу две группировки одновременно — например, отличается ли NPS не только по филиалам, но и по типу клиента, новый он или постоянный, и есть ли эффект их сочетания. Двухфакторный ANOVA считает три вещи сразу: эффект первого фактора, эффект второго и эффект их взаимодействия — ситуацию, когда разница между филиалами разная для новых и постоянных клиентов, а не одинаковая для всех.
Эффект взаимодействия часто оказывается самой полезной находкой во всём анализе. Может выясниться, что филиалы почти не различаются по NPS постоянных клиентов, зато сильно расходятся по новым — то есть проблема не в филиале как таковом, а в том, как именно там встречают новых посетителей. Без учёта взаимодействия такая деталь тонет в общих средних по филиалу и остаётся незамеченной, хотя именно она чаще всего указывает, что конкретно нужно исправлять.
Двухфакторный дизайн требует больше данных, чем однофакторный, потому что каждая комбинация уровней двух факторов — например, три филиала на два типа клиентов — образует отдельную ячейку, и в каждой ячейке нужно достаточно респондентов для устойчивой оценки. При шести ячейках и минимуме в пятнадцать-двадцать человек на ячейку общая необходимая выборка легко превышает сотню, и это стоит учитывать на этапе планирования сбора данных, а не постфактум, когда данные уже собраны и распределены неравномерно.
Непараметрическая альтернатива: критерий Краскела-Уоллиса
Если данные внутри групп сильно отклоняются от нормального распределения или размеры групп очень малы, обычный ANOVA становится ненадёжным, и вместо него используют критерий Краскела-Уоллиса — его непараметрический аналог. Вместо сравнения средних значений он сравнивает ранги: все ответы по всем группам вместе сортируются от меньшего к большему, каждому присваивается ранговое место, а дальше проверяется, не сосредоточены ли ранги одной из групп систематически выше или ниже остальных.
Плата за эту устойчивость — меньшая чувствительность: при по-настоящему нормально распределённых данных критерий Краскела-Уоллиса реже обнаруживает существующую разницу, чем обычный ANOVA, поэтому применять его стоит именно тогда, когда есть основания сомневаться в нормальности, а не по умолчанию вместо параметрического теста. Как и в случае с ANOVA, значимый результат этого критерия тоже требует последующих попарных сравнений, чтобы понять, какие именно группы различаются. На практике признаком, что стоит перейти к непараметрическому варианту, часто служит визуальный график распределения ответов внутри каждой группы: явная скошенность или два отдельных пика — сигнал не доверять предположению о нормальности вслепую.
Типичные ошибки
- Сравнивать группы попарным t-критерием без поправки вместо ANOVA.
- Считать значимый результат ANOVA доказательством, что все группы отличаются друг от друга.
- Не проводить апостериорные сравнения после значимого результата и гадать, какая группа отличается.
- Игнорировать взаимодействие факторов в двухфакторном дизайне.
- Делать ANOVA на группах меньше пятнадцати-двадцати человек и доверять точечному результату.
- Путать статистическую значимость различий с их практической величиной.
Ограничения метода
ANOVA, как и t-критерий, предполагает примерно нормальное распределение ответов внутри групп и сопоставимый разброс между группами — если один филиал даёт крайне неоднородные оценки, а другой сплошь стабильные, тест становится менее надёжным. Метод также требует достаточного числа наблюдений в каждой группе: сравнение трёх филиалов с двадцатью, восемьюдесятью и шестью респондентами в каждом даёт результат, где вклад маленькой группы почти не поддаётся оценке.
Как и вся эта линейка тестов, ANOVA — метод корреляционный: он показывает, что группы различаются, но не объясняет причину различия сам по себе, если группы формировались не случайно, а по естественным признакам вроде местоположения или типа клиента. В сервисе «До Сути» вы сами задаёте, что считать группой при экспорте ответов, а сам расчёт ANOVA выполняется во внешнем статистическом пакете — встроенного дисперсионного анализа в сервисе нет, и результат экспорта — это исходные баллы по группам, а не готовый тест.
Стоит также учитывать, что ANOVA — это тест на равенство средних, и он ничего не говорит о разбросе внутри групп сам по себе. Две ситуации — группы с одинаковым средним, но разным разбросом ответов, и группы с разными средними при одинаковом разбросе — требуют разного взгляда на результат, и ANOVA в чистом виде описывает только второй случай, а первую разницу нужно смотреть отдельно, сравнивая стандартные отклонения групп между собой. Игнорировать эту разницу опасно: филиал с широким разбросом мнений — и очень довольными, и очень недовольными клиентами одновременно — требует другого управленческого решения, чем филиал со стабильно средними оценками, даже если формальный тест на равенство средних не увидел между ними различия.
С чего начать
Если вы сравниваете больше двух групп впервые, начните с самого ANOVA, а не с попарных сравнений: он быстро отвечает, стоит ли вообще углубляться дальше. При значимом результате переходите к апостериорным сравнениям с поправкой на множественность, а не к перебору обычных t-критериев. И держите в уме размер каждой группы отдельно — если в одном из филиалов ответов заметно меньше, чем в остальных, его результат стоит воспринимать с поправкой на неопределённость, даже если формально тест это учитывает.
- Сначала посчитайте ANOVA целиком, не разбивая группы на пары заранее.
- Проверьте p-значение общего теста: незначимый результат — сигнал не идти дальше в попарные сравнения.
- При значимом результате используйте апостериорный тест с поправкой на множественность.
- Проверьте размер каждой группы отдельно, а не только их общее число.
Частые вопросы
T-критерий сравнивает средние ровно двух групп. Если групп больше двух, сравнивать их попарно t-критерием некорректно: каждое отдельное сравнение добавляет свой шанс случайной ложной находки, и при пяти-шести группах общий риск ошибки заметно превышает привычные пять процентов. ANOVA одним тестом отвечает на вопрос, отличается ли хотя бы одна из групп от остальных значимо больше, чем можно объяснить случайным разбросом внутри групп, и только после значимого результата имеет смысл искать конкретные пары.
Только то, что не все сравниваемые группы одинаковы — где-то есть значимое различие. Он не говорит, какая именно группа или пара групп отличается: различие может создавать всего одна группа-выброс на фоне остальных почти одинаковых. Чтобы понять, какие конкретно группы различаются, после значимого результата ANOVA проводят апостериорные, или post-hoc, сравнения с поправкой на множественность — они и указывают, какие пары действительно расходятся, а какие различия в средних объясняются случайным разбросом.
Да, если результат ANOVA значим и вам важно знать, какие именно группы различаются. Сам по себе значимый результат ANOVA — это ответ на общий вопрос «есть ли разница где-то», а бизнес-решения почти всегда требуют более конкретного ответа: какой филиал, какой тариф, какой сегмент отличается от остальных. Апостериорные тесты дают этот ответ с поправкой на множественность сравнений, в отличие от простого перебора t-критериев без поправки.
Технически да, но с оговоркой: чем меньше группа, тем менее надёжна оценка именно по ней, и итоговый вывод по маленькой группе стоит воспринимать с осторожностью, даже если формальный тест это частично учитывает. Если одна из групп в разы меньше остальных — например, двадцать респондентов против ста пятидесяти в соседних, — разумно либо дособрать данные по маленькой группе, либо явно оговорить в отчёте, что вывод по ней менее устойчив, чем по остальным.