«До Сути»← Все статьи

Метрики · 10 сентября 2026 г.

Критерий Краскела-Уоллиса: как сравнить три и более группы без ANOVA

Критерий Краскела-Уоллиса — непараметрический тест, который сравнивает три и более независимые группы по числовой или порядковой переменной, когда данные не отвечают условиям обычного дисперсионного анализа: шкала порядковая, распределение скошено или выборка небольшая. Он расширяет логику U-критерия Манна-Уитни на произвольное число групп, сравнивая не средние значения, а ранги ответов в общем отсортированном ряду. Значимый результат говорит только о том, что хотя бы одна пара групп различается, но не указывает, какая именно, — для этого нужны отдельные попарные сравнения с поправкой на их множественность. Ниже — как читать результат правильно и что делать дальше.

Когда нужен Краскела-Уоллиса вместо ANOVA

Дисперсионный анализ (ANOVA) сравнивает средние значения трёх и более групп и опирается на те же предположения, что и t-критерий: приблизительная нормальность распределения внутри каждой группы и однородность разброса между группами. Оценка удовлетворённости по шкале от 1 до 5 в трёх сегментах клиентов формально этим условиям не отвечает почти никогда — шкала порядковая, распределения скошены к разным краям в разных сегментах, а выборки внутри отдельных сегментов часто небольшие. В таких случаях Краскела-Уоллиса даёт более осторожную и методически корректную проверку различий между группами, не полагаясь на предположения, которые данные не подтверждают. Ситуация усложняется, если сравниваемых групп сразу пять-шесть, как бывает при сравнении регионов или возрастных категорий: чем больше групп, тем выше шанс, что распределение хотя бы в одной из них заметно отклонится от нормального, и проверять условия применимости отдельно для каждой группы вручную перед выбором критерия становится совсем непрактично — заметно проще сразу оценить общую картину по гистограммам всех групп сразу на одном общем графике.

Второй повод для перехода — сильно разные размеры групп. ANOVA чувствительна к нарушению однородности разброса особенно тогда, когда группы заметно различаются по числу наблюдений: одна ветка опроса собрала триста ответов, а другая — двадцать пять. Краскела-Уоллиса не свободен от всех проблем такого дисбаланса, но не опирается на предположение о равенстве дисперсий так же жёстко, как классическая ANOVA, и остаётся рабочим инструментом там, где параметрический аналог уже вызывает сомнения в корректности вывода. Третий, менее очевидный повод — наличие в данных единичных аномальных ответов, которые встречаются в любом достаточно длинном опросе: один респондент, случайно или намеренно поставивший минимальную оценку по всем пунктам, способен заметно сдвинуть среднее значение своей группы, а на сумму рангов повлияет минимально, потому что ранг ограничен позицией в общем списке, а не абсолютной величиной ответа.

Как работает критерий: расширение Манна-Уитни на несколько групп

Расчёт начинается так же, как у Манна-Уитни: все ответы из всех сравниваемых групп объединяются в один список и ранжируются от наименьшего к наибольшему без учёта принадлежности к группе, а совпадающие значения получают общий средний ранг. Дальше для каждой группы отдельно считается сумма её рангов, и статистика H строится так, чтобы отражать, насколько сильно эти суммы отличаются от того, что ожидалось бы, если бы все группы были взяты из одного и того же распределения ответов и ранги распределились между ними пропорционально размеру каждой группы.

Итоговое p-значение отвечает на вопрос, насколько вероятно такое расхождение сумм рангов между всеми группами сразу, если бы на самом деле разницы между ними не было вовсе. Малое p-значение говорит, что хотя бы одна пара групп различается достаточно сильно, чтобы это не объяснялось случайностью выборки, — но само по себе не указывает, какая именно пара. Это прямая параллель с обычной ANOVA: значимый результат там точно так же не говорит, какие конкретно группы различаются, и требует отдельного апостериорного анализа для ответа на этот вопрос.

Связь с распределением хи-квадрат

При достаточно большом числе наблюдений в каждой группе — обычно от пяти и больше — статистика H приблизительно следует распределению хи-квадрат с числом степеней свободы, равным числу групп минус один. Это не совпадение и не просто удобное приближение: именно поэтому большинство статистических пакетов при выводе результата Краскела-Уоллиса указывает степени свободы точно так же, как при обычном тесте хи-квадрат, и само итоговое p-значение считается по той же самой таблице распределения. Знать об этой связи полезно не ради формул как таковых, а для того, чтобы не удивляться, встретив в итоговом выводе программы упоминание хи-квадрата там, где изначально ожидался отдельный, самостоятельный непараметрический тест.

На совсем малых выборках — меньше пяти наблюдений в какой-либо из сравниваемых групп — это приближение обычно работает заметно хуже, и часть статистических пакетов в таком случае предлагает точный расчёт p-значения вместо приближённого через распределение хи-квадрат. Разница в итоговом выводе между точным и приближённым расчётом на малых выборках иногда оказывается заметной, и если размер хотя бы одной группы близок к этой границе, стоит явно проверить, какой метод расчёта использовал конкретный инструмент, а не полагаться на настройку по умолчанию вслепую.

Пример: сравнение трёх каналов поддержки по оценке

КаналЧисло ответовМедиана оценкиСредний ранг
Чат584128
Почта47396
Телефон39384

Цифры в примере условные и служат только для того, чтобы показать формат отчёта, а не как ориентир по реальным оценкам каналов поддержки. По такой таблице расчёт может дать статистику H около 11,4 при двух степенях свободы и p-значение около 0,003 — результат значим, хотя бы одна пара каналов различается по оценке достаточно сильно, чтобы не объяснять это случайностью. Число степеней свободы здесь равно числу групп минус один, то есть двум для трёх каналов, и большинство статистических пакетов выводит его вместе с итоговым p-значением автоматически.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Что показывает значимый результат — и чего не показывает

Значимый H-критерий — это ответ на вопрос «есть ли разница хоть где-то среди групп», а не «какие именно группы отличаются друг от друга». В примере выше это может означать, что чат отличается и от почты, и от телефона, а почта с телефоном между собой похожи; или что различается только одна пара из трёх; или что различаются все три группы. По одному итоговому p-значению эти сценарии неразличимы, и делать вывод вроде «чат работает лучше телефона» сразу по результату критерия — методическая ошибка, даже если по средним рангам в таблице это выглядит правдоподобно.

Правильный порядок такой: сначала общий H-критерий подтверждает, что разница где-то есть и её вообще стоит искать, а затем отдельные попарные сравнения показывают, между какими именно группами она статистически значима. Пропускать первый шаг и сразу сравнивать все пары друг с другом — тоже ошибка, но в другую сторону: без общего теста как фильтра число случайных ложных находок при большом количестве пар растёт быстрее, чем кажется интуитивно. Этот двухшаговый порядок иногда называют защитой по иерархии: пока общий тест не подтвердил, что разница где-то есть, отдельные попарные сравнения не запускают вовсе, и это правило стоит закрепить как часть стандартной процедуры анализа, а не решать каждый раз заново по ситуации.

Апостериорные сравнения: критерий Данна и поправка на множественность

Стандартный способ выяснить, какие именно группы различаются после значимого H-критерия, — апостериорный критерий Данна: он попарно сравнивает группы на основе тех же рангов, что использовались в общем расчёте, а не пересчитывает их заново для каждой пары изолированно, что делает сравнения между собой согласованными. Для трёх групп это три попарных сравнения — чат против почты, чат против телефона, почта против телефона, — и по каждому считается собственное p-значение.

Здесь возникает проблема множественных сравнений: если проверять несколько гипотез подряд на одном и том же уровне значимости 0,05, вероятность хотя бы одной случайной ложной находки растёт с числом сравнений — при трёх независимых проверках она приближается к четырнадцати процентам вместо заявленных пяти. Поэтому p-значения по каждой паре корректируют — чаще всего поправкой Бонферрони, которая делит порог значимости на число сравнений, — прежде чем делать вывод о том, какая именно пара групп различается на самом деле.

Пошагово: что делать после значимого H-критерия

  1. Убедитесь, что общий H-критерий значим — без этого попарные сравнения не запускают.
  2. Проведите апостериорные попарные сравнения критерием Данна по всем нужным парам групп.
  3. Скорректируйте p-значения каждой пары поправкой на множественность, например Бонферрони.
  4. Определите, какие пары остались значимыми после поправки, а какие — нет.
  5. Приведите медианы каждой группы рядом с результатом, чтобы вывод был понятен без объяснения рангов.
  6. Сформулируйте вывод именно по значимым после поправки парам, а не по всем визуально различающимся.

Условия применимости

Как и у Манна-Уитни, группы должны быть независимыми: один и тот же респондент не может входить в несколько сравниваемых групп одновременно. Переменная должна допускать упорядочивание — быть числовой или порядковой, — но требования к форме распределения нет. Ещё одно дополнительное условие, специфичное именно для Краскела-Уоллиса, — сравниваемых групп должно быть минимум три; для двух групп по сути получается тот же расчёт, что и у Манна-Уитни, и пользоваться для этого случая отдельным названием критерия избыточно. Ещё одно практическое требование — группы должны сравниваться по одной и той же переменной, измеренной одинаковым способом во всех группах: сравнивать оценку удовлетворённости по пятибалльной шкале в одном сегменте с оценкой по десятибалльной шкале в другом напрямую нельзя, даже если обе шкалы неформально называются «оценкой удовлетворённости» в опроснике.

Эффект-размер: эпсилон-квадрат

Как и любой другой тест значимости, H-критерий на большой выборке способен показать статистическую значимость даже при практически неважном различии между группами. Величину эффекта для Краскела-Уоллиса принято оценивать эпсилон-квадратом — числом от нуля до единицы, производным от статистики H и общего числа наблюдений, по смыслу близким к доле объяснённой дисперсии в обычной ANOVA. Ориентировочно значения около 0,01 читаются как малый эффект, около 0,06 — средний, от 0,14 — большой, и эту цифру стоит приводить в паре с p-значением, а не вместо него, особенно в отчётах на выборках от тысячи ответов и больше. Эпсилон-квадрат удобен ещё и тем, что сопоставим между разными опросами и разными наборами групп: два исследования с одинаковым эпсилон-квадратом показывают сравнимую по силе связь между группирующей переменной и результатом, даже если абсолютные значения статистики H и p различаются из-за разного размера выборки.

Ограничения

Главное ограничение — меньшая статистическая мощность по сравнению с ANOVA на данных, где условия параметрики на самом деле выполнены: часть информации теряется при переходе от значений к рангам, и для обнаружения того же по величине эффекта непараметрике требуется выборка заметно больше. Второе — сам по себе значимый H-критерий не указывает, какие группы различаются, и пропуск апостериорного анализа с поправкой на множественность — самая частая методическая ошибка при использовании этого теста на практике.

Третье ограничение касается интерпретации при неравной форме распределений разных групп: если группы отличаются не типичным уровнем ответов, а разбросом или формой распределения, значимый результат не обязательно означает то, что интуитивно ожидается от сравнения «какая группа отвечает выше». В таких случаях стоит посмотреть на распределения групп напрямую, а не полагаться только на медианы и итоговое p-значение. Четвёртое ограничение — как и обычная ANOVA, критерий не различает практическую и статистическую значимость сам по себе: на выборке в несколько тысяч ответов даже пренебрежимо малое различие между группами способно пройти порог значимости, и без эпсилон-квадрата рядом с p-значением отчёт рискует переоценить важность найденной разницы для реальных решений.

Расчёт H-критерия, апостериорных сравнений Данна и эпсилон-квадрата делается во внешнем статистическом инструменте после выгрузки ответов. В сервисе «До Сути» опрос собирает и хранит сырые баллы по группам, а сам расчёт и поправка на множественность сравнений выполняются в статистическом пакете после экспорта данных.

Типичные ошибки

С чего начать

Возьмите вопрос из опроса, где сравниваются три и более естественные группы — сегменты, каналы, тарифы, — постройте таблицу медиан и средних рангов по каждой и посчитайте H-критерий на выгруженных данных. Если результат значим, сразу переходите к апостериорным сравнениям Данна с поправкой на множественность, а не формулируйте вывод по одному общему p-значению и визуальной разнице в таблице. Это на порядок надёжнее и убережёт от поспешного вывода вроде «канал А явно лучше канала Б», который сам по себе итоговый результат общего теста на самом деле никогда не подтверждал.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Чем критерий Краскела-Уоллиса отличается от ANOVA?

ANOVA сравнивает средние значения трёх и более групп и требует приблизительной нормальности распределения внутри каждой из них, а также однородности разброса между группами. Краскела-Уоллиса сравнивает ранги ответов всех групп в общем отсортированном ряду и не требует ни нормальности, ни строгой однородности разброса, поэтому подходит для порядковых шкал вроде оценки удовлетворённости, скошенных распределений и небольших или сильно неравных по размеру групп.

Что делать после значимого результата Краскела-Уоллиса?

Значимый H-критерий говорит только о том, что хотя бы одна пара групп различается, но не указывает, какая именно. Следующий шаг — апостериорные попарные сравнения критерием Данна по всем нужным парам групп, а затем обязательная поправка p-значений на множественность сравнений, чаще всего поправкой Бонферрони. Только после поправки можно назвать конкретные пары групп, которые статистически различаются, и приводить их медианы в итоговом отчёте.

Зачем нужна поправка на множественность сравнений?

Если проверять несколько гипотез подряд на одном уровне значимости 0,05 без поправки, вероятность хотя бы одной случайной ложной находки растёт быстрее, чем кажется: уже при трёх независимых попарных сравнениях она приближается к четырнадцати процентам вместо заявленных пяти. Поправка вроде Бонферрони снижает порог значимости для каждого отдельного сравнения пропорционально их числу, чтобы общая вероятность ложной находки по всем парам вместе осталась на заявленном уровне.

Можно ли использовать Краскела-Уоллиса для двух групп?

Формально можно, но результат будет полностью эквивалентен U-критерию Манна-Уитни на тех же данных, поскольку Краскела-Уоллиса — прямое обобщение этого критерия на большее число групп. Для двух групп проще и понятнее использовать сам Манна-Уитни: он даёт ту же статистику значимости, но привычнее для читателя отчёта и не требует объяснения, почему для двух групп применён метод, названный для сравнения нескольких.

Читайте также