Метрики · 10 сентября 2026 г.
U-критерий Манна-Уитни: как сравнить две группы без t-критерия
U-критерий Манна-Уитни — непараметрический тест, который сравнивает две независимые группы по числовой или порядковой переменной без требования к нормальному распределению данных. Его используют вместо t-критерия, когда сравниваемый показатель измерен порядковой шкалой вроде оценки удовлетворённости от 1 до 5, распределение заметно скошено или в группе меньше тридцати ответов. Вместо средних значений критерий сравнивает ранги — места ответов обеих групп в общем отсортированном ряду, — и поэтому остаётся корректным независимо от формы распределения. Ниже — как он работает, что означает результат и какие условия стоит проверить перед расчётом.
Когда нужен Манна-Уитни вместо t-критерия
T-критерий сравнивает средние значения двух групп и предполагает, что переменная измерена в шкале с равными интервалами и распределена приблизительно нормально — или что размер каждой группы достаточно велик, чтобы это предположение перестало быть критичным. Оценка удовлетворённости по пятибалльной шкале формально этому условию не отвечает: нет строгих оснований считать, что разница между «3» и «4» психологически равна разнице между «4» и «5», а сама шкала в реальных опросах почти всегда скошена к одному краю — довольных обычно больше, чем крайне недовольных. В таких случаях Манна-Уитни даёт более осторожную и корректную оценку различия между группами.
Второй частый и не менее важный повод — маленькая выборка в одной или обеих сравниваемых группах. Устойчивость t-критерия к отклонениям от нормальности опирается на центральную предельную теорему, которая уверенно работает начиная примерно с тридцати наблюдений; на пятнадцати ответах в новой ветке опроса эта опора ещё не сработала. Третий повод — явные выбросы: один аномально низкий или высокий ответ способен заметно сдвинуть среднее значение группы, а на ранг он повлияет не больше чем на одну позицию, поэтому критерий на основе рангов устойчивее к таким искажениям. Четвёртый повод, менее очевидный, но частый на практике, — сравнение времени прохождения опроса или другой метрики с естественным нижним пределом и длинным правым хвостом: такие данные почти никогда не распределены симметрично, и попытка сравнить их средние через t-критерий систематически недооценивает влияние немногочисленных, но очень долгих прохождений на общую картину.
Как работает критерий: ранги вместо средних
Расчёт начинается с того, что все ответы обеих групп объединяются в один список и ранжируются от наименьшего к наибольшему, без разделения на группы. Каждому ответу присваивается ранг — его место в этом общем списке; при совпадающих значениях им присваивается средний ранг из тех позиций, которые они делят между собой. Затем ранги суммируются отдельно по каждой группе, и на основе этих сумм считается статистика U. Идея простая: если группы устроены одинаково, их ранги должны перемешаться в общем списке примерно поровну, а если одна группа систематически отвечает выше другой — её ответы соберутся ближе к верхним рангам, и суммы разойдутся заметно сильнее, чем можно объяснить случайностью.
Итоговое рассчитанное p-значение отвечает на вопрос, насколько вероятно именно такое или ещё более сильное расхождение сумм рангов, если бы на самом деле обе группы были взяты из одного и того же распределения ответов. Малое итоговое p-значение — обычно меньше принятого порога 0,05 — говорит о том, что расхождение вряд ли случайно и одна группа действительно отвечает систематически выше или ниже другой. Как и большинство статистических тестов, расчёт вручную нужен редко: практически любой статистический пакет и многие онлайн-калькуляторы считают U-статистику и p-значение по введённым данным автоматически.
Пример: сравнение двух тарифов по оценке удовлетворённости
| Тариф | Число ответов | Медиана оценки | Сумма рангов |
|---|---|---|---|
| Базовый | 42 | 3 | 1680 |
| Расширенный | 38 | 4 | 1940 |
Цифры в примере условные и нужны только для того, чтобы показать формат отчёта, а не как ориентир по реальным оценкам тарифов. По такой таблице расчёт может дать p-значение около 0,02 — расхождение медиан статистически значимо, клиенты расширенного тарифа в среднем оценивают удовлетворённость выше. Важная деталь: критерий сравнил распределения ответов целиком, а медиана в таблице приведена для того, чтобы результат был понятен без объяснения, что такое сумма рангов, — сама статистика U этого числа не показывает напрямую.
Что означает результат — про медианы, а не средние
Строго говоря, Манна-Уитни проверяет, одинаково ли распределены ответы двух групп, а не равны ли их средние или медианы в узком смысле. На практике при типичных для опросов данных значимый результат почти всегда читается как разница в медианах или в общем уровне ответов между группами, и медиану поэтому приводят в отчёте как понятную характеристику каждой группы рядом с результатом теста. Но если распределения двух групп имеют одинаковую медиану, а различаются формой — например, у одной группы ответы кучкуются вокруг середины, а у другой разбросаны по краям шкалы, — критерий всё равно может показать значимый результат, хотя медианы совпадают, и это стоит иметь в виду при интерпретации.
Поэтому перед выводом полезно посмотреть не только на итоговое p-значение, но и на распределение ответов каждой группы — гистограммой или простым списком долей по каждому баллу шкалы. Это быстро показывает, действительно ли одна группа сдвинута относительно другой целиком, или расхождение объясняется чем-то более сложным, что медиана и p-значение сами по себе не показывают.
Условия применимости
Критерий требует, чтобы сравниваемые группы были независимыми: один и тот же респондент не может состоять в обеих одновременно. Для связанных выборок — например, если одних и тех же людей опрашивали дважды, до и после изменения, — существует отдельный непараметрический метод, критерий знаковых рангов Уилкоксона, и применять к таким данным Манна-Уитни некорректно, потому что он не учитывает связь между парными наблюдениями. Второе условие заметно мягче, чем у t-критерия: переменная должна допускать упорядочивание — быть числовой или порядковой, — но требования к форме распределения нет вовсе, и в этом состоит основное практическое преимущество метода перед его параметрическим аналогом. Третье условие, которое часто упускают, — распределения обеих групп должны быть сопоставимы по разбросу: если у одной группы ответы кучкуются плотно вокруг одного значения, а у другой разбросаны по всей шкале, интерпретация значимого результата как «одна группа выше другой» становится менее однозначной, и в таком случае полезно смотреть на распределения напрямую, а не полагаться только на итоговый вывод теста.
Односторонний и двусторонний вариант критерия
Как и большинство статистических тестов, Манна-Уитни можно применить в двух вариантах. Двусторонний проверяет сам факт различия между группами, не задавая заранее направление — какая из групп выше, — и это стандартный, наиболее осторожный выбор для большинства задач. Односторонний проверяет конкретное направление, заданное заранее, например «расширенный тариф оценивают выше базового», и при том же уровне расхождения в данных даёт меньшее p-значение — но пользоваться им допустимо только если направление было сформулировано как гипотеза до того, как данные оказались перед глазами, а не выбрано задним числом ради более убедительного результата. На практике одностороннюю версию оправданно использовать редко: соблазн выбрать её постфактум, увидев данные, слишком велик, и большинство руководств по методологии рекомендуют двусторонний вариант как более защищённый от такого искушения выбор по умолчанию, даже если заранее казалось очевидным, какая группа окажется выше.
Как оценить нужный размер выборки заранее
- Определите минимальную разницу между группами, которую вам важно не пропустить.
- Оцените ожидаемый разброс ответов по имеющимся данным прошлых опросов или пилотной выборки.
- Заложите на непараметрический критерий выборку на десять-пятнадцать процентов больше, чем для t-критерия.
- Проверьте, что в самой маленькой из групп будет не меньше пятнадцати-двадцати ответов.
- Если группы формируются естественно и их размер неравен — учтите это на этапе планирования, а не по факту сбора.
Запас в размере выборки нужен не из перестраховки, а из-за меньшей статистической мощности непараметрических методов: на тех же данных, где условия параметрики действительно выполнялись бы, Манна-Уитни обнаруживает реальную разницу реже, чем t-критерий, потому что часть информации о величине различий теряется при переходе от значений к рангам. Планировать выборку заранее дешевле, чем обнаружить нехватку данных уже после сбора, когда добрать недостающие ответы часто негде.
Эффект-размер r: насколько велика разница
Сам по себе U-критерий отвечает только на вопрос, есть ли различие и в какую сторону, но не показывает, насколько оно велико. Для этого дополнительно считают эффект-размер r — он получается делением стандартизованного значения Z, которое статистический пакет обычно выводит вместе с p-значением, на квадратный корень из общего числа наблюдений в обеих группах. Результат — число от нуля до примерно единицы, не зависящее напрямую от размера выборки, в отличие от p-значения, которое на очень больших выборках может оказаться крошечным даже при незначительном на практике различии.
Ориентировочные границы для интерпретации r такие же, как у похожих коэффициентов эффекта в статистике: около 0,1 — слабый эффект, около 0,3 — умеренный, от 0,5 — сильный. Эти границы условны и зависят от контекста задачи: разница в удовлетворённости с r около 0,1 может быть незначительной для одного продукта и вполне достойной внимания для другого, если ставки на решение высоки. Приводить r в паре с p-значением полезно именно потому, что первое отвечает на вопрос «насколько», а второе — только на вопрос «случайно ли», и путать их местами — частая причина завышенных выводов из статистически значимого, но практически ничтожного результата. На выборке в несколько тысяч ответов даже r около 0,05 способен дать формально значимое p-значение, и без явного указания величины эффекта такой результат в отчёте выглядит убедительнее, чем есть на самом деле.
Ограничения
Главное ограничение уже названо: меньшая статистическая мощность по сравнению с параметрическим аналогом на данных, где условия параметрики на самом деле выполнены, — часть информации о величине различий теряется при переходе от значений к рангам. Второе: без эффект-размера r рядом с p-значением статистически значимый, но крошечный по смыслу результат на большой выборке легко принять за важное различие, хотя оно может не иметь практического значения для решений о продукте.
Третье ограничение касается интерпретации при неравной форме распределений двух групп: как отмечено выше, значимый результат при разной форме распределений не всегда означает разницу в типичном уровне ответов, и в таком случае полезнее смотреть на полное распределение, а не только на итоговое p-значение и медианы.
Пограничное p-значение: что делать, если результат неоднозначен
P-значение 0,048 и p-значение 0,06 формально попадают по разные стороны стандартного порога 0,05, но по существу говорят почти одно и то же — граница в пять процентов условна и не превращает результат из «случайного» в «настоящий» одним махом. Пограничный результат — это сигнал не подгонять формулировку под желаемый ответ, добавляя респондентов до тех пор, пока порог не будет пройден, а честно признать неопределённость: разница, возможно, есть, но данных пока недостаточно, чтобы утверждать это уверенно.
Практичный выход в пограничном случае — до принятия решения на основе результата собрать дополнительную порцию ответов по заранее определённому правилу, а не произвольно останавливаться, как только цифра станет устраивающей. Если решение слишком дорогое, чтобы ждать, честнее прямо написать в отчёте: «результат на грани значимости, требует подтверждения на большей выборке» — это менее эффектная формулировка, чем уверенное «разница подтверждена», но она не создаёт ложной уверенности у тех, кто будет принимать решение на основе цифры. Такая формулировка честнее и в долгосрочной перспективе полезнее: если разница подтвердится позже на дополнительных данных, доверие к аналитике вырастет, а если нет — не придётся объяснять задним числом, почему уверенный вывод оказался ошибочным.
Типичные ошибки
- Применять t-критерий к порядковой шкале по умолчанию, не проверив, распределены ли данные нормально.
- Использовать Манна-Уитни для связанных, а не независимых выборок вместо критерия Уилкоксона.
- Делать вывод о разнице средних значений, хотя критерий строго проверяет распределения целиком.
- Выбирать односторонний вариант критерия после того, как данные уже видны, ради меньшего p-значения.
- Не приводить медианы и эффект-размер рядом с p-значением в отчёте.
- Игнорировать разницу в форме распределений при интерпретации значимого результата.
С чего начать
Возьмите вопрос из последнего опроса с порядковой шкалой, где вы сравнивали две группы t-критерием, и посчитайте тот же результат Манна-Уитни на тех же данных. Если выводы совпадают — можно спокойно приводить более привычный параметрический результат в отчёте. Если расходятся — это сигнал, что форма распределения данных повлияла на вывод достаточно сильно, чтобы стоило довериться более осторожной непараметрической оценке и перепроверить решение, принятое на основе t-критерия, прежде чем действовать на его основании дальше.
Частые вопросы
T-критерий сравнивает средние значения двух групп и требует, чтобы данные были распределены приблизительно нормально, а шкала измерения имела равные интервалы между значениями. Манна-Уитни сравнивает ранги ответов обеих групп в общем отсортированном ряду и не требует ни нормальности, ни равных интервалов, поэтому подходит для порядковых шкал вроде оценки удовлетворённости от 1 до 5, малых выборок и данных с выбросами, которые искажают среднее значение сильнее, чем ранг.
Значимое p-значение говорит, что распределения ответов двух групп вряд ли совпадают, и на практике при типичных для опросов данных это почти всегда читается как разница в медианах или общем уровне ответов между группами. Строго критерий сравнивает распределения целиком, а не только медианы, поэтому при разной форме распределений двух групп значимый результат не всегда означает именно сдвиг типичного уровня — стоит дополнительно посмотреть на гистограммы обеих групп.
Нет, только к независимым выборкам, где респондент не может относиться сразу к обеим группам. Для связанных данных — например, ответы одних и тех же людей до и после изменения — нужен другой непараметрический метод, критерий знаковых рангов Уилкоксона, который учитывает парность наблюдений. Применение Манна-Уитни к связанным данным даёт некорректный результат, потому что критерий не знает о связи между конкретными парами ответов.
Критерий работает и на малых выборках, в этом его смысл, но статистическая мощность у него ниже, чем у t-критерия на тех же данных, если условия параметрики на самом деле выполнены. Практический ориентир — закладывать выборку на десять-пятнадцать процентов больше, чем потребовалось бы для t-критерия, и не меньше пятнадцати-двадцати ответов в самой маленькой из сравниваемых групп, иначе даже реальная разница рискует остаться незамеченной.