Метрики · 10 сентября 2026 г.
Непараметрические критерии в опросах: что делать, когда t-критерий не подходит
Непараметрические критерии — это статистические тесты, которые не требуют нормального распределения данных и подходят для порядковых шкал вроде оценок от 1 до 5. Их используют вместо t-критерия, ANOVA и корреляции Пирсона, когда данные опроса этим методам не соответствуют: ответы по шкале Лайкерта, маленькая выборка, категориальные вопросы вроде выбора канала связи. Четыре критерия закрывают почти все практические случаи: хи-квадрат для категориальных вопросов, Манна-Уитни для сравнения двух групп, Краскела-Уоллиса для трёх и более, Спирмен для связи между порядковыми переменными. Ниже — когда какой выбрать и что при этом теряется.
Когда параметрические критерии перестают работать
T-критерий, дисперсионный анализ и корреляция Пирсона — параметрические методы: они опираются на конкретное предположение о том, как распределены данные, обычно на нормальное распределение, и требуют шкалы, где расстояние между значениями действительно одинаково — интервальной или относительной. Средний чек в рублях этому условию отвечает: разница между 1000 и 2000 рублей ровно такая же, как между 5000 и 6000. С оценкой по шкале от 1 до 5 в опросе так уверенно утверждать нельзя: расстояние между «2» и «3» психологически не обязано равняться расстоянию между «4» и «5», а сама шкала часто скошена к одному краю, а не распределена колоколом вокруг середины.
Второй частый повод — маленькая выборка. Параметрические критерии опираются на то, что при достаточном числе наблюдений среднее значение по выборке само по себе распределяется приблизительно нормально, даже если исходные данные не нормальны, — это центральная предельная теорема, и на практике она начинает уверенно работать примерно от тридцати наблюдений в группе. На пятнадцати ответах в одной ветке опроса эта опора ещё не сработала, и результат t-критерия может ошибаться сильнее, чем кажется. Непараметрические критерии эту опору не используют вовсе, поэтому остаются корректными и на малых, и на скошенных выборках — но платят за это меньшей чувствительностью, о чём ниже.
Что такое непараметрические критерии простыми словами
Общая идея у всех непараметрических методов одна: вместо самих значений они чаще всего работают с рангами — местом наблюдения в отсортированном ряду — или с частотами попадания в категорию. Ранг устойчив к форме распределения и к выбросам: аномально большое значение сдвигает среднее заметно, а ранг — максимум на одну позицию. Именно поэтому непараметрику называют ещё «устойчивыми» методами: они меньше зависят от того, насколько ровно и симметрично выглядят исходные данные, и не ломаются от одного нетипичного ответа в выборке.
Порядковые шкалы и малые выборки — два повода перейти на непараметрику
На практике решение принимается по трём вопросам. Первый — какого типа переменная: категориальная без порядка вроде выбранного канала связи, порядковая вроде шкалы удовлетворённости, или числовая непрерывная вроде времени ответа в секундах. Для категориальных без порядка параметрических альтернатив вообще не существует — здесь нужен хи-квадрат в любом случае. Второй вопрос — распределена ли числовая переменная хотя бы приблизительно нормально; для этого можно посмотреть на гистограмму или посчитать асимметрию, если инструмент это позволяет. Третий — сколько наблюдений в самой маленькой из сравниваемых групп.
Если ответ на любой из этих вопросов говорит не в пользу параметрики — переменная порядковая, распределение явно скошено, самая маленькая группа меньше тридцати ответов, — безопаснее взять непараметрический критерий. Ошибиться в обратную сторону дороже: применить t-критерий там, где он не подходит, значит получить p-значение, которое не отражает реальную вероятность случайности разницы, и принять решение на основании цифры, которая обещает больше уверенности, чем есть на самом деле.
| Задача | Параметрический критерий | Непараметрический аналог |
|---|---|---|
| Сравнить две независимые группы | t-критерий Стьюдента | U-критерий Манна-Уитни |
| Сравнить три и более группы | Дисперсионный анализ (ANOVA) | Критерий Краскела-Уоллиса |
| Связь между двумя числовыми переменными | Корреляция Пирсона | Корреляция Спирмена |
| Связь между двумя категориальными вопросами | Аналога нет | Критерий хи-квадрат |
| Данные | Интервальные, распределены нормально | Порядковые, скошенные, с выбросами |
| Работает с | Средними значениями | Рангами или частотами |
| Устойчивость к выбросам | Низкая | Высокая |
Хи-квадрат — проверка связи между категориальными вопросами
Хи-квадрат отвечает на вопрос, есть ли связь между двумя категориальными переменными: например, зависит ли выбор канала обратной связи от сегмента клиента, или отличается ли доля жалоб по типам продукта. Это следующий шаг после кросс-табуляции: сама таблица показывает разницу долей визуально, а хи-квадрат отвечает, объясняется ли эта разница случайностью выборки или отражает реальную связь в генеральной совокупности. Тест сравнивает наблюдаемые частоты в каждой ячейке таблицы с частотами, которые ожидались бы, если бы переменные были независимы друг от друга. Подробный разбор с формулой и условиями применимости — в отдельной статье про критерий хи-квадрат.
Ключевое ограничение хи-квадрата — требование к размеру ожидаемой частоты в ячейках таблицы: если в каком-то сочетании категорий ожидается меньше пяти наблюдений, результат теста становится ненадёжным, и стандартный выход — укрупнить категории или перейти на точный критерий Фишера, который для малых таблиц считает вероятность точно, а не приближённо. Эта деталь легко упускается на практике: опрос с редким сегментом клиентов и десятком каналов связи почти всегда даёт часть ячеек с единичными наблюдениями, и запускать хи-квадрат на такой таблице без предварительного укрупнения — источник ложных выводов, которые выглядят статистически убедительно.
Манна-Уитни и Краскела-Уоллиса — сравнение групп без нормальности
U-критерий Манна-Уитни сравнивает две независимые группы по порядковой или скошенной числовой переменной — типичный случай: сравнить оценки удовлетворённости у клиентов двух тарифов. Вместо сравнения средних он объединяет все ответы обеих групп в один ранжированный ряд и смотрит, не оказались ли ранги одной группы систематически выше рангов другой. Критерий Краскела-Уоллиса делает то же самое для трёх и более групп и по сути является обобщением Манна-Уитни — но, как и обычная ANOVA, отвечает только на вопрос «есть ли разница хоть где-то», а не «между какими именно группами». Оба метода разобраны подробнее в отдельных статьях, включая то, что делать после значимого результата Краскела-Уоллиса.
Важная оговорка для обоих критериев: они сравнивают не буквально средние значения, а распределения целиком, и формально значимый результат означает, что распределения различаются, — на практике это почти всегда читается как разница в типичном уровне ответов между группами, но строго говорящий об этом показатель — медиана каждой группы, а не среднее. При отчёте перед коллегами полезно сразу приводить медианы рядом с результатом теста: цифра «медиана 4 против медианы 3» понятна без объяснения, что такое ранги, а сам факт значимости лишь подтверждает, что увиденная разница не случайна.
Спирмен вместо Пирсона — когда шкала порядковая
Корреляция Спирмена измеряет связь между двумя переменными так же, как Пирсон, — числом от минус единицы до единицы, — но вместо самих значений использует их ранги. Это делает её пригодной для порядковых шкал, где нельзя быть уверенным в равенстве интервалов между соседними баллами, и устойчивой к нелинейным, но монотонным связям: если рост одной переменной стабильно сопровождается ростом другой, но не строго по прямой линии, Пирсон это недооценит, а Спирмен уловит корректно. Ещё одно практическое преимущество — устойчивость к единичным аномальным ответам, которые в обычной корреляции способны исказить результат сильнее, чем кажется на выборке из полусотни наблюдений.
Пример: одна анкета, три типа вопросов, три критерия
Представим короткий опрос после обращения в поддержку: пользователь выбирает канал, которым воспользовался (чат, почта, телефон), ставит оценку удовлетворённости по шкале от 1 до 5 и указывает свой тарифный сегмент. Три вопроса в одной анкете — и три разных критерия для их анализа. Связь между выбранным каналом и тарифным сегментом — это связь двух категориальных переменных без числового смысла, и здесь работает только хи-квадрат: сравнивать «средний» канал бессмысленно, а вот сравнить распределение долей по таблице сопряжённости можно. Цифры в примере условные и нужны только для того, чтобы показать логику выбора критерия, а не как ориентир по реальным долям.
Сравнение оценки удовлетворённости между пользователями чата и почты — это уже сравнение двух групп по порядковой переменной, и здесь уместен Манна-Уитни, а не t-критерий, потому что пятибалльная шкала не гарантирует равных интервалов между соседними значениями. А если групп три — чат, почта, телефон, — тот же вопрос решается критерием Краскела-Уоллиса, и значимый результат здесь означает только то, что хотя бы одна пара каналов отличается, а не то, что отличаются все три сразу. Если бы вместо оценки удовлетворённости стояла числовая метрика вроде времени решения обращения в минутах с явно нормальным распределением, для тех же сравнений подошли бы обычные t-критерий и ANOVA — выбор критерия определяется не самим фактом сравнения групп, а типом и распределением переменной.
Как выбрать нужный критерий — практический алгоритм
- Определите тип переменной: категориальная без порядка, порядковая или числовая непрерывная.
- Если сравниваете две категориальные переменные между собой — сразу берите хи-квадрат.
- Если сравниваете две независимые группы по числовому или порядковому показателю — проверьте распределение.
- При явном отклонении от нормальности или выборке меньше тридцати в группе — берите Манна-Уитни.
- Для трёх и более групп по той же логике — критерий Краскела-Уоллиса вместо ANOVA.
- Для связи двух порядковых или скошенных числовых переменных — корреляция Спирмена вместо Пирсона.
- В спорном случае посчитайте оба варианта: похожий результат снимает вопрос, разный — повод разобраться, что искажает параметрику.
Последний пункт стоит воспринимать буквально, а не как формальность. Если параметрический и непараметрический критерий на одних и тех же данных дают одинаковый вывод о наличии или отсутствии разницы, можно спокойно приводить в отчёте более привычный параметрический результат — читателю не придётся объяснять, что такое ранги. Расхождение выводов — сигнал, что распределение данных действительно нарушает условия параметрики достаточно сильно, чтобы это повлияло на решение, и здесь стоит довериться непараметрическому результату как более осторожной оценке.
Что теряется при переходе на непараметрику
Главная плата за устойчивость — статистическая мощность. Если данные на самом деле распределены нормально и условия параметрики выполняются, непараметрический критерий на тех же данных обнаруживает реальную разницу реже, чем параметрический: часть информации теряется при переходе от значений к рангам. На практике это означает, что для обнаружения того же по величине эффекта непараметрике требуется выборка на десять-пятнадцать процентов больше. Поэтому выбор непараметрики — это не универсально безопасное решение по умолчанию, а компромисс, оправданный именно тогда, когда условия параметрики действительно не выполняются.
Второе ограничение — интерпретация результата менее наглядна. Параметрический критерий даёт разницу средних в тех же единицах, что и сама метрика: «удовлетворённость выше на 0,4 балла». Непараметрический критерий строго говорит только о различии распределений или рангов, и переводить это в разницу медиан или содержательную формулировку нужно отдельным шагом, а не автоматически. Для отчёта перед нестатистической аудиторией это неудобство стоит продумать заранее: голая p-значимость без понятной формулировки эффекта звучит убедительно, но ничего не объясняет тому, кто принимает решение. Практический выход — всегда добавлять к результату теста медианы или доли сравниваемых групп в исходных единицах измерения, а сам критерий использовать только как формальную проверку на случайность различия, а не как единственную цифру в итоговом отчёте.
Типичные ошибки
- Применять t-критерий к пятибалльной шкале Лайкерта по умолчанию, не проверив альтернативу.
- Выбирать непараметрику всегда «на всякий случай», теряя статистическую мощность там, где она не нужна.
- Использовать хи-квадрат при маленьких ожидаемых частотах в ячейках таблицы без точного критерия Фишера.
- Останавливаться на значимом результате Краскела-Уоллиса без апостериорного сравнения групп попарно.
- Путать корреляцию Спирмена с причинно-следственной связью между переменными.
- Не проверять распределение вовсе и выбирать критерий наугад или по привычке.
- Приводить в отчёте только p-значение непараметрического теста без оценки величины различия.
- Смешивать в одной таблице хи-квадрат категориальные переменные с числовыми без предварительной группировки в категории.
С чего начать
Возьмите один вопрос из последнего опроса, где вы уже сравнивали группы — тарифы, каналы, сегменты, — и посмотрите на распределение ответов гистограммой. Если оно заметно скошено, шкала порядковая, а группа меньше тридцати ответов, посчитайте результат и параметрическим, и непараметрическим методом параллельно. Расчёт хи-квадрата, Манна-Уитни, Краскела-Уоллиса и Спирмена делается во внешнем статистическом инструменте после выгрузки ответов — в сервисе «До Сути» опрос собирается и хранится, а сам выбор и расчёт критерия остаётся задачей того, кто анализирует данные. Сравнение результатов двух подходов на знакомых данных — лучший способ увидеть разницу не в теории, а на практике.
Частые вопросы
Параметрические критерии — t-критерий, ANOVA, корреляция Пирсона — требуют, чтобы данные были распределены определённым образом, обычно нормально, и измерены в шкале с равными интервалами между значениями. Непараметрические критерии этого не требуют: они работают с рангами или частотами вместо самих значений, поэтому подходят для порядковых шкал вроде оценок от 1 до 5, малых выборок и данных с выбросами. Плата за эту гибкость — меньшая статистическая мощность на тех данных, где параметрика была бы уместна.
Если сравниваемая переменная числовая, распределена приблизительно нормально и в каждой группе больше тридцати ответов — уместен обычный t-критерий. Если переменная порядковая, вроде оценки удовлетворённости, распределение заметно скошено или выборка меньше — используйте U-критерий Манна-Уитни. Он сравнивает не средние значения, а ранги ответов обеих групп в общем ряду, и остаётся корректным независимо от формы распределения исходных данных.
Хи-квадрат нужен, когда обе сравниваемые переменные категориальные, то есть не имеют числового или порядкового смысла: выбранный канал связи, тип обращения, регион. У такого сравнения параметрической альтернативы вообще не существует — сравнивать средние значения категорий бессмысленно. Тест проверяет, отличаются ли наблюдаемые частоты в таблице сопряжённости от тех, что ожидались бы при полной независимости переменных, и требует, чтобы ожидаемая частота в большинстве ячеек была не меньше пяти.
Нет. Если условия параметрического критерия на самом деле выполняются — данные нормальны, выборка достаточно большая, — непараметрический аналог обнаруживает реальную разницу реже, потому что теряет часть информации при переходе к рангам. Использовать непараметрику по умолчанию «для надёжности» на подходящих данных — значит без нужды снижать шанс заметить реальный эффект. Выбор стоит делать осознанно, по фактическому распределению и размеру выборки, а не по общему правилу.