Метрики · 14 сентября 2026 г.
Критерий Уилкоксона для связанных выборок: сравниваем тех же людей дважды
Критерий Уилкоксона для связанных выборок — непараметрический тест, который проверяет, изменился ли показатель у одних и тех же респондентов между двумя замерами: оценка сервиса до и после доработки, балл удобства интерфейса в двух версиях у одних тестировщиков. Вместо самих чисел он работает с рангами абсолютных величин разностей и их знаками, поэтому не требует нормального распределения и устойчив к выбросам — паре респондентов, чья оценка изменилась резче остальных. Это парный аналог критерия Манна-Уитни: там ранжируют объединённую выборку двух независимых групп, здесь — разности внутри пар одной и той же группы. Ниже — как он считается, чем отличается от парного t-критерия и в каких случаях выбор теста меняет вывод.
Когда нужен именно этот критерий
Критерий Уилкоксона для связанных выборок применяют, когда один и тот же непрерывный или порядковый показатель измерен дважды у одних и тех же людей, а условие нормальности распределения разностей не выполняется или его невозможно проверить из-за маленькой выборки. Типичный случай — балл по шкале Лайкерта до и после изменения: разница между соседними баллами шкалы не обязательно означает одно и то же психологическое расстояние на всём её протяжении, а критерий Уилкоксона использует только знак и относительную величину разности, а не её точное числовое значение.
Второй частый повод — выбросы. Если сорок пять из пятидесяти клиентов изменили оценку на один-два балла, а пятеро — на семь-восемь из-за нетипичной ситуации, парный t-критерий, чувствительный к средним значениям, может сделать вывод, продиктованный именно этими пятью случаями. Критерий Уилкоксона переводит все разности в ранги по абсолютной величине, и экстремальное значение получает большой ранг, но не искажает результат так, как искажало бы прямое среднее по сырым числам.
Практический пример: команда поддержки переписала шаблоны ответов и хочет понять, выросла ли оценка удовлетворённости у тех же клиентов, которые уже оценивали старые шаблоны месяц назад. Выборка небольшая — тридцать пять клиентов, — и заранее неизвестно, насколько симметрично распределены изменения оценки. В такой ситуации критерий Уилкоксона безопаснее парного t-критерия по умолчанию: он не потребует дополнительной проверки нормальности, которая на тридцати пяти наблюдениях и так ненадёжна, и не даст неверный вывод, если один клиент резко поменял оценку из-за отдельного инцидента, не связанного с новыми шаблонами.
Как считается критерий: ранги разностей
Расчёт идёт в несколько шагов. Сначала для каждой пары находят разность между вторым и первым замером. Пары с нулевой разностью — когда ответ не изменился совсем — из расчёта исключают, и это первое, что стоит знать: чем больше людей ответили одинаково оба раза, тем меньше пар реально участвует в тесте, даже если исходная выборка выглядит внушительной. Затем все оставшиеся разности ранжируют по абсолютной величине, не обращая внимания на знак, — самая маленькая по модулю разность получает ранг один.
После ранжирования каждому рангу возвращают исходный знак разности, и дальше сравнивают сумму рангов положительных изменений с суммой рангов отрицательных. Если реального сдвига нет, обе суммы должны быть примерно равны — рост и снижение оценки происходят одинаково часто и с сопоставимой величиной. Тест-статистика W равна меньшей из двух сумм, и чем она меньше относительно возможного максимума, тем более выражен перекос в одну сторону, а значит тем меньше итоговое p-значение.
Отдельного внимания заслуживают связанные ранги — когда у двух и более пар абсолютная величина разности совпадает. В этом случае им присваивают средний ранг из тех, что они делили бы при небольшом различии: если два одинаковых по модулю значения претендуют на второе и третье место, оба получают ранг два с половиной. Такая корректировка почти всегда выполняется автоматически в статистических пакетах, но при ручном расчёте по небольшой выборке её легко упустить, и тогда сумма рангов считается неверно уже на этом шаге, до всякой интерпретации p-значения.
На таблице выше видно, как это работает на пяти условных наблюдениях. Второй респондент не изменил оценку и выпадает из расчёта. У третьего и четвёртого модуль разности одинаков и равен одному баллу, поэтому оба получают средний ранг полтора вместо того, чтобы один занял первое место, а другой второе. Дальше сумма рангов положительных разностей — здесь все оставшиеся разности положительны — сравнивается с теоретическим распределением этой суммы при отсутствии эффекта, и именно из этого сравнения получается итоговое p-значение. Цифры в примере условные и нужны только для того, чтобы показать механику расчёта, а не как ориентир для реальной выборки.
| Респондент | До | После | Разность | Ранг |разности| |
|---|---|---|---|---|
| 1 | 5 | 7 | +2 | 3 |
| 2 | 6 | 6 | 0 | исключён |
| 3 | 4 | 5 | +1 | 1.5 |
| 4 | 8 | 9 | +1 | 1.5 |
| 5 | 3 | 8 | +5 | 4 |
Чем отличается от парного t-критерия
Парный t-критерий использует точные величины разностей и их среднее: разность в пять баллов весит в пять раз больше разности в один балл. Критерий Уилкоксона работает только с рангами, поэтому разность в пять баллов и разность в четыре при отсутствии других значений между ними могут получить соседние ранги — тест видит, что одно изменение больше другого, но не во сколько именно раз. Это и делает его устойчивее к выбросам, и одновременно немного менее мощным, когда данные на самом деле нормальны: в такой ситуации t-критерий использует больше информации и находит эффект чуть увереннее при том же объёме данных.
Практическое правило простое: если показатель — это время, деньги или другая величина, где числа сопоставимы по всей шкале и распределение разностей не выглядит перекошенным, берите парный t-критерий. Если это оценка по шкале, где психологическое расстояние между делениями не гарантированно одинаково, или если в разностях видны явные выбросы, берите критерий Уилкоксона. При сомнении можно посчитать оба — на реальных данных выводы почти всегда совпадают, а расхождение само по себе сигнал присмотреться к распределению внимательнее.
Как читать результат
Итоговое p-значение критерия Уилкоксона интерпретируется так же, как у любого другого теста значимости: это вероятность получить такой или более выраженный перекос сумм рангов, если на самом деле никакого систематического изменения между двумя замерами нет. Малое p-значение говорит, что направленный сдвиг — рост или падение оценки — статистически маловероятен как случайность. Оно не говорит, что сдвиг наблюдался у всех респондентов: часть могла остаться на месте, часть — измениться в противоположную сторону, и итоговый результат отражает баланс, а не единодушие.
Отдельно нужно смотреть на число пар, реально участвовавших в расчёте, — то есть на выборку без нулевых разностей. Если из ста опрошенных ответ не изменили семьдесят, тест фактически опирается на тридцать пар, и это стоит явно указывать в отчёте рядом с p-значением. Большое число неизменившихся ответов само по себе результат: возможно, изменение, которое вы тестировали, ощутила лишь часть аудитории, и это важнее самого факта статистической значимости на оставшихся тридцати наблюдениях.
Размер эффекта: ранговая корреляция
Для критерия Уилкоксона размер эффекта обычно считают через ранговую корреляцию, аналогичную по духу корреляции Спирмена: она показывает, насколько последовательно изменения идут в одну сторону, в шкале от минус одного до одного. Значение около нуля означает, что положительные и отрицательные сдвиги уравновешивают друг друга, значение, близкое по модулю к единице, — что почти все изменившие оценку респонденты сдвинулись в одну сторону. Именно эта цифра, а не p-значение, отвечает на содержательный вопрос «насколько цельным было изменение», и её стоит приводить рядом с выводом о значимости.
На большой выборке даже слабая, практически малозначимая ранговая корреляция даёт крохотное p-значение, поэтому отчёт, где указано только «p меньше 0,01», без размера эффекта, легко создаёт впечатление сильного результата там, где реальный сдвиг мнений минимален. Правило то же, что и для остальных тестов значимости: p-значение отвечает на вопрос «есть ли эффект», размер эффекта — на вопрос «насколько он велик», и решения принимаются по второму, а не по первому.
Условия применимости
- Данные должны быть парными: один и тот же респондент или объект в обоих замерах, однозначно сопоставленный.
- Показатель — порядковый или непрерывный, но не категориальный без внутреннего порядка.
- Распределение разностей желательно симметричным относительно медианы, хотя строгая нормальность не требуется.
- Число пар с ненулевой разностью должно быть достаточным — при менее чем пяти-шести парах тест почти не имеет мощности.
Последнее условие стоит проверять отдельно от общего размера выборки. Опрос на триста человек с идентификацией по email может дать всего двадцать пар с ненулевой разностью, если большинство ответило одинаково оба раза, и на таких двадцати парах тест уже работает на грани мощности. Планируя повторный замер, закладывайте запас: если ожидаете, что изменение почувствует лишь часть аудитории, исходную выборку нужно увеличивать пропорционально этой ожидаемой доле, а не ориентироваться на общее число разосланных приглашений или на итоговый процент ответивших на анкету людей.
Условие симметричности распределения разностей упоминают реже, чем стоило бы: критерий Уилкоксона строго проверяет гипотезу о равенстве нулю медианы разностей только при симметричном распределении. Если разности сильно скошены — например, оценка почти у всех выросла незначительно, а у небольшой группы упала резко, — интерпретация теста как проверки именно медианы становится менее строгой, хотя направление общего вывода обычно остаётся верным. В спорных случаях полезно визуально посмотреть на гистограмму разностей, а не полагаться только на итоговое число.
Стоит также учитывать масштаб исходной шкалы. На пятибалльной шкале число различимых значений разности невелико — от минус четырёх до плюс четырёх, — и при маленькой выборке связанных рангов окажется много, что немного снижает точность теста. На десятибалльной или стобалльной шкале разностей больше, и точность выше при том же числе респондентов. Это не повод отказываться от коротких шкал, но повод не удивляться, если на пятидесяти респондентах с пятибалльной шкалой критерий Уилкоксона окажется менее чувствительным, чем ожидалось по одной лишь величине выборки.
Типичные ошибки
- Применять критерий к независимым группам вместо связанных пар одних и тех же людей.
- Не сообщать, сколько пар исключено из-за нулевой разности, и как это влияет на итоговую выборку.
- Путать критерий Уилкоксона для связанных выборок с критерием Манна-Уитни для независимых — названия близкие, задачи разные.
- Делать вывод об эффекте только по p-значению, без ранговой корреляции как меры размера эффекта.
- Использовать этот тест для категориальной переменной без внутреннего порядка вместо критерия Мак-Немара.
- Игнорировать асимметрию распределения разностей при интерпретации результата как утверждения о медиане.
Ограничения
Критерий Уилкоксона, как и любой тест значимости, не объясняет причину изменения и не отличает эффект вашего вмешательства от параллельных внешних факторов — сезонности, новостного фона, обновления у конкурентов. Он также требует однозначной идентификации пар: если между двумя волнами часть респондентов сменилась, тест применять нельзя без предварительной фильтрации до полных пар. И, как и парный t-критерий, он ничего не говорит о величине изменения в исходных единицах — только о ранге и направлении, поэтому для отчёта перед бизнесом обычно нужны ещё и сырые описательные цифры: средние баллы до и после, доля выросших и снизившихся оценок.
Ещё один момент, который редко упоминают: критерий сам по себе не различает практически значимое изменение и статистический шум на большой выборке. Тысяча пар с крохотным, но систематическим сдвигом даст такое же уверенное p-значение, как сто пар с заметным изменением. Поэтому вывод «критерий Уилкоксона показал значимый рост» без указания медианы разности и доли изменившихся респондентов остаётся неполным — читателю отчёта нужны обе цифры, чтобы решить, стоит ли результат дальнейших действий.
С чего начать
Соберите данные так, чтобы каждый респондент был однозначно идентифицирован в обоих замерах — по ссылке с уникальным кодом или по логину, а не по анонимной форме, где сопоставить пары невозможно. В сервисе «До Сути» для этого достаточно разослать персональные ссылки с меткой респондента и повторить тот же опрос через нужный интервал — тогда пары для критерия Уилкоксона собираются сами, без ручного сопоставления анкет после сбора. Посчитайте разности, постройте гистограмму и оцените, насколько она симметрична и есть ли выбросы: это займёт пять минут и сразу подскажет, нужен ли парный t-критерий или его непараметрический аналог. Если сомневаетесь в выборе, посчитайте оба теста — на реальных данных они почти всегда сходятся в выводе, а расхождение станет поводом внимательнее посмотреть на распределение, а не поводом для паники.
Частые вопросы
Манна-Уитни сравнивает две независимые группы разных людей, ранжируя объединённую выборку целиком. Уилкоксон для связанных выборок сравнивает два замера у одних и тех же людей, ранжируя не сами значения, а абсолютные величины разностей внутри каждой пары, с учётом их знака. Названия похожи и легко перепутать, но задачи разные: первый — про разных людей в двух группах, второй — про одних и тех же людей, опрошенных дважды.
Когда распределение разностей между двумя замерами заметно скошено или содержит выбросы, а также когда показатель — порядковая шкала вроде Лайкерта, где расстояние между соседними баллами не гарантированно одинаково на всём диапазоне. Парный t-критерий уместнее для величин вроде времени или денег с симметричным распределением разностей и без резких выбросов. При небольшой выборке, где нормальность трудно проверить, критерий Уилкоксона — более безопасный выбор по умолчанию.
Респонденты, ответившие одинаково в обоих замерах, не несут информации об изменении и не участвуют в расчёте суммы рангов. Это не ошибка теста, а часть его логики, но важно всегда указывать, сколько пар реально вошло в анализ. Если из ста опрошенных ответ не изменили семьдесят, вывод о значимости строится всего на тридцати наблюдениях, и это стоит явно проговорить в отчёте, а не прятать за общим размером выборки.
Само p-значение отвечает только на вопрос, есть ли направленный сдвиг статистически. Насколько он выражен, показывает ранговая корреляция в диапазоне от минус одного до одного: значения около нуля означают, что рост и снижение оценки уравновешивают друг друга, значения, близкие по модулю к единице — что почти все изменившие оценку сдвинулись в одну сторону. На большой выборке даже слабая корреляция даёт крохотное p-значение, поэтому размер эффекта важнее для содержательного вывода.