Метрики · 14 сентября 2026 г.
Критерии для связанных выборок: когда опрашиваете тех же людей дважды
Связанные, или парные, выборки — это когда один и тот же показатель измеряют у одних и тех же людей дважды или больше: оценку сервиса до и после обновления интерфейса, ответ клиента в двух волнах трекинга, реакцию сотрудника на три опроса подряд. Для такого дизайна нужен отдельный класс критериев, а не те, что сравнивают две разные группы людей. Непрерывный показатель, измеренный дважды, — парный t-критерий или критерий Уилкоксона. Категориальный признак дважды — критерий Мак-Немара. Три и больше замеров — критерий Фридмана. Путаница между независимыми и связанными выборками не ломает расчёт явно, а тихо занижает мощность теста или искажает p-значение. Ниже — как выбрать критерий и что каждый из них не может показать.
Чем связанные выборки отличаются от независимых групп
Независимые выборки — это когда в двух группах разные люди: клиенты филиала А и клиенты филиала Б, пользователи нового тарифа и пользователи старого. Между ответами двух групп нет естественной связи, кроме той, что вы сами ищете статистикой. Связанные выборки устроены иначе: один и тот же человек отвечает дважды, и его второй ответ систематически связан с первым — просто потому, что оба ответа дал один и тот же человек со своим уровнем терпимости, привычным способом отвечать и общим отношением к теме. Эта связь — не помеха, а полезная информация, которую специальные критерии умеют использовать.
Практический тест на связанность простой: можно ли для каждого наблюдения в одной выборке однозначно назвать пару в другой. Если да — это тот самый респондент до и после, тот же товар в оценке двух экспертов, тот же магазин в двух кварталах — выборки связаны. Если пары назвать нельзя, а есть просто два независимых набора людей или объектов, нужен другой класс тестов — для независимых выборок, о котором отдельный разговор в статьях про t-критерий, Манна-Уитни и Краскела-Уоллиса. Смешение этих двух классов задач — источник заметной доли ошибок в самостоятельных расчётах после опросов, потому что внешне таблицы с числами выглядят совершенно одинаково.
Проверка на практике занимает минуту: откройте таблицу с ответами и спросите себя, есть ли в ней столбец с идентификатором респондента, повторяющийся дважды. Если да и в каждой строке кроме идентификатора есть номер волны — перед вами связанные данные. Если каждая строка — это один человек, ответивший один раз, а сравнение идёт между строками с разным значением какого-то признака вроде тарифа или филиала — данные независимы, и весь этот класс критериев не подходит вовсе.
Почему для связанных выборок нужен отдельный тест
Если применить к парным данным тест для независимых выборок, результат не будет катастрофически неверным, но потеряет часть мощности. Тест для независимых групп видит только суммарный разброс ответов в каждой группе и не знает, что часть этого разброса объясняется устойчивыми различиями между людьми: кто-то в принципе ставит оценки выше, кто-то — ниже, независимо от того, что вы измеряете. Специальный критерий для связанных выборок убирает эту индивидуальную составляющую из уравнения и сравнивает только изменение внутри каждой пары, поэтому ему требуется меньше участников, чтобы обнаружить реальный эффект.
Есть и обратная опасность: применить парный тест к данным, которые на самом деле независимы. Тест решит, что пары связаны сильнее, чем есть на самом деле, и это может как завысить, так и занизить итоговую оценку значимости в зависимости от структуры данных. Правило простое и не имеет исключений: тип теста определяется дизайном сбора данных, а не тем, какой результат вы хотите получить. Если сомневаетесь, спросите: одна и та же анкета от одного и того же человека дважды, или две разные анкеты от разных людей?
Как выбрать критерий: три вопроса
Выбор конкретного теста для связанных выборок сводится к трём последовательным вопросам, и отвечать на них нужно по данным, а не по удобству расчёта.
- Сколько раз измерен показатель у одного и того же респондента: дважды или три и более раз?
- Какого типа переменная: непрерывная оценка (баллы, время, сумма) или категориальная (да/нет, выбор варианта)?
- Если переменная непрерывная — распределены ли разности между парами приблизительно нормально?
Пример на условных цифрах: сервис поддержки собрал оценку удовлетворённости у ста двадцати клиентов до внедрения нового скрипта общения и у тех же ста двадцати клиентов через месяц после. Показатель непрерывный — балл от одного до десяти, замера два, значит, дело за третьим вопросом: распределены ли разности между двумя оценками каждого клиента приблизительно нормально. Если гистограмма разностей выглядит колоколообразно без резких выбросов, подойдёт парный t-критерий; если в разностях есть перекос из-за пары клиентов, чья оценка изменилась драматически сильнее остальных, надёжнее критерий Уилкоксона. Цифры условные и нужны только для того, чтобы показать логику выбора, а не как ориентир для реального размера эффекта.
| Число замеров | Тип переменной | Критерий |
|---|---|---|
| 2 | Непрерывная, разности нормальны | Парный t-критерий |
| 2 | Непрерывная, разности не нормальны | Критерий Уилкоксона |
| 2 | Категориальная (да/нет) | Критерий Мак-Немара |
| 3 и более | Непрерывная, порядковая | Критерий Фридмана |
| 3 и более | Непрерывная, строго нормальна | Дисперсионный анализ с повторными измерениями |
Парный t-критерий и критерий Уилкоксона: два замера подряд
Когда показатель непрерывный и измерен дважды у одних и тех же людей — удовлетворённость до и после изменения, время выполнения задачи в двух версиях интерфейса, — выбор идёт между парным t-критерием и критерием Уилкоксона. Первый считает среднюю разность между парами и проверяет, отличается ли она от нуля, и требует, чтобы сами разности были распределены приблизительно нормально. Второй ранжирует абсолютные величины разностей и работает с рангами, а не с самими числами, поэтому переносит выбросы и асимметрию заметно спокойнее.
На практике для шкал Лайкерта и других порядковых оценок критерий Уилкоксона — более честный выбор по умолчанию: разница между баллом 8 и 9 не обязательно равна разнице между 3 и 4 психологически, а Уилкоксон опирается только на порядок и знак разностей, а не на их точную величину. Парный t-критерий уместен, когда показатель действительно похож на непрерывную величину — время на выполнение действия, сумма покупки — и выборка не совсем крошечная. Подробный разбор расчёта критерия Уилкоксона и типичных ошибок при его использовании — отдельная тема.
Критерий Мак-Немара: когда переменная категориальная
Если вместо баллов вы дважды спрашивали про да/нет — планирует ли клиент продлить подписку до и после изменения тарифа, согласен ли сотрудник рекомендовать компанию в двух волнах опроса, — парный t-критерий и Уилкоксон не подходят вовсе: у них нет механизма работы с бинарной категориальной переменной. Здесь нужен критерий Мак-Немара, который смотрит не на всех респондентов сразу, а только на тех, чей ответ изменился между двумя замерами, и проверяет, симметрично ли это изменение в обе стороны.
Логика критерия непривычна тем, кто раньше работал только с хи-квадратом для независимых групп: респонденты, ответившие «да» оба раза или «нет» оба раза, вообще не участвуют в расчёте — они не несут информации об изменении. Значение имеют только те, кто перешёл из одной категории в другую, и вопрос стоит так: одинаково ли часто люди меняют мнение в обе стороны, или переходы систематически идут в одну сторону чаще, чем в другую.
Критерий Фридмана: три и более замера подряд
Когда одних и тех же людей опрашивают не дважды, а три раза и больше — ежеквартальный трекинг вовлечённости, оценка трёх версий прототипа одними и теми же тестировщиками, — сравнение каждой пары волн отдельным критерием Уилкоксона накапливает ошибку множественных сравнений так же, как это происходит с t-критерием при трёх и более независимых группах. Критерий Фридмана решает эту задачу сразу для всех волн: он ранжирует значения внутри каждого респондента по всем замерам и проверяет, отличаются ли средние ранги волн друг от друга.
Значимый результат Фридмана говорит только, что где-то среди волн есть различие, но не указывает, между какими именно. Как и после значимого Краскела-Уоллиса, дальше нужны попарные апостериорные сравнения — обычно тем же Уилкоксоном для каждой пары волн — с поправкой на множественность, потому что теперь сравнений снова несколько. Параметрический аналог Фридмана — дисперсионный анализ с повторными измерениями — точнее при выполнении своих условий, но требует дополнительной проверки сферичности данных, которую на практике в опросах проверяют редко, поэтому Фридман остаётся более безопасным выбором по умолчанию. На практике для трекинговых опросов с четырьмя-шестью волнами это почти всегда рабочая связка: сам Фридман как первый фильтр, а Уилкоксон с поправкой — для локализации конкретной пары волн, где различие реально возникло.
Размер эффекта для связанных выборок
P-значение отвечает только на вопрос, есть ли эффект статистически, но не на вопрос, насколько он велик практически, и для связанных выборок это так же верно, как для независимых. Для парного t-критерия и Уилкоксона считают размер эффекта через отношение средней разности к разбросу разностей или через ранговую корреляцию по величине, аналогичную корреляции Спирмена. Для Мак-Немара содержательнее не абстрактный размер эффекта, а прямое число: сколько человек перешли из «нет» в «да» и сколько — в обратную сторону, потому что бизнесу нужен именно баланс переходов, а не статистика сама по себе.
Полезная практика — всегда указывать рядом с результатом теста долю респондентов, чей ответ реально изменился, а не только вывод «значимо» или «не значимо». Если в опросе из четырёхсот человек мнение поменяли пятнадцать, а критерий всё равно показал значимость благодаря большой выборке, решение «менять продукт под этот результат» будет неоправданным — эффект статистически реален, но затрагивает слишком узкую долю аудитории, чтобы быть приоритетом.
Отдельно стоит смотреть на направление эффекта, а не только на его величину. Средняя разность может быть положительной при том, что улучшение почувствовала лишь половина респондентов, а у другой половины оценка осталась прежней или снизилась. В отчёте честнее показать распределение индивидуальных изменений — сколько человек выросли в оценке, сколько остались на месте, сколько снизили её, — а не сворачивать всё в одно среднее число, которое одинаково хорошо описывает и равномерный рост у всех, и рост у меньшинства на фоне падения у части аудитории.
Типичные ошибки
- Применять t-критерий или Манна-Уитни для независимых групп к данным, где на самом деле опрошены одни и те же люди дважды.
- Выбирать критерий по тому, какой даёт нужный результат, а не по структуре данных.
- Использовать парный t-критерий для явно асимметричных данных без проверки распределения разностей.
- Сравнивать три и более волн серией отдельных Уилкоксонов без поправки на множественность.
- Считать значимый Мак-Немара доказательством того, что мнение изменилось у всех, а не у части респондентов.
- Игнорировать респондентов, ответивших одинаково в обоих замерах, при интерпретации результата Мак-Немара как «ничего не изменилось для всех».
- Путать связанные выборки с простым увеличением размера одной и той же группы между волнами при разном составе респондентов.
Ограничения подхода
Все критерии для связанных выборок требуют, чтобы пары действительно были парами: один и тот же человек, один и тот же объект наблюдения в обоих замерах. Если состав респондентов между волнами частично поменялся — кто-то не ответил во второй волне, кто-то появился только в ней, — использовать эти тесты напрямую нельзя: нужно либо оставить в анализе только полные пары, либо переходить к моделям, устойчивым к пропускам, что для типового опроса обычно избыточно.
Ещё одно ограничение — эти критерии ничего не говорят о причине изменения. Значимый рост удовлетворённости между волнами может отражать реальный эффект продуктового изменения, а может — сезонность, внешнее событие или простое привыкание к вопросу при повторном заполнении анкеты. Чем длиннее промежуток между замерами, тем больше конкурирующих объяснений нужно исключить прежде, чем приписывать разницу тому изменению, которое вы тестировали.
Стоит держать в уме и регрессию к среднему: респонденты, поставившие в первом замере крайне низкую или крайне высокую оценку, во втором замере статистически склонны сдвигаться к середине шкалы просто из-за случайного разброса, а не из-за реального изменения отношения. Если для второй волны вы намеренно выбрали именно недовольных клиентов первой волны, часть последующего улучшения окажется этим эффектом, а не результатом ваших действий — этот механизм разобран отдельно, потому что путают его чаще, чем кажется.
С чего начать
Прежде чем считать что-либо, ответьте на один вопрос: у вас действительно одни и те же респонденты в обоих замерах, идентифицированные однозначно — по email, номеру телефона или внутреннему ID? Без надёжной идентификации пары построить нельзя, и весь класс критериев для связанных выборок становится недоступен независимо от того, как хочется его применить. Если идентификация есть, дальше — по таблице выше: число замеров и тип переменной определяют тест почти автоматически, а сервис вроде «До Сути» позволяет привязать повторные ответы к одному респонденту по ссылке или коду уже на этапе сбора, а не пытаться сопоставлять их постфактум.
Частые вопросы
В связанных выборках один и тот же человек или объект измерен дважды и больше: клиент до и после обновления, тот же товар в оценке разных периодов. В независимых выборках в сравниваемых группах разные люди без естественной пары между ними. Практический тест простой: можно ли для каждого наблюдения в одной группе однозначно назвать соответствующее наблюдение в другой. Если да — выборки связаны, и нужен парный тест; если нет — обычный тест для независимых групп.
Если показатель непрерывный и разности между парами распределены приблизительно нормально — парный t-критерий. Если распределение разностей заметно скошено или есть выбросы, а также для порядковых шкал вроде Лайкерта — критерий Уилкоксона для связанных выборок, он устойчивее к отклонениям от нормальности. Если переменная категориальная, например да/нет, оба этих теста не подходят вовсе — там нужен критерий Мак-Немара, который сравнивает симметрию переходов между категориями.
Формально расчёт выполнится и даже может показать похожий результат, но тест для независимых групп не использует информацию о том, что ответы связаны через одного и того же человека, и поэтому теряет статистическую мощность. Ему требуется больше данных, чтобы найти реальный эффект, потому что индивидуальные различия между людьми добавляются в общий разброс вместо того, чтобы вычитаться из него. На маленьких выборках это может превратить реально значимый результат в статистически незначимый.
Критерии для связанных выборок требуют полных пар, поэтому стандартный путь — оставить в анализе только тех, кто ответил в обоих замерах, а не пытаться заполнить пропуски произвольно. Стоит отдельно проверить, не связан ли отказ отвечать повторно с самим измеряемым показателем: если из опроса выпадают в основном недовольные клиенты, оставшаяся выборка окажется смещена в сторону более позитивных оценок, и об этом нужно честно сказать в отчёте.