«До Сути»← Все статьи

Метрики · 14 сентября 2026 г.

Критерии для связанных выборок: когда опрашиваете тех же людей дважды

Связанные, или парные, выборки — это когда один и тот же показатель измеряют у одних и тех же людей дважды или больше: оценку сервиса до и после обновления интерфейса, ответ клиента в двух волнах трекинга, реакцию сотрудника на три опроса подряд. Для такого дизайна нужен отдельный класс критериев, а не те, что сравнивают две разные группы людей. Непрерывный показатель, измеренный дважды, — парный t-критерий или критерий Уилкоксона. Категориальный признак дважды — критерий Мак-Немара. Три и больше замеров — критерий Фридмана. Путаница между независимыми и связанными выборками не ломает расчёт явно, а тихо занижает мощность теста или искажает p-значение. Ниже — как выбрать критерий и что каждый из них не может показать.

Чем связанные выборки отличаются от независимых групп

Независимые выборки — это когда в двух группах разные люди: клиенты филиала А и клиенты филиала Б, пользователи нового тарифа и пользователи старого. Между ответами двух групп нет естественной связи, кроме той, что вы сами ищете статистикой. Связанные выборки устроены иначе: один и тот же человек отвечает дважды, и его второй ответ систематически связан с первым — просто потому, что оба ответа дал один и тот же человек со своим уровнем терпимости, привычным способом отвечать и общим отношением к теме. Эта связь — не помеха, а полезная информация, которую специальные критерии умеют использовать.

Практический тест на связанность простой: можно ли для каждого наблюдения в одной выборке однозначно назвать пару в другой. Если да — это тот самый респондент до и после, тот же товар в оценке двух экспертов, тот же магазин в двух кварталах — выборки связаны. Если пары назвать нельзя, а есть просто два независимых набора людей или объектов, нужен другой класс тестов — для независимых выборок, о котором отдельный разговор в статьях про t-критерий, Манна-Уитни и Краскела-Уоллиса. Смешение этих двух классов задач — источник заметной доли ошибок в самостоятельных расчётах после опросов, потому что внешне таблицы с числами выглядят совершенно одинаково.

Проверка на практике занимает минуту: откройте таблицу с ответами и спросите себя, есть ли в ней столбец с идентификатором респондента, повторяющийся дважды. Если да и в каждой строке кроме идентификатора есть номер волны — перед вами связанные данные. Если каждая строка — это один человек, ответивший один раз, а сравнение идёт между строками с разным значением какого-то признака вроде тарифа или филиала — данные независимы, и весь этот класс критериев не подходит вовсе.

Почему для связанных выборок нужен отдельный тест

Если применить к парным данным тест для независимых выборок, результат не будет катастрофически неверным, но потеряет часть мощности. Тест для независимых групп видит только суммарный разброс ответов в каждой группе и не знает, что часть этого разброса объясняется устойчивыми различиями между людьми: кто-то в принципе ставит оценки выше, кто-то — ниже, независимо от того, что вы измеряете. Специальный критерий для связанных выборок убирает эту индивидуальную составляющую из уравнения и сравнивает только изменение внутри каждой пары, поэтому ему требуется меньше участников, чтобы обнаружить реальный эффект.

Есть и обратная опасность: применить парный тест к данным, которые на самом деле независимы. Тест решит, что пары связаны сильнее, чем есть на самом деле, и это может как завысить, так и занизить итоговую оценку значимости в зависимости от структуры данных. Правило простое и не имеет исключений: тип теста определяется дизайном сбора данных, а не тем, какой результат вы хотите получить. Если сомневаетесь, спросите: одна и та же анкета от одного и того же человека дважды, или две разные анкеты от разных людей?

Как выбрать критерий: три вопроса

Выбор конкретного теста для связанных выборок сводится к трём последовательным вопросам, и отвечать на них нужно по данным, а не по удобству расчёта.

  1. Сколько раз измерен показатель у одного и того же респондента: дважды или три и более раз?
  2. Какого типа переменная: непрерывная оценка (баллы, время, сумма) или категориальная (да/нет, выбор варианта)?
  3. Если переменная непрерывная — распределены ли разности между парами приблизительно нормально?

Пример на условных цифрах: сервис поддержки собрал оценку удовлетворённости у ста двадцати клиентов до внедрения нового скрипта общения и у тех же ста двадцати клиентов через месяц после. Показатель непрерывный — балл от одного до десяти, замера два, значит, дело за третьим вопросом: распределены ли разности между двумя оценками каждого клиента приблизительно нормально. Если гистограмма разностей выглядит колоколообразно без резких выбросов, подойдёт парный t-критерий; если в разностях есть перекос из-за пары клиентов, чья оценка изменилась драматически сильнее остальных, надёжнее критерий Уилкоксона. Цифры условные и нужны только для того, чтобы показать логику выбора, а не как ориентир для реального размера эффекта.

Число замеровТип переменнойКритерий
2Непрерывная, разности нормальныПарный t-критерий
2Непрерывная, разности не нормальныКритерий Уилкоксона
2Категориальная (да/нет)Критерий Мак-Немара
3 и болееНепрерывная, порядковаяКритерий Фридмана
3 и болееНепрерывная, строго нормальнаДисперсионный анализ с повторными измерениями

Парный t-критерий и критерий Уилкоксона: два замера подряд

Когда показатель непрерывный и измерен дважды у одних и тех же людей — удовлетворённость до и после изменения, время выполнения задачи в двух версиях интерфейса, — выбор идёт между парным t-критерием и критерием Уилкоксона. Первый считает среднюю разность между парами и проверяет, отличается ли она от нуля, и требует, чтобы сами разности были распределены приблизительно нормально. Второй ранжирует абсолютные величины разностей и работает с рангами, а не с самими числами, поэтому переносит выбросы и асимметрию заметно спокойнее.

На практике для шкал Лайкерта и других порядковых оценок критерий Уилкоксона — более честный выбор по умолчанию: разница между баллом 8 и 9 не обязательно равна разнице между 3 и 4 психологически, а Уилкоксон опирается только на порядок и знак разностей, а не на их точную величину. Парный t-критерий уместен, когда показатель действительно похож на непрерывную величину — время на выполнение действия, сумма покупки — и выборка не совсем крошечная. Подробный разбор расчёта критерия Уилкоксона и типичных ошибок при его использовании — отдельная тема.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Критерий Мак-Немара: когда переменная категориальная

Если вместо баллов вы дважды спрашивали про да/нет — планирует ли клиент продлить подписку до и после изменения тарифа, согласен ли сотрудник рекомендовать компанию в двух волнах опроса, — парный t-критерий и Уилкоксон не подходят вовсе: у них нет механизма работы с бинарной категориальной переменной. Здесь нужен критерий Мак-Немара, который смотрит не на всех респондентов сразу, а только на тех, чей ответ изменился между двумя замерами, и проверяет, симметрично ли это изменение в обе стороны.

Логика критерия непривычна тем, кто раньше работал только с хи-квадратом для независимых групп: респонденты, ответившие «да» оба раза или «нет» оба раза, вообще не участвуют в расчёте — они не несут информации об изменении. Значение имеют только те, кто перешёл из одной категории в другую, и вопрос стоит так: одинаково ли часто люди меняют мнение в обе стороны, или переходы систематически идут в одну сторону чаще, чем в другую.

Перед расчётом Мак-Немара обязательно постройте таблицу переходов два на два: сколько человек сказали «да» в обоих замерах, сколько «нет» в обоих, и сколько перешли в каждую из двух сторон. Сам тест использует только числа в двух ячейках с переходами, но полная таблица нужна, чтобы не потерять из виду размер группы, которая вообще не изменила ответ.

Критерий Фридмана: три и более замера подряд

Когда одних и тех же людей опрашивают не дважды, а три раза и больше — ежеквартальный трекинг вовлечённости, оценка трёх версий прототипа одними и теми же тестировщиками, — сравнение каждой пары волн отдельным критерием Уилкоксона накапливает ошибку множественных сравнений так же, как это происходит с t-критерием при трёх и более независимых группах. Критерий Фридмана решает эту задачу сразу для всех волн: он ранжирует значения внутри каждого респондента по всем замерам и проверяет, отличаются ли средние ранги волн друг от друга.

Значимый результат Фридмана говорит только, что где-то среди волн есть различие, но не указывает, между какими именно. Как и после значимого Краскела-Уоллиса, дальше нужны попарные апостериорные сравнения — обычно тем же Уилкоксоном для каждой пары волн — с поправкой на множественность, потому что теперь сравнений снова несколько. Параметрический аналог Фридмана — дисперсионный анализ с повторными измерениями — точнее при выполнении своих условий, но требует дополнительной проверки сферичности данных, которую на практике в опросах проверяют редко, поэтому Фридман остаётся более безопасным выбором по умолчанию. На практике для трекинговых опросов с четырьмя-шестью волнами это почти всегда рабочая связка: сам Фридман как первый фильтр, а Уилкоксон с поправкой — для локализации конкретной пары волн, где различие реально возникло.

Размер эффекта для связанных выборок

P-значение отвечает только на вопрос, есть ли эффект статистически, но не на вопрос, насколько он велик практически, и для связанных выборок это так же верно, как для независимых. Для парного t-критерия и Уилкоксона считают размер эффекта через отношение средней разности к разбросу разностей или через ранговую корреляцию по величине, аналогичную корреляции Спирмена. Для Мак-Немара содержательнее не абстрактный размер эффекта, а прямое число: сколько человек перешли из «нет» в «да» и сколько — в обратную сторону, потому что бизнесу нужен именно баланс переходов, а не статистика сама по себе.

Полезная практика — всегда указывать рядом с результатом теста долю респондентов, чей ответ реально изменился, а не только вывод «значимо» или «не значимо». Если в опросе из четырёхсот человек мнение поменяли пятнадцать, а критерий всё равно показал значимость благодаря большой выборке, решение «менять продукт под этот результат» будет неоправданным — эффект статистически реален, но затрагивает слишком узкую долю аудитории, чтобы быть приоритетом.

Отдельно стоит смотреть на направление эффекта, а не только на его величину. Средняя разность может быть положительной при том, что улучшение почувствовала лишь половина респондентов, а у другой половины оценка осталась прежней или снизилась. В отчёте честнее показать распределение индивидуальных изменений — сколько человек выросли в оценке, сколько остались на месте, сколько снизили её, — а не сворачивать всё в одно среднее число, которое одинаково хорошо описывает и равномерный рост у всех, и рост у меньшинства на фоне падения у части аудитории.

Типичные ошибки

Ограничения подхода

Все критерии для связанных выборок требуют, чтобы пары действительно были парами: один и тот же человек, один и тот же объект наблюдения в обоих замерах. Если состав респондентов между волнами частично поменялся — кто-то не ответил во второй волне, кто-то появился только в ней, — использовать эти тесты напрямую нельзя: нужно либо оставить в анализе только полные пары, либо переходить к моделям, устойчивым к пропускам, что для типового опроса обычно избыточно.

Ещё одно ограничение — эти критерии ничего не говорят о причине изменения. Значимый рост удовлетворённости между волнами может отражать реальный эффект продуктового изменения, а может — сезонность, внешнее событие или простое привыкание к вопросу при повторном заполнении анкеты. Чем длиннее промежуток между замерами, тем больше конкурирующих объяснений нужно исключить прежде, чем приписывать разницу тому изменению, которое вы тестировали.

Стоит держать в уме и регрессию к среднему: респонденты, поставившие в первом замере крайне низкую или крайне высокую оценку, во втором замере статистически склонны сдвигаться к середине шкалы просто из-за случайного разброса, а не из-за реального изменения отношения. Если для второй волны вы намеренно выбрали именно недовольных клиентов первой волны, часть последующего улучшения окажется этим эффектом, а не результатом ваших действий — этот механизм разобран отдельно, потому что путают его чаще, чем кажется.

С чего начать

Прежде чем считать что-либо, ответьте на один вопрос: у вас действительно одни и те же респонденты в обоих замерах, идентифицированные однозначно — по email, номеру телефона или внутреннему ID? Без надёжной идентификации пары построить нельзя, и весь класс критериев для связанных выборок становится недоступен независимо от того, как хочется его применить. Если идентификация есть, дальше — по таблице выше: число замеров и тип переменной определяют тест почти автоматически, а сервис вроде «До Сути» позволяет привязать повторные ответы к одному респонденту по ссылке или коду уже на этапе сбора, а не пытаться сопоставлять их постфактум.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Чем связанные выборки отличаются от независимых?

В связанных выборках один и тот же человек или объект измерен дважды и больше: клиент до и после обновления, тот же товар в оценке разных периодов. В независимых выборках в сравниваемых группах разные люди без естественной пары между ними. Практический тест простой: можно ли для каждого наблюдения в одной группе однозначно назвать соответствующее наблюдение в другой. Если да — выборки связаны, и нужен парный тест; если нет — обычный тест для независимых групп.

Какой критерий выбрать для двух замеров одного показателя?

Если показатель непрерывный и разности между парами распределены приблизительно нормально — парный t-критерий. Если распределение разностей заметно скошено или есть выбросы, а также для порядковых шкал вроде Лайкерта — критерий Уилкоксона для связанных выборок, он устойчивее к отклонениям от нормальности. Если переменная категориальная, например да/нет, оба этих теста не подходят вовсе — там нужен критерий Мак-Немара, который сравнивает симметрию переходов между категориями.

Почему нельзя просто сравнить t-критерием две волны как независимые группы?

Формально расчёт выполнится и даже может показать похожий результат, но тест для независимых групп не использует информацию о том, что ответы связаны через одного и того же человека, и поэтому теряет статистическую мощность. Ему требуется больше данных, чтобы найти реальный эффект, потому что индивидуальные различия между людьми добавляются в общий разброс вместо того, чтобы вычитаться из него. На маленьких выборках это может превратить реально значимый результат в статистически незначимый.

Что делать, если часть респондентов не ответила во второй волне?

Критерии для связанных выборок требуют полных пар, поэтому стандартный путь — оставить в анализе только тех, кто ответил в обоих замерах, а не пытаться заполнить пропуски произвольно. Стоит отдельно проверить, не связан ли отказ отвечать повторно с самим измеряемым показателем: если из опроса выпадают в основном недовольные клиенты, оставшаяся выборка окажется смещена в сторону более позитивных оценок, и об этом нужно честно сказать в отчёте.

Читайте также