«До Сути»← Все статьи

Метрики · 14 сентября 2026 г.

Критерий Фридмана: как сравнить три и более замера у одних и тех же людей

Критерий Фридмана — непараметрический тест, который проверяет, есть ли различия между тремя и более замерами одного показателя у одних и тех же респондентов: ежеквартальный трекинг вовлечённости, оценка трёх версий прототипа одними и теми же тестировщиками, отклик на серию из четырёх писем. Это связанный аналог критерия Краскела-Уоллиса: там ранжируют объединённую выборку нескольких независимых групп, здесь — ранжируют значения внутри каждого респондента по всем волнам замера. Сравнивать волны попарно отдельными тестами Уилкоксона нельзя без поправки на множественность, а Фридман решает эту задачу сразу для всех волн одним расчётом. Ниже — как он считается, что делать после значимого результата и в чём его практические ограничения.

Когда нужен именно этот критерий

Критерий Фридмана применяют, когда один и тот же порядковый или непрерывный показатель измерен три и более раза у одних и тех же людей или объектов, а условия для параметрического дисперсионного анализа с повторными измерениями не выполняются — распределение не нормально, выборка небольшая, или данные и вовсе представляют собой ранги, а не точные числа. Классический пример из продуктовой практики: одна и та же группа из пятнадцати пользователей тестирует три варианта интерфейса и после каждого ставит оценку удобства по десятибалльной шкале — три оценки на человека, и вопрос в том, отличаются ли варианты между собой.

Ключевое условие — именно связанность: одни и те же респонденты проходят через все сравниваемые условия или волны. Если бы три группы пользователей тестировали по одному варианту каждая, это была бы задача для критерия Краскела-Уоллиса — независимые группы, а не связанные замеры. Спутать эти две ситуации легко, если не проговорить дизайн эксперимента явно с самого начала: итоговая таблица с оценками по трём вариантам выглядит одинаково независимо от того, отвечали ли эти пятнадцать человек все три раза или же было опрошено сорок пять разных людей по одному разу на вариант.

Похожая задача встречается в трекинговых исследованиях удовлетворённости: одну и ту же панель клиентов опрашивают ежеквартально четыре раза подряд, и нужно понять, менялся ли уровень удовлетворённости от квартала к кварталу. Здесь тоже три условия сходятся одновременно — порядковая или непрерывная переменная, одни и те же респонденты, три и более момента измерения, — и критерий Фридмана становится естественным выбором вместо серии отдельных попарных тестов между соседними кварталами подряд без всякой поправки на множественность.

Как считается критерий: ранги внутри каждого респондента

Расчёт начинается не с общего ранжирования всех чисел подряд, а с ранжирования внутри каждого респондента отдельно. Для каждого человека три или более его оценки за разные волны ранжируются от меньшей к большей: лучшая оценка получает наибольший ранг, худшая — наименьший. Это принципиальное отличие от Краскела-Уоллиса, где ранжируется вся выборка сразу: Фридман сравнивает не абсолютные значения между людьми, а относительный порядок волн внутри одного и того же человека, что и убирает индивидуальные различия между респондентами из уравнения.

После того как ранги проставлены индивидуально для каждого респондента, их суммируют по каждой волне отдельно — получаются суммы рангов для варианта А, варианта Б и варианта В. Если между вариантами нет реальной разницы, каждый респондент присваивал бы ранги фактически случайно, и суммы рангов по волнам должны быть примерно равны. Чем сильнее суммы рангов отличаются друг от друга, тем больше итоговая статистика критерия и тем меньше p-значение. Статистика Фридмана асимптотически следует распределению хи-квадрат с числом степеней свободы на единицу меньше числа сравниваемых волн.

При двух совпадающих оценках у одного респондента в разных волнах — связанных рангах внутри одного человека — им присваивают средний ранг, точно так же, как это делают критерий Уилкоксона и критерий Манна-Уитни при совпадающих значениях. Игнорировать связанные ранги и произвольно присваивать порядок при ручном расчёте — источник тихой ошибки, которая не приводит к явному сбою, но сдвигает итоговую статистику и, соответственно, p-значение теста.
РеспондентВариант А (балл)Вариант Б (балл)Вариант В (балл)Ранги А/Б/В
16871 / 3 / 2
25961 / 3 / 2
37891 / 2 / 3
46791 / 2 / 3
Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

В этом условном примере вариант Б и вариант В почти всегда получают более высокий ранг, чем вариант А, а между собой Б и В распределены не так однозначно. Сумма рангов по варианту А в такой картине окажется заметно ниже сумм по Б и В, и именно такой перекос сумм и обнаруживает критерий Фридмана. Цифры условные и нужны только для того, чтобы показать логику ранжирования внутри респондента, а не как ориентир для реального размера различий между вариантами интерфейса.

Значимый результат: что дальше

Значимый результат критерия Фридмана говорит только, что где-то среди сравниваемых волн есть различие, но не указывает, между какими именно парами оно находится. Это тот же принцип, что у дисперсионного анализа и критерия Краскела-Уоллиса для независимых групп: общий тест — это фильтр, отсеивающий ситуации, где никакого различия нет вовсе, а не источник конкретного ответа «что от чего отличается». После значимого результата нужен второй шаг — апостериорные попарные сравнения.

Стандартный путь — сравнить волны попарно критерием Уилкоксона для связанных выборок, но обязательно с поправкой на множественность, потому что теперь снова выполняется несколько тестов подряд на одних и тех же данных. При трёх волнах это три попарных сравнения, при четырёх — уже шесть, и без поправки шанс случайно найти различие там, где его нет, растёт с каждой дополнительной парой. Простейший вариант поправки — разделить обычный порог 0,05 на число сравнений и требовать этого более строгого порога для каждой отдельной пары. Более мягкий по консервативности вариант — метод Холма, который применяет разную строгость порога к разным сравнениям в зависимости от их порядка по значимости и реже пропускает реальные различия при том же контроле общей ошибки.

Отличие от дисперсионного анализа с повторными измерениями

Параметрический аналог критерия Фридмана — дисперсионный анализ с повторными измерениями — при выполнении своих условий точнее и обладает большей статистической мощностью. Но у него есть дополнительное требование, которого нет у ANOVA для независимых групп: сферичность, то есть примерное равенство дисперсий разностей между всеми возможными парами волн. Проверяется это отдельным тестом Мокли, и на практике в опросах его почти никогда не проверяют — либо забывают, либо не знают, что нужно.

Именно поэтому критерий Фридмана — более безопасный выбор по умолчанию для трекинговых данных в опросах: он не предъявляет требования к сферичности вовсе, работает с рангами вместо точных значений и остаётся корректным при умеренных нарушениях распределения. Плата за эту устойчивость — чуть меньшая мощность на действительно нормальных данных: если условия дисперсионного анализа выполнены строго, он найдёт умеренный эффект немного увереннее при том же объёме выборки. На практике для трекинга из четырёх-шести волн разница в мощности между двумя тестами обычно не критична, а риск незамеченного нарушения сферичности — вполне реален.

Есть и практический аргумент в пользу Фридмана помимо статистической строгости: он не требует, чтобы сама оценка была настоящей непрерывной величиной. Порядковая шкала удобства от одного до пяти или прямое ранжирование трёх вариантов по личному предпочтению без числовой оценки вовсе — оба формата вписываются в критерий Фридмана без дополнительных допущений, тогда как дисперсионный анализ формально рассчитан на непрерывные измерения с равными интервалами между соседними делениями используемой шкалы оценки.

Размер эффекта: коэффициент конкордации Кендалла

Для критерия Фридмана размер эффекта считают через коэффициент конкордации Кендалла — число от нуля до единицы, показывающее, насколько согласованно респонденты ранжируют волны между собой. Значение, близкое к нулю, означает, что респонденты присваивают порядок волнам почти случайно и общего согласия нет; значение, близкое к единице, означает, что почти все респонденты одинаково упорядочивают волны от худшей к лучшей. Этот коэффициент отвечает на содержательный вопрос «насколько единодушна аудитория», который значимость сама по себе не раскрывает.

На практике коэффициент конкордации полезен ещё и как самостоятельная диагностика до всякого теста значимости: если он получается совсем маленьким даже при большой выборке, это сигнал, что респонденты воспринимают сравниваемые варианты слишком по-разному, чтобы говорить об одном общем предпочтении аудитории. В таком случае продуктовое решение «выбрать лучший вариант для всех» может быть неверной постановкой задачи — вероятно, аудиторию стоит сегментировать и смотреть предпочтения по группам отдельно, а не искать единый победитель.

Цифры в примере с тремя вариантами интерфейса выше условные, но показывают типичную картину: если коэффициент конкордации получается около 0,6–0,7, это говорит о достаточно устойчивом общем предпочтении аудитории, тогда как значение около 0,2 при том же значимом p-значении говорит скорее о слабом, хотя и статистически уловимом, согласии между респондентами. Разница между этими двумя ситуациями важна для решения: в первом случае можно смело катить один вариант на всех, во втором — стоит присмотреться к тому, не делится ли аудитория на подгруппы с разными предпочтениями.

Условия применимости

Последнее условие на практике оказывается самым болезненным. В отличие от независимых сравнений, где респондент без ответа на одну волну просто выпадает из этой волны и остаётся в остальных, критерий Фридмана требует полного набора наблюдений по всем волнам сразу: если человек ответил на первую и вторую волну, но пропустил третью, его данные не участвуют в расчёте вовсе. При длинном трекинге с большим числом волн это может резко и незаметно сократить итоговую выборку до значительно меньшего числа полных случаев, чем кажется по общему числу собранных ответов.

Типичные ошибки

  1. Сравнивать волны попарно критерием Уилкоксона без общего теста Фридмана и без поправки на множественность.
  2. Путать связанный дизайн с независимыми группами, когда в разных волнах на самом деле участвовали разные люди.
  3. Интерпретировать значимый результат как ответ на вопрос, какая именно волна отличается от какой.
  4. Оставлять в выборке респондентов с неполными данными по не всем волнам вместо честного исключения.
  5. Не проверять коэффициент конкордации и делать вывод только по p-значению, без меры согласованности мнений.
  6. Использовать параметрический дисперсионный анализ с повторными измерениями без проверки сферичности данных.

Отдельно стоит упомянуть ошибку с направлением расчёта рангов: если случайно ранжировать не оценки внутри каждого респондента по волнам, а сразу всю объединённую выборку значений, результат превратится в нечто похожее на Краскела-Уоллиса, но статистически некорректное для связанного дизайна. Проверить себя просто: после ранжирования у каждого респондента должен получиться полный набор рангов от одного до числа волн без повторов, кроме случаев связанных значений внутри одного человека.

Ограничения

Критерий Фридмана, как и другие тесты значимости, не объясняет причину различий между волнами: рост оценки от первой волны к третьей может отражать реальное улучшение продукта, а может — эффект привыкания респондентов к самому процессу оценивания или сезонные колебания настроения аудитории. Чем больше волн и чем длиннее промежутки между ними, тем больше конкурирующих объяснений стоит рассмотреть, прежде чем связывать различие именно с тем изменением, которое вы тестировали. Требование полных данных по всем волнам также означает, что критерий систематически недооценивает мнение той части аудитории, которая перестаёт отвечать по ходу трекинга, — а это обычно не случайная выборка респондентов, а те, кто разочаровался или потерял интерес.

Ещё одно практическое ограничение — число волн, которое реально можно провести без потери большей части выборки. Каждая дополнительная волна добавляет ещё одну возможность для респондента не ответить, и требование полных данных по всем волнам действует накопительно: при пяти волнах с отдельной вероятностью неответа в пятнадцать процентов на каждой доля респондентов с полным набором ответов может опуститься ниже половины исходной выборки. Планируя длинный трекинг, стоит закладывать этот эффект заранее, а не удивляться маленькой итоговой выборке уже после сбора всех волн.

С чего начать

Убедитесь, что у вас действительно связанный дизайн — одни и те же респонденты во всех волнах, идентифицированные однозначно, — и что показатель измерен одинаково на каждом этапе, той же формулировкой и той же шкалой. В сервисе «До Сути» повторные волны трекинга удобно собирать через одну и ту же персональную ссылку респондента, что сразу даёт корректную структуру данных для критерия Фридмана без ручного сведения нескольких выгрузок. Посчитайте общий тест, а при значимом результате переходите к попарным сравнениям Уилкоксона с поправкой на множественность и обязательно приводите коэффициент конкордации рядом с p-значением — он покажет, насколько согласованно аудитория видит различия между волнами, а не только то, есть ли различия вообще.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Чем критерий Фридмана отличается от критерия Краскела-Уоллиса?

Краскела-Уоллиса сравнивает три и более независимых группы разных людей, ранжируя всю объединённую выборку сразу. Фридман сравнивает три и более замера у одних и тех же людей, ранжируя значения внутри каждого респондента отдельно, а затем суммируя ранги по волнам. Первый теряет информацию о том, что все ответы дал один и тот же человек, потому что её там просто нет; второй, наоборот, использует эту связь, чтобы убрать индивидуальные различия между респондентами из расчёта.

Что делать после значимого результата критерия Фридмана?

Значимый результат говорит только, что где-то среди волн есть различие, но не указывает, между какими именно. Дальше нужны попарные апостериорные сравнения — обычно критерием Уилкоксона для каждой пары волн — с поправкой на множественность, потому что при этом снова выполняется несколько тестов подряд на одних и тех же данных. Простой вариант поправки — разделить обычный порог значимости 0,05 на число попарных сравнений.

Почему нельзя просто сравнить волны попарно без общего теста Фридмана?

При трёх волнах это уже три попарных сравнения, при четырёх — шесть, и без поправки на множественность вероятность случайно найти различие там, где его нет, растёт с каждой дополнительной парой почти вдвое быстрее, чем кажется интуитивно. Критерий Фридмана решает задачу сразу для всех волн одним расчётом и определяет, есть ли вообще смысл переходить к более детальным попарным сравнениям, прежде чем множить число тестов.

Что делать с респондентами, пропустившими одну из волн?

Критерий Фридмана требует полного набора данных по всем сравниваемым волнам: респондент без ответа хотя бы на одну волну исключается из расчёта целиком, а не частично. При длинном трекинге с большим числом волн это может заметно сократить итоговую выборку по сравнению с общим числом собранных ответов. Стоит отдельно проверить, не связан ли отказ отвечать повторно с самим измеряемым показателем, чтобы не переоценить устойчивость вывода на оставшихся полных случаях.

Читайте также