Метрики · 13 сентября 2026 г.
Проверка данных опроса на нормальность распределения: зачем и как
Проверка на нормальность распределения — это шаг, который решает, законно ли применять к данным опроса параметрическую статистику: t-критерий, дисперсионный анализ, корреляцию Пирсона. Формальный способ проверки — тест Шапиро-Уилка (для выборок примерно до 5000 наблюдений) или тест Колмогорова-Смирнова для больших выборок, дополненные визуальной проверкой гистограммой и QQ-графиком. Если распределение заметно отклоняется от нормального — а для оценочных шкал удовлетворённости это скорее правило, чем исключение, — на смену параметрическим методам приходят непараметрические аналоги: критерий Манна-Уитни вместо t-критерия, Краскела-Уоллиса вместо ANOVA, корреляция Спирмена вместо Пирсона. Ниже — как посчитать тест, прочитать график и решить, что делать с результатом.
Почему проверка на нормальность вообще нужна
Большая часть привычной статистики — t-критерий, дисперсионный анализ, корреляция Пирсона — построена на допущении, что данные (или, точнее, остатки модели) распределены нормально, то есть подчиняются симметричной колоколообразной кривой Гаусса. Это допущение не декоративное: на нём основан расчёт p-значения, и если оно нарушено достаточно сильно, p-значение перестаёт отражать реальную вероятность случайности результата — тест может показать значимость там, где её нет, или пропустить реальный эффект.
Практическая сложность в том, что нарушение допущения о нормальности не выдаёт себя явной ошибкой программы — расчёт t-критерия или ANOVA молча выдаст число и p-значение при любых входных данных, независимо от того, насколько распределение далеко от нормального. Отчёт с таким числом выглядит благополучно, а проверить, насколько ему можно доверять, нужно было до расчёта, а не после того, как цифра уже попала в презентацию.
Второй практический повод для проверки — данные опросов систематически склонны нарушать нормальность сильнее, чем данные из лабораторных измерений: оценочные шкалы удовлетворённости почти всегда скошены к верхнему краю (большинство отвечающих ставит 4 или 5 из 5), время прохождения опроса имеет длинный правый хвост из-за единичных долгих сессий, а число покупок или обращений в поддержку — это счётная переменная с множеством нулей. Все три случая — типичные кандидаты на явное нарушение нормальности, а не редкое исключение.
Визуальная проверка: гистограмма и QQ-график
Первый и самый быстрый способ оценить нормальность — построить гистограмму распределения ответов и посмотреть на неё глазами: нормальное распределение симметрично, с одним пиком в центре и убывающими к обоим краям хвостами. Скошенность в одну сторону, два отдельных пика (бимодальность) или резкий обрыв на одном из краёв — все это визуальные признаки того, что распределение далеко от нормального, и формальный тест почти наверняка это подтвердит.
Более точный визуальный инструмент — QQ-график (quantile-quantile plot): он откладывает квантили реального распределения против квантилей теоретического нормального распределения. Если данные нормальны, точки на графике ложатся вдоль прямой диагональной линии; отклонение точек от линии на краях графика (типичная картина для скошенных данных) или S-образный изгиб (типичный для распределений с тяжёлыми или лёгкими хвостами) точно показывает, в чём именно нарушение и где оно сильнее всего — в центре распределения или на краях.
Формальный тест: Шапиро-Уилка и Колмогорова-Смирнова
Тест Шапиро-Уилка — стандартный формальный способ проверки нормальности для выборок примерно до 5000 наблюдений: он возвращает статистику W (чем ближе к единице, тем ближе распределение к нормальному) и p-значение. Нулевая гипотеза теста — «распределение нормально», поэтому логика интерпретации здесь обратная привычной: p-значение выше 0,05 говорит, что оснований отвергать нормальность нет, а p-значение ниже 0,05 — что распределение статистически значимо отличается от нормального.
Для выборок большего размера, где тест Шапиро-Уилка становится вычислительно тяжелее и при этом слишком чувствителен к минимальным отклонениям, чаще используют тест Колмогорова-Смирнова (в варианте Лиллиефорса для случая, когда параметры нормального распределения оцениваются по самой выборке) — он сравнивает эмпирическую функцию распределения данных с теоретической функцией нормального распределения и тоже выдаёт p-значение с той же логикой интерпретации.
Практическая ловушка обоих тестов — чувствительность к размеру выборки. На выборке в несколько тысяч респондентов тест Шапиро-Уилка почти гарантированно найдёт статистически значимое отклонение от идеальной нормальности, даже если оно ничтожно мало и не влияет на выводы содержательно: реальные данные никогда не бывают идеально нормальными, а большая выборка даёт тесту достаточно мощности, чтобы заметить любое, даже пренебрежимо малое расхождение. Поэтому формальный тест на большой выборке стоит всегда дополнять визуальной проверкой графиком, а не доверять одному p-значению.
Асимметрия и эксцесс как быстрая числовая проверка
Помимо теста и графика, есть промежуточный по трудоёмкости способ оценить нормальность — посчитать коэффициенты асимметрии (skewness) и эксцесса (kurtosis) распределения. У идеально нормального распределения оба коэффициента равны нулю: асимметрия показывает, скошено ли распределение в одну сторону, эксцесс — насколько острая или плоская его вершина и насколько тяжёлые хвосты по сравнению с нормальной кривой.
Практический ориентир, которого придерживается большинство прикладных руководств: значения асимметрии и эксцесса в диапазоне примерно от −1 до 1 обычно не создают серьёзных проблем для параметрической статистики, а значения за пределами примерно ±2 — сигнал, что стоит переходить к непараметрическим методам или проверять данные внимательнее. Подробный разбор расчёта и интерпретации обоих коэффициентов — тема отдельной статьи, потому что асимметрия и эксцесс полезны не только как проверка перед тестом, но и как самостоятельная характеристика распределения ответов.
Когда проверка на нормальность вообще имеет смысл
Проверка нормальности осмысленна не для любых данных опроса без разбора, а конкретно для тех, где дальше планируется параметрическая статистика: сравнение средних t-критерием или ANOVA, корреляция Пирсона, линейная регрессия. Для номинальных и порядковых данных — категории, оценочные шкалы без суммирования нескольких пунктов — вопрос о нормальности не встаёт вообще, потому что параметрическая статистика для них изначально не годится независимо от формы распределения: об этом подробно рассказано в статье об уровнях измерения.
Второй нюанс — строго говоря, допущение параметрических тестов касается не самих исходных данных, а распределения остатков модели или, для t-критерия, распределения выборочного среднего, а не отдельных наблюдений. Из-за центральной предельной теоремы среднее по достаточно большой выборке (условный ориентир — от 30 наблюдений в группе) стремится к нормальному распределению даже тогда, когда исходные данные им не являются, поэтому t-критерий на практике неплохо переносит умеренные нарушения нормальности на больших группах, а вот на малых выборках чувствителен к ним куда сильнее.
| Ситуация | Нужна ли проверка нормальности | Комментарий |
|---|---|---|
| Сравнение средних t-критерием, малая группа (n < 30) | Да | На малой выборке центральная предельная теорема не спасает |
| Сравнение средних t-критерием, большая группа (n > 100) | Желательна, но менее критична | Среднее по большой выборке само тяготеет к нормальности |
| Корреляция Пирсона | Да | Иначе сила связи может быть занижена или искажена выбросами |
| Анализ порядковой или номинальной шкалы | Не нужна | Параметрическая статистика для них неприменима в принципе |
| Критерий хи-квадрат, Манна-Уитни, Краскела-Уоллиса | Не нужна | Непараметрические методы не опираются на форму распределения |
Что делать, если распределение не нормальное
Первый и самый надёжный путь — перейти на непараметрический аналог нужного теста: критерий Манна-Уитни вместо t-критерия для двух независимых групп, критерий Краскела-Уоллиса вместо дисперсионного анализа для трёх и более групп, корреляцию Спирмена вместо Пирсона для связи двух переменных. Все эти методы работают с рангами значений, а не с самими значениями, и поэтому не требуют допущения о нормальности вовсе — это самый частый и практически надёжный выбор.
Второй путь, менее универсальный, — математическое преобразование данных, чаще всего логарифмическое, которое умеет сглаживать правостороннюю скошенность (типичную для дохода, времени и счётных переменных с длинным хвостом) до формы, близкой к нормальной. Такое преобразование обратимо и не искажает содержательный смысл сравнения, но требует, чтобы все значения были строго положительными, и усложняет интерпретацию итоговых цифр — коэффициенты и разницы после логарифмирования читаются уже не в исходных единицах, а в отношениях, что не всегда удобно для нестатистической аудитории отчёта.
Третий путь, применимый только при большой выборке, — опереться на устойчивость параметрического теста за счёт центральной предельной теоремы, описанной выше, и использовать t-критерий или ANOVA несмотря на умеренное отклонение от нормальности, явно указав в отчёте, что нормальность проверялась и отклонение признано допустимым для размера выборки. Это компромиссный, а не идеальный вариант, и применять его стоит осознанно, а не по умолчанию из нежелания считать непараметрический аналог.
Выбросы и нормальность: смежная, но разная проблема
Проверку на нормальность легко спутать с поиском выбросов — экстремальных значений, сильно отличающихся от основной массы данных, — потому что оба шага выполняются на одном и том же этапе анализа и оба влияют на итоговый результат теста. Разница в том, что выбросы — это отдельные точки, а нормальность — свойство формы всего распределения: один-единственный выброс способен сильно исказить и гистограмму, и результат теста Шапиро-Уилка, создавая иллюзию ненормальности там, где основная масса данных на самом деле распределена нормально.
Практический порядок действий — сначала проверить данные на выбросы и решить, что с ними делать (оставить, если они реальны и содержательны, или удалить как ошибку ввода), и только после этого повторно оценивать нормальность оставшихся данных. Обратный порядок — сразу делать вывод о ненормальности распределения, не проверив, не создана ли эта картина одним-двумя выбросами, — частая методологическая ошибка, которая ведёт к ненужному переходу на непараметрические методы там, где основные данные были бы нормальны и без искажающих их выбросов.
Проверка нормальности по группам, а не по всей выборке сразу
Частая техническая ошибка при подготовке к t-критерию или ANOVA — проверить нормальность распределения ответов по всей выборке целиком, хотя допущение теста относится к распределению внутри каждой сравниваемой группы отдельно, а не к объединённой выборке. Две группы, каждая из которых распределена нормально, но с разными средними значениями, дадут при объединении бимодальное — двугорбое — распределение, которое формальный тест на всей выборке справедливо забракует, хотя по существу проблемы для t-критерия здесь нет.
Правильный порядок — разбить данные по сравниваемым группам (например, по тарифу или сегменту клиента) и проверить нормальность отдельно внутри каждой группы тестом Шапиро-Уилка или визуально гистограммой. Если группы небольшие — меньше 20-30 наблюдений в каждой, — визуальная проверка и здравый смысл дают больше пользы, чем формальный тест, потому что на таких размерах выборки у любого теста на нормальность слишком мало статистической мощности, чтобы сделать надёжный вывод в любую сторону.
Практический алгоритм
- Определите, планируется ли параметрическая статистика (t-критерий, ANOVA, корреляция Пирсона) — если нет, проверка нормальности не нужна.
- Проверьте и обработайте явные выбросы до оценки нормальности, а не после.
- Разбейте данные по сравниваемым группам и проверьте нормальность отдельно в каждой, а не по объединённой выборке.
- Постройте гистограмму и QQ-график для визуальной оценки формы распределения.
- Посчитайте тест Шапиро-Уилка (для выборок примерно до 5000) или Колмогорова-Смирнова для более крупных.
- При отклонении от нормальности на малой выборке — переходите на непараметрический аналог теста, а не игнорируйте результат проверки.
Типичные ошибки
- Считать t-критерий или ANOVA без какой-либо проверки нормальности «по умолчанию».
- Доверять только p-значению теста Шапиро-Уилка на большой выборке, где даже пренебрежимо малое отклонение окажется значимым.
- Проверять нормальность по объединённой выборке вместо отдельных сравниваемых групп.
- Путать проверку на выбросы с проверкой на нормальность и делать вывод о форме распределения без обработки экстремальных значений.
- Применять логарифмическое преобразование к данным с нулевыми или отрицательными значениями без предварительной корректировки.
- Игнорировать асимметрию оценочных шкал удовлетворённости, считая, что раз шкала числовая, распределение автоматически нормально.
С чего начать
Возьмите числовую переменную из последнего опроса — например, оценку удовлетворённости или время прохождения — постройте по ней гистограмму и посчитайте тест Шапиро-Уилка во внешнем статистическом инструменте после выгрузки данных. Если распределение заметно скошено, это не повод отказываться от анализа, а сигнал перейти на непараметрический метод, разобранный в статье о непараметрических критериях. Отдельно стоит завести привычку документировать, какой именно тест на нормальность применялся и на какой именно выборке — по группам или по всей совокупности сразу, — чтобы результат можно было воспроизвести и перепроверить позже, когда данных станет больше. В сервисе «До Сути» опрос собирается с любым типом числовых и оценочных вопросов, а проверка нормальности и выбор теста остаются задачей того, кто анализирует выгруженные ответы.
Частые вопросы
Есть три взаимодополняющих способа: визуально — построить гистограмму и QQ-график и посмотреть, симметрично ли распределение и ложатся ли точки на диагональ; формально — посчитать тест Шапиро-Уилка для выборок примерно до 5000 наблюдений или тест Колмогорова-Смирнова для больших выборок; числовым ориентиром — посчитать коэффициенты асимметрии и эксцесса, которые у нормального распределения равны нулю. На практике надёжнее всего сочетать все три способа, а не полагаться на один p-значение теста, особенно на большой выборке.
Самый надёжный путь — перейти на непараметрический аналог нужного метода: критерий Манна-Уитни вместо t-критерия, Краскела-Уоллиса вместо дисперсионного анализа, корреляцию Спирмена вместо Пирсона. Эти методы работают с рангами значений и не требуют допущения о нормальности. Реже применяют логарифмическое преобразование данных для сглаживания скошенности или полагаются на устойчивость параметрического теста при достаточно большой выборке благодаря центральной предельной теореме, явно указав в отчёте эту оговорку.
T-критерий, дисперсионный анализ и корреляция Пирсона built на допущении, что данные или остатки модели распределены нормально, и на этом допущении построен расчёт p-значения. Если оно нарушено достаточно сильно, p-значение перестаёт достоверно отражать вероятность случайности результата: тест может показать значимость там, где её нет, или, наоборот, пропустить реальный эффект. Проверка нормальности — способ узнать это заранее, а не после того, как ошибочный вывод уже попал в отчёт.
Строго методологически — нет: параметрическая статистика, для которой нужна нормальность, изначально неприменима к порядковой шкале независимо от формы её распределения, потому что расстояния между соседними значениями шкалы не гарантированы равными. Вопрос о нормальности имеет смысл только для данных, для которых уже законна параметрическая статистика, — например, для суммарного балла валидированной методики или для метрик вроде времени и числа покупок, где расстояния между значениями содержательны.