«До Сути»← Все статьи

Метрики · 6 сентября 2026 г.

Размер эффекта: почему «статистически значимо» не значит «важно»

Статистическая значимость отвечает лишь на вопрос, случайна ли наблюдаемая разница, но ничего не говорит о том, велика ли она и стоит ли внимания на практике: при достаточно большой выборке значимой окажется даже ничтожная разница в сотые доли балла. Размер эффекта решает именно эту задачу — он измеряет величину различия или связи в стандартизированных единицах, не зависящих от размера выборки, и позволяет сравнивать находки из разных опросов между собой. Ниже — что такое d Коэна на простом примере, как читать условные границы маленького, среднего и большого эффекта и почему на очень больших выборках отчёт стоит строить вокруг величины эффекта, а не вокруг одной лишь значимости.

Проблема, которую p-значение не решает

P-значение отвечает только на один вопрос: насколько вероятно получить наблюдаемую разницу, если на самом деле никакой разницы нет. Оно ничего не говорит о том, велика ли сама разница и стоит ли она внимания на практике. При достаточно большой выборке даже ничтожная разница в 0,05 балла из десяти становится статистически значимой — тест честно фиксирует, что разница не случайна, но не отвечает, важна ли она хоть сколько-нибудь для бизнеса. Полноценный вывод требует обоих чисел сразу — вероятности случайности и величины эффекта, — а не выбора одного из них в качестве единственного критерия.

Проблема встречается в обе стороны. На маленькой выборке реальная и существенная разница в полтора-два балла из десяти может не набрать значимости просто из-за нехватки данных, и вывод «разницы нет» окажется преждевременным. Размер эффекта — величина, которая решает именно эту задачу: она измеряет, насколько велика разница или связь сама по себе, независимо от того, сколько респондентов участвовало в опросе.

Что такое размер эффекта простыми словами

Размер эффекта — это стандартизированная мера величины различия или связи, не зависящая от единиц измерения и размера выборки. Вместо «разница в 0,8 балла» размер эффекта говорит «разница составляет 0,6 стандартного отклонения», а это уже можно сравнивать между разными шкалами, разными опросами, разными исследованиями — потому что стандартное отклонение единое мерило для любой числовой переменной, а сырые баллы такими не являются.

Практическая польза очевидна при сравнении результатов из разных источников. Если один опрос показал разницу в 0,8 балла по шкале от одного до десяти, а другой — разницу в 12 рублей по шкале готовности платить, сырые числа сравнить нельзя вовсе. А размер эффекта в обоих случаях выражен в одних и тех же единицах — долях стандартного отклонения, — и уже поддаётся сравнению: можно сказать, какой из двух эффектов на самом деле крупнее относительно разброса своих данных.

Похожая логика применяется и при подготовке исследования заранее: если известно, какой минимальный размер эффекта имеет практическое значение — скажем, d не меньше 0,3, — можно заранее рассчитать, сколько респондентов нужно, чтобы тест с разумной вероятностью такой эффект обнаружил. Это переворачивает привычный порядок действий: вместо того чтобы после сбора данных гадать, хватило ли выборки, размер выборки планируется заранее исходя из того эффекта, который вообще стоит искать.

Cohen's d для разницы средних: пример

Самый распространённый размер эффекта для сравнения двух групп — d Коэна, который считается как разница средних, делённая на общее стандартное отклонение по обеим группам. Цифры ниже условные и нужны только для показа формата расчёта. Если два тарифа дают среднюю оценку 8,1 и 7,6 при стандартном отклонении около 1,6, d получается примерно 0,3 — разница в треть стандартного отклонения, что по общепринятой условной шкале считается небольшим, но не ничтожным эффектом.

Разница среднихСтд. отклонениеd КоэнаУсловная величина
0.21.60.13Очень маленький
0.51.60.31Маленький
1.01.60.63Средний
2.01.61.25Большой

Таблица показывает главное: одна и та же абсолютная разница в баллах превращается в разный d Коэна в зависимости от того, насколько сильно вообще разбросаны ответы. Разница в один балл при небольшом разбросе — это заметный, средний эффект, а та же разница в один балл при большом разбросе ответов внутри групп — эффект куда скромнее. Именно поэтому сравнивать сырые баллы между разными опросами без поправки на разброс некорректно.

Существуют и другие размеры эффекта для других типов сравнений: например, для доли объяснённой дисперсии в ANOVA или регрессии используют эта-квадрат или уже знакомый R², а для связи между двумя категориальными переменными — V Крамера. Логика везде одна и та же: перевести исходную статистику в стандартизированную шкалу, которую можно сравнивать между разными измерениями, а не оставаться в сырых единицах конкретного вопроса.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Точность оценки размера эффекта

Как и любая статистика, посчитанная по выборке, размер эффекта — это оценка, а не точное значение, и у неё есть своя погрешность. D Коэна, равный 0,3 на выборке в тридцать человек в каждой группе, может на самом деле лежать где-то между 0,0 и 0,6 при пересчёте с учётом неопределённости выборки — то есть эффект может оказаться и нулевым, и вдвое больше заявленного. На выборке в триста человек в группе тот же точечный расчёт 0,3 будет куда точнее, а разброс возможных значений — заметно уже.

Практический вывод: указывать голое число размера эффекта без представления о его точности так же неполно, как указывать среднее без разброса. Если ресурсы позволяют, стоит сообщать эффект вместе с доверительным интервалом, а если это неудобно в конкретном отчёте — хотя бы держать в уме размер выборки, на которой эффект посчитан, и не относиться к точечной оценке на тридцати респондентах с той же уверенностью, что и к оценке на трёхстах.

Как читать величину эффекта

Для d Коэна принята условная градация: около 0,2 считается маленьким эффектом, около 0,5 — средним, от 0,8 и выше — большим. Это ориентир, а не жёсткая граница, и в разных областях применяются свои поправки: в исследованиях удовлетворённости клиентов эффект d 0,3 может быть вполне ощутимым практически, а в медицинских испытаниях тот же 0,3 иногда считают слишком слабым, чтобы менять протокол лечения. Абсолютное значение важно интерпретировать в контексте конкретной задачи, а не по универсальной таблице.

Здесь же стоит развеять частое заблуждение: маленький размер эффекта не значит бесполезный. Изменение продукта, дающее d равное 0,2 по удовлетворённости, при масштабировании на всю клиентскую базу способно принести ощутимый совокупный результат, если внедрить его дёшево и без побочных рисков. И наоборот, большой эффект на крошечной непоказательной выборке может вообще не воспроизвестись на остальной аудитории. Величина эффекта — не единственный критерий решения, а один из нескольких, которые стоит смотреть вместе.

Полезно также сравнивать найденный эффект с эффектами уже известных, проверенных практик в вашей отрасли, если такие ориентиры существуют. Если типичное продуктовое улучшение в вашей категории даёт d около 0,15–0,2, а конкретная гипотеза показывает d 0,4, это относительно крупная находка на фоне обычных результатов, даже если по универсальной шкале Коэна она всего лишь «средняя».

Размер эффекта и корреляция — это уже эффект

Коэффициент корреляции сам по себе уже является размером эффекта: он изначально стандартизирован и не зависит от единиц измерения переменных. Поэтому для связи между двумя переменными отдельно считать что-то дополнительное не нужно — достаточно смотреть на величину самого коэффициента, помня условную градацию силы связи. То же касается R² из регрессии: доля объяснённой дисперсии — это тоже готовый размер эффекта, просто выраженный в других единицах, чем d Коэна.

Путаница возникает, когда p-значение корреляции воспринимают как показатель её силы. Коэффициент корреляции 0,1 на выборке в пять тысяч ответов вполне может оказаться статистически значимым — но сама связь при этом остаётся крайне слабой и практически незначимой, объясняя ничтожную долю различий между переменными. Значимость говорит «связь скорее всего не случайна», величина коэффициента говорит «насколько эта связь вообще существенна» — и второе для практических решений почти всегда важнее первого.

Почему большая выборка делает p-значение ненадёжным ориентиром

Чем больше выборка, тем меньшая разница нужна, чтобы получить статистическую значимость: p-значение неуклонно падает с ростом числа наблюдений даже при неизменном реальном эффекте. На выборке в пятьдесят тысяч ответов почти любая разница между сегментами окажется значимой просто в силу объёма данных, и полагаться в такой ситуации только на p-значение означает объявлять важным практически всё подряд.

Обратная сторона той же логики — на очень маленьких выборках интерпретировать размер эффекта тоже стоит с оговоркой: сама оценка эффекта в этом случае крайне неточна, и то, что выглядит как большой эффект на пятнадцати респондентах, может оказаться куда скромнее при повторном замере на большей выборке. Осторожность нужна в обе стороны от размера выборки, а не только применительно к очень большим массивам данных. Правильный вопрос звучит не «значим ли эффект», а «насколько точно мы вообще можем судить о его величине при таком объёме данных» — и ответ на него часто важнее самого факта значимости.

На очень больших выборках отчёт стоит строить вокруг размера эффекта, а не вокруг звёздочек значимости: при достаточном объёме данных статистически значимым окажется почти любое отличие, и p-значение в этой ситуации перестаёт быть содержательным фильтром важности.

Как использовать размер эффекта на практике

Разумный порядок отчёта — сначала проверить значимость, чтобы отсеять случайный шум, а затем обязательно указать размер эффекта, чтобы читатель понимал реальный масштаб находки. Формулировка «различие статистически значимо, d равен 0,15» честнее и информативнее, чем просто «различие значимо», потому что сразу показывает: эффект есть, но он небольшой, и решение о его практической важности стоит принимать отдельно, с учётом стоимости изменения и масштаба аудитории.

На практике размер эффекта особенно полезен при сравнении нескольких найденных различий между собой: если из пяти протестированных факторов три значимы, но с d от 0,1 до 0,2, а два — с d выше 0,5, приоритет стоит отдавать вторым, даже если формально все пять прошли порог значимости одинаково. Без размера эффекта такое ранжирование сделать нельзя — все пять выглядели бы равнозначными находками.

Ещё один практический сценарий — сравнение эффекта до и после изменения продукта. Если год назад определённый фактор давал d равный 0,5, а после ряда доработок тот же фактор при повторном замере даёт d равный 0,2, это не всегда значит, что фактор стал менее важным сам по себе: возможно, вы уже устранили основную часть проблемы, и оставшийся эффект — это то, что реалистично осталось поправить. Отслеживание размера эффекта в динамике часто информативнее, чем разовый снимок на одной волне, потому что показывает не только текущее состояние, но и то, движется ли ситуация в нужную сторону от волны к волне.

Типичные ошибки

Ограничения

Размер эффекта не заменяет содержательное суждение о важности находки — он лишь даёт для этого суждения объективную опору вместо интуитивной оценки по сырым баллам. Условные границы «маленький — средний — большой» переносятся между областями не буквально, и то, что мало в одной задаче, может быть существенным в другой. Кроме того, размер эффекта, как и всё остальное в этой линейке методов, оценивается по выборке и сам по себе имеет погрешность, которая тем больше, чем меньше респондентов участвовало в замере.

В сервисе «До Сути» экспорт результатов даёт сырые баллы и группировки, из которых размер эффекта считается вручную или во внешнем статистическом инструменте — готового d Коэна или аналогичного показателя сервис не выводит автоматически, и это стоит знать заранее, если отчёт строится именно вокруг величины эффекта, а не только вокруг значимости различий.

С чего начать

Если в ваших отчётах до сих пор фигурирует только формулировка «значимо / не значимо», добавьте рядом с каждым значимым различием его размер эффекта — для разницы средних это d Коэна, для связи двух переменных достаточно самого коэффициента корреляции. Это несложный дополнительный расчёт, который сразу меняет то, как читаются результаты: часть «значимых» находок при этом обнажится как практически незначительная, а часть — подтвердит, что действительно заслуживает внимания и ресурсов на исправление. Привычка занимает пару минут на отчёт, а окупается тем, что решения о приоритетах перестают опираться на случайно устроенный порог значимости.

  1. Для каждого значимого различия посчитайте d Коэна, а не только p-значение.
  2. Указывайте условную величину эффекта рядом со значимостью в отчётах.
  3. При очень большой выборке в первую очередь смотрите на размер эффекта.
  4. Ранжируйте находки для приоритизации по величине эффекта, а не по одинаковому факту значимости.
Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Что такое размер эффекта простыми словами?

Размер эффекта — стандартизированная величина различия или связи, которая не зависит от единиц измерения и размера выборки. Вместо «разница в 0,8 балла» он показывает «разница составляет столько-то стандартных отклонений», и это уже можно сравнивать между разными шкалами и разными исследованиями. В отличие от p-значения, которое отвечает лишь на вопрос «случайна ли разница», размер эффекта отвечает на вопрос «насколько эта разница велика», и для практических решений именно этот вопрос обычно важнее.

Почему статистически значимое различие может быть неважным?

Потому что p-значение зависит от размера выборки: чем больше респондентов, тем меньшая разница нужна для значимости. На выборке в несколько десятков тысяч ответов почти любое различие между сегментами окажется статистически значимым просто из-за объёма данных, даже если по сути оно ничтожно и не заслуживает внимания. Размер эффекта решает эту проблему: он показывает реальный масштаб различия независимо от того, сколько человек участвовало в замере, и позволяет отделить формальную значимость от практической важности.

Как посчитать d Коэна для разницы двух средних?

D Коэна — это разница средних значений двух групп, делённая на общее стандартное отклонение ответов по обеим группам вместе. Результат показывает разницу в долях стандартного отклонения: около 0,2 принято считать маленьким эффектом, около 0,5 — средним, от 0,8 — большим. Эти границы условны и не универсальны для всех областей, но дают отправную точку для интерпретации: сама по себе цифра без такого ориентира мало что говорит о практической значимости найденного различия.

Является ли коэффициент корреляции размером эффекта?

Да, и отдельно ничего пересчитывать не нужно: коэффициент корреляции изначально стандартизирован и не зависит от единиц измерения переменных, а значит, уже является готовым размером эффекта для связи между двумя переменными. Путаница возникает, когда за силу связи принимают её статистическую значимость: коэффициент 0,1 на выборке в несколько тысяч ответов может быть значимым, но сама связь при этом остаётся слабой и объясняет ничтожную долю различий между переменными.

Читайте также