Метрики · 10 сентября 2026 г.
Корреляция Спирмена: когда обычный коэффициент Пирсона вводит в заблуждение
Корреляция Спирмена — непараметрический коэффициент связи между двумя переменными, который считается не по самим значениям, а по их рангам, и поэтому не требует ни нормального распределения, ни линейной формы связи, только монотонной — когда рост одной переменной стабильно сопровождается ростом или снижением другой. Её используют вместо корреляции Пирсона, когда хотя бы одна из переменных измерена порядковой шкалой, например оценкой удовлетворённости от 1 до 5, или когда в данных есть выбросы, искажающие обычный коэффициент. Значение коэффициента, как и у Пирсона, лежит от минус единицы до единицы. Ниже — как он считается, чем отличается от Пирсона на практике и какие ограничения стоит знать.
Когда нужна корреляция Спирмена вместо Пирсона
Корреляция Пирсона измеряет силу линейной связи между двумя числовыми переменными и предполагает, что шкала измерения имеет равные интервалы между значениями: разница между 100 и 200 рублями точно такая же, как между 900 и 1000. С порядковой шкалой опроса — оценкой от 1 до 5, рангом важности среди нескольких вариантов, уровнем образования — это предположение не выполняется строго: нет твёрдых оснований считать расстояние между «3» и «4» баллами равным расстоянию между «4» и «5». Спирмен обходит эту проблему, работая не с самими баллами, а с их рангами — местом каждого наблюдения в отсортированном по возрастанию ряду, — и поэтому остаётся корректным независимо от того, равны интервалы шкалы или нет.
Второй повод — нелинейная, но монотонная связь. Пирсон измеряет именно линейную связь и недооценивает силу зависимости, где рост одной переменной сопровождается ростом другой, но не строго пропорционально — например, ускоряющимся или замедляющимся образом. Спирмен по устройству расчёта чувствителен именно к направлению связи, а не к её конкретной форме, и потому улавливает такие зависимости точнее. Третий повод — выбросы: один аномально большой или маленький ответ способен заметно исказить коэффициент Пирсона, а на ранг он повлияет не больше чем на одну позицию, что делает Спирмена заметно устойчивее к единичным нетипичным наблюдениям в выборке. Четвёртый, менее очевидный повод — связь между переменными с разными единицами измерения и разным разбросом значений, где абсолютная величина изменения одной переменной плохо сопоставима с изменением другой: ранговый подход снимает эту проблему автоматически, поскольку сравнивает не сами числа, а относительное положение наблюдений внутри каждой переменной.
Как считается: ранги вместо значений
Расчёт начинается с того, что значения каждой из двух переменных отдельно ранжируются от наименьшего к наибольшему; при совпадающих значениях им присваивается общий средний ранг. Затем к полученным рангам применяется обычная формула корреляции Пирсона — то есть Спирмен по сути является корреляцией Пирсона, посчитанной не по исходным данным, а по их рангам. Это объясняет, почему интерпретация итогового числа похожа: значение от минус единицы до единицы, где ноль означает отсутствие монотонной связи, а близкие к краям значения — сильную связь в положительном или отрицательном направлении.
Практически расчёт делается тем же статистическим инструментом, что и обычная корреляция, — большинство пакетов и электронных таблиц с надстройками для статистики считают коэффициент Спирмена по кнопке или формуле так же легко, как и Пирсона, разница только в выборе метода. Значимость коэффициента, то есть вероятность того, что связь такой силы возникла бы случайно при отсутствии реальной зависимости, считается и указывается рядом с самим значением — и оценивать стоит оба числа вместе, а не только силу связи саму по себе.
Связанные ранги: особенность порядковых шкал опроса
В шкале Лайкерта из пяти вариантов у сотни респондентов почти неизбежно найдётся много совпадающих оценок — скажем, тридцать человек поставят «4». Формула ранжирования для таких совпадений присваивает всем им общий средний ранг: если тридцать ответов делят между собой позиции с пятидесятой по семьдесят девятую, каждый из них получает ранг 64,5 — среднее арифметическое границ этого диапазона. Чем меньше вариантов ответа на шкале и чем больше выборка, тем больше таких совпадений возникает, и без поправки на связанные ранги стандартная формула коэффициента даёт слегка смещённую оценку.
На практике беспокоиться об этом почти никогда не нужно: подавляющее большинство статистических пакетов и функций для расчёта Спирмена в таблицах автоматически применяют поправку на связанные ранги, и результат уже её учитывает. Важнее знать сам факт существования поправки, чтобы не удивляться, если ручной расчёт по учебной формуле без поправки чуть разойдётся с тем, что выдаёт готовый инструмент, — расхождение обычно небольшое, но полностью объяснимое именно этой деталью, а не ошибкой в данных.
Матрица корреляций по нескольким вопросам анкеты
Если в анкете десяток связанных по смыслу вопросов на порядковых шкалах, удобно посчитать не одну пару коэффициентов, а сразу матрицу — таблицу, где на пересечении каждой строки и столбца стоит коэффициент Спирмена между соответствующей парой вопросов. Это быстро показывает общую структуру связей: какие вопросы движутся вместе, какие независимы друг от друга, а какие, возможно, дублируют один и тот же смысл разными формулировками. Такая матрица — практичный первый шаг перед более сложными методами вроде факторного анализа, когда нужно понять, не измеряет ли анкета на самом деле меньше самостоятельных конструктов, чем в ней вопросов.
При построении матрицы по многим парам сразу особенно важно не забывать про множественность сравнений: если в анкете двадцать вопросов, число возможных пар превышает сто девяносто, и на уровне значимости 0,05 несколько случайных ложных связей появятся почти наверняка просто по теории вероятностей. Смотреть на такую матрицу стоит не в поисках любой формально значимой ячейки, а в поисках коэффициентов, заметно выделяющихся по силе на общем фоне, — это более надёжный сигнал, чем единичное пересечение порога значимости.
Пример: связь оценки поддержки и готовности продлить подписку
| Метрика | Коэффициент Пирсона | Коэффициент Спирмена |
|---|---|---|
| Оценка поддержки (1–5) и готовность продлить (1–5) | 0,41 | 0,52 |
| Оценка поддержки (1–5) и месячный чек (числовой) | 0,18 | 0,19 |
| Время ответа (минуты) и оценка поддержки (1–5) | -0,23 | -0,37 |
Цифры в примере условные и нужны только для того, чтобы показать формат сравнения, а не как ориентир по реальным значениям коэффициентов. Разница между значениями Пирсона и Спирмена в первой и третьей строке этой таблицы заметно больше, чем во второй строке, — и это вполне типичная картина: там, где обе переменные порядковые или связь нелинейна, расхождение между коэффициентами существенно, а там, где обе переменные числовые с примерно линейной связью, оба метода дают близкий результат. Именно поэтому Спирмен особенно важен для пар переменных, где хотя бы одна измерена шкалой Лайкерта.
Как читать значение коэффициента
Общепринятые ориентировочные границы для силы связи такие: значения примерно до 0,3 читаются как слабая связь, от 0,3 до 0,5 — умеренная, от 0,5 до 0,7 — заметная, выше 0,7 — сильная. Эти границы условны и не заменяют содержательной оценки: коэффициент 0,3 между оценкой поддержки и готовностью продлить подписку может быть вполне значимым практическим сигналом, если раньше эта связь считалась отсутствующей, а коэффициент 0,3 между двумя показателями, теоретически обязанными совпадать почти полностью, — поводом проверить, не ошибка ли это в данных.
Сам по себе знак коэффициента показывает направление найденной связи: положительный означает, что при росте одной переменной растёт и другая, отрицательный — что при росте одной другая снижается. В таблице выше время ответа поддержки отрицательно связано с оценкой: чем дольше ждали ответа, тем ниже оценка, и это направление интуитивно понятно, но важно всё же проверять его по данным, а не считать заранее очевидным — иногда связь оказывается противоположной ожиданиям, и именно такие случаи чаще всего стоит разбирать в первую очередь.
Корреляция — не причинность
Как и любой коэффициент корреляции, Спирмен показывает совместное изменение двух переменных, но не то, что одна вызывает другую. Связь между временем ответа поддержки и оценкой может объясняться напрямую — долгое ожидание раздражает и снижает оценку, — а может опосредованно: сложные обращения одновременно требуют больше времени на решение и вызывают больше недовольства независимо от скорости ответа как таковой. Разделить эти две версии объяснения по одному-единственному коэффициенту корреляции нельзя; для этого нужен либо контролируемый эксперимент, либо дополнительная переменная, отдельно фиксирующая сложность каждого обращения.
Частичная корреляция: как учесть влияние третьей переменной
Если есть подозрение, что видимая связь между двумя переменными на самом деле объясняется третьей — например, связь между временем ответа и оценкой на самом деле объясняется сложностью обращения, а не самим временем, — можно посчитать частичную корреляцию: она показывает связь между первыми двумя переменными при статистически зафиксированном значении третьей. Если частичный коэффициент оказывается заметно ниже обычного, это подтверждает, что третья переменная действительно объясняла существенную часть исходной связи.
Частичная корреляция не заменяет полноценный контролируемый эксперимент и остаётся статистическим, а не причинным доказательством, но она дешевле и быстрее: не нужно ничего менять в процессе сбора данных, если нужная третья переменная уже есть в собранном опросе. Ограничение в том, что метод работает надёжно только тогда, когда сама контролируемая переменная измерена достаточно точно; шумная или грубо категоризированная третья переменная снимет связь лишь частично, и вывод о её роли в исходной связи окажется заметно заниженным по сравнению с реальным вкладом этой переменной.
Ограничения
Главное ограничение — Спирмен улавливает только монотонные связи: если зависимость сначала растёт, а потом падает — например, оценка удовлетворённости растёт с ростом цены до определённого уровня, а затем снижается, — коэффициент может оказаться близким к нулю, хотя реальная связь между переменными сильная, просто немонотонная. В таком случае числовой коэффициент вообще плохо описывает зависимость, и её стоит сначала увидеть на диаграмме рассеяния, прежде чем сводить к одному числу. Немонотонные связи в опросах встречаются чаще, чем кажется: удовлетворённость длиной анкеты, например, обычно растёт с уменьшением числа вопросов лишь до определённой точки, а затем перестаёт заметно меняться, и любая попытка описать такую зависимость одним-единственным коэффициентом корреляции почти неизбежно даёт обманчиво слабый и вводящий в заблуждение итоговый результат.
Второе ограничение — как и у Пирсона, коэффициент чувствителен к объёму данных при интерпретации значимости: на выборке в несколько тысяч ответов даже коэффициент 0,05 способен пройти порог статистической значимости, оставаясь при этом практически незначимым для решений. Поэтому силу связи стоит оценивать по самому значению коэффициента, а значимость — по p-значению, и не путать одно с другим при формулировке вывода в отчёте. Третье ограничение — коэффициент чувствителен к разнородности выборки: если объединить в один расчёт два сегмента клиентов, где связь между переменными выражена по-разному или направлена в разные стороны, общий коэффициент может показать слабую или даже нулевую связь там, где внутри каждого сегмента по отдельности она отчётливая, — этот эффект стоит проверять, разбивая расчёт по подгруппам, если есть основания подозревать неоднородность.
Как выбрать между Спирменом и Пирсоном на практике
- Если хотя бы одна переменная порядковая — оценка, ранг, уровень — сразу берите Спирмена.
- Если обе переменные числовые, постройте диаграмму рассеяния и оцените форму связи на глаз.
- При явно нелинейной, но монотонной форме связи выбирайте Спирмена вместо Пирсона.
- При заметных выбросах на диаграмме предпочтите Спирмена как более устойчивый к ним метод.
- В спорном случае посчитайте оба коэффициента: близкие значения снимают вопрос выбора метода.
- Всегда указывайте в отчёте, какой из двух коэффициентов использован и почему.
Типичные ошибки
- Считать корреляцию Пирсона между двумя порядковыми шкалами по умолчанию, не проверив альтернативу.
- Делать вывод о причинности из значимого коэффициента корреляции.
- Игнорировать нелинейные немонотонные связи, которые коэффициент Спирмена не улавливает.
- Приводить в отчёте коэффициент без указания на статистическую значимость связи.
- Не проверять диаграмму рассеяния перед тем, как свести связь к одному числу.
- Путать силу связи, которую показывает коэффициент, с её статистической значимостью.
С чего начать
Возьмите пару вопросов из последнего опроса, где вы уже считали или собирались считать корреляцию, и постройте диаграмму рассеяния ответов. Если хотя бы одна переменная порядковая, или на графике заметна нелинейная, но при этом монотонная форма связи — посчитайте сразу оба коэффициента, Пирсона и Спирмена, и внимательно сравните полученные значения между собой. Расчёт в сервисе «До Сути» не выполняется: опрос собирает и хранит парные ответы на оба вопроса анкеты, а сами коэффициенты, диаграмма рассеяния и при необходимости матрица корреляций по нескольким вопросам сразу считаются во внешнем статистическом инструменте или обычной таблице уже после выгрузки данных.
Частые вопросы
Пирсон измеряет линейную связь между двумя числовыми переменными по их фактическим значениям и требует шкалы с равными интервалами между значениями. Спирмен считается по рангам — местам наблюдений в отсортированном ряду — и поэтому не требует ни равных интервалов, ни линейности связи, только монотонности. Это делает Спирмена подходящим для порядковых шкал вроде оценки удовлетворённости и устойчивым к выбросам, которые заметно искажают коэффициент Пирсона.
Прежде всего, когда хотя бы одна из двух переменных измерена порядковой шкалой — оценкой от 1 до 5, рангом важности, уровнем образования. Также стоит перейти на Спирмена при явно нелинейной, но монотонной форме связи на диаграмме рассеяния и при заметных выбросах в данных. Если обе переменные числовые, связь примерно линейна и выбросов нет, оба коэффициента дают близкий результат, и выбор между ними не принципиален.
Число от минус единицы до единицы: ноль означает отсутствие монотонной связи, значения ближе к единице — сильную положительную связь, к минус единице — сильную отрицательную. Ориентировочно до 0,3 — слабая связь, от 0,3 до 0,5 — умеренная, от 0,5 до 0,7 — заметная, выше 0,7 — сильная, но эти границы условны и должны оцениваться с учётом контекста задачи, а не как жёсткое правило.
Нет, ни для Спирмена, ни для Пирсона. Коэффициент показывает, что две переменные изменяются согласованно, но не объясняет, почему. Связь может объясняться прямым влиянием одной переменной на другую, обратным влиянием или третьей переменной, воздействующей на обе сразу. Чтобы подтвердить причинность, нужен контролируемый эксперимент или дополнительный анализ, а не один коэффициент корреляции, каким бы сильным он ни оказался.