Метрики · 6 сентября 2026 г.
Регрессионный анализ опроса: что на самом деле влияет на NPS
Регрессионный анализ опроса — это способ посчитать, насколько сильно каждый отдельный фактор — скорость ответа поддержки, цена, качество продукта — двигает итоговую метрику вроде NPS или общей удовлетворённости, при этом отделив его влияние от влияния остальных факторов. Корреляция показывает, что два вопроса связаны, но не говорит, какой из них главный, если факторов десять и все они между собой немного связаны. Регрессия отвечает именно на этот вопрос: какой вклад у каждого фактора при прочих равных и сколько процентов различий в оценке она вообще объясняет. Ниже — как считать простую и множественную регрессию на примере, как читать коэффициенты, что такое R² и мультиколлинеарность и почему высокий коэффициент ещё не значит, что фактор стоит чинить первым.
Зачем регрессия, если уже есть корреляция
Корреляция отвечает на вопрос, связаны ли два показателя между собой, но перестаёт быть полезной, как только факторов становится больше одного. Предположим, вы просите клиентов оценить цену, скорость обслуживания, качество продукта и поддержку, а потом смотрите, что сильнее всего коррелирует с итоговой удовлетворённостью. Часто оказывается, что сильнее всего коррелируют сразу три фактора из четырёх — просто потому, что довольные клиенты в среднем выше оценивают всё подряд, а недовольные занижают всё подряд. Раздельные корреляции в такой ситуации не говорят, какой фактор действительно двигает оценку, а какой просто едет на общем фоне удовлетворённости.
Регрессионный анализ решает именно эту задачу: он оценивает вклад каждого фактора при фиксированных остальных, то есть отвечает на вопрос «что изменится в оценке, если этот фактор вырастет, а все другие останутся на месте». Результат — не просто список сильных корреляций, а список факторов, ранжированных по уникальному вкладу, который не объясняется остальными переменными. Это ровно то, что нужно для приоритизации: если у отдела продукта есть время на одно улучшение, регрессия отвечает, какое из четырёх вероятных направлений даст больше эффекта на итоговую метрику, а не просто какое сильнее с ней связано на бумаге.
Похожая ситуация возникает и при сравнении отделов внутри одной компании: если отдел с самым высоким NPS одновременно отличается и низкими ценами, и быстрой доставкой, и лучшим сервисом, простая корреляция не скажет, какой из трёх факторов на самом деле тянет оценку вверх, а какие просто сопутствуют. Регрессия, поставленная на данные по отделам, разложит эти три фактора и покажет, что реально объясняет разницу, а что — побочный эффект того, что хорошие отделы обычно хороши сразу во всём.
Что такое драйверный анализ на практике
На практике эту задачу называют драйверным анализом: NPS или общая удовлетворённость выступает целевой переменной, а частные оценки — цены, скорости, качества, поддержки — предикторами. Модель считает не абсолютную важность каждого фактора в вакууме, а вклад, очищенный от пересечений с остальными: если скорость и качество продукта у вас сильно коррелируют между собой, регрессия честно покажет, что часть влияния скорости на самом деле объясняется качеством, и не отдаст этот вклад дважды.
Стоит сразу проговорить, чего драйверный анализ не даёт. Регрессия — метод корреляционный, а не экспериментальный, и высокий коэффициент у фактора не доказывает, что именно его изменение вызовет рост NPS, — доказывает это только эксперимент, где вы реально меняете скорость обслуживания и смотрите на результат. Но даже без причинного доказательства ранжирование по регрессии полезнее ранжирования по сырой корреляции: оно как минимум убирает эффект «всё связано со всем через общее настроение респондента», который иначе искажает список приоритетов.
Простая линейная регрессия на одном примере
Начнём с самого простого случая — один предиктор и одна цель. Пусть вы собираете время ожидания ответа поддержки в минутах и итоговую оценку удовлетворённости по десятибалльной шкале. Простая регрессия подбирает прямую линию, которая лучше всего описывает облако точек «время ожидания — оценка», и даёт два числа: на сколько в среднем меняется оценка при увеличении времени ожидания на одну минуту, и какой была бы оценка при нулевом ожидании. Первое число — это и есть коэффициент, вокруг которого строится вся интерпретация.
Цифры в примере ниже условные и нужны только для того, чтобы показать формат расчёта, а не как реальный ориентир для вашей отрасли. При коэффициенте минус 0,3 балла за минуту ожидания клиент, прождавший десять минут, в среднем оценивает сервис на три балла ниже того, кто получил ответ мгновенно, — и этого уже достаточно, чтобы понять, стоит ли вкладываться в сокращение очереди поддержки, ещё до того как считать более сложные модели с несколькими факторами сразу.
| Время ожидания, мин | Средняя оценка | Предсказание регрессии |
|---|---|---|
| 0 | 8.7 | 8.6 |
| 5 | 7.2 | 7.1 |
| 10 | 5.8 | 5.6 |
| 20 | 3.1 | 2.6 |
Множественная регрессия: несколько факторов одновременно
Когда предикторов несколько, логика та же, но появляется важное уточнение: каждый коэффициент теперь показывает вклад своего фактора при удержании остальных постоянными. Если в модель с временем ожидания добавить оценку компетентности оператора, коэффициент при времени ожидания обычно немного меняется — часть эффекта, которая раньше приписывалась только скорости, на самом деле объяснялась тем, что медленные ответы чаще давали менее компетентные операторы. Множественная регрессия разводит эти два эффекта по отдельности, а простая — нет, потому что не видит второй фактор вообще.
Отдельная практическая деталь — факторы в модели почти всегда измерены в разных единицах: минуты, рубли, баллы по шкале от одного до пяти. Сравнивать сырые коэффициенты между собой в этом случае бессмысленно: коэффициент минус 0,3 у времени ожидания и коэффициент 0,8 у оценки качества продукта не говорят, что качество вдвое важнее. Для сравнения используют стандартизированные коэффициенты — бета, — которые пересчитаны так, будто все переменные измерены в одинаковых единицах отклонения от среднего. Только по бете корректно ранжировать факторы между собой.
Мультиколлинеарность: когда факторы дублируют друг друга
Есть ситуация, в которой коэффициенты регрессии начинают вести себя странно: знак у фактора вдруг оказывается противоположным здравому смыслу, или коэффициент у явно важного показателя внезапно почти нулевой. Чаще всего причина — мультиколлинеарность: два или больше предикторов сильно коррелируют между собой, и модель не может честно разделить их вклады, потому что не знает, какому из почти одинаковых факторов приписать общий эффект. Внешне это выглядит как проблема модели, а на деле — проблема данных, которую регрессия просто честно показывает.
Простая проверка перед расчётом — посмотреть на корреляционную матрицу самих предикторов, а не только на их связь с целевой переменной. Если два вопроса анкеты коррелируют между собой на уровне 0,8–0,9, они, скорее всего, измеряют одно и то же под разными формулировками, и включать оба в модель как независимые факторы не стоит. Решение обычно одно из двух: оставить один из дублирующих вопросов, а второй убрать, либо объединить их в один фактор через факторный анализ и подавать в регрессию уже готовую сводную оценку вместо двух почти одинаковых.
Есть и более простой практический тест на мультиколлинеарность, не требующий специальных расчётов: если при добавлении нового предиктора коэффициенты у уже включённых факторов резко меняются — вдвое или больше, — это почти всегда сигнал, что новый фактор частично дублирует один из старых. Устойчивая модель ведёт себя иначе: добавление разумного нового предиктора немного корректирует существующие коэффициенты, но не переворачивает их с ног на голову. Этот простой признак стоит проверять каждый раз, когда модель пополняется новым фактором, а не полагаться только на формальные показатели мультиколлинеарности.
R² и что он на самом деле показывает
R² показывает долю различий в целевой переменной, которую объясняет модель, — от нуля до единицы, или в процентах. Модель с R² 0,35 объясняет тридцать пять процентов различий в оценках клиентов набором включённых факторов, а остальные шестьдесят пять процентов приходятся на всё, что в модель не попало: настроение в моменте, ожидания, о которых вы не спрашивали, случайные колебания. На опросных данных о человеческом поведении R² в диапазоне 0,2–0,4 — нормальный результат, а не признак того, что модель не удалась: люди не описываются десятком переменных полностью, и ожидать иного не стоит.
Логистическая регрессия: когда результат бинарный
Обычная регрессия предполагает, что целевая переменная непрерывна — оценка по шкале, сумма покупки, время ответа. Но часто интересующий результат бинарный: клиент ушёл или остался, порекомендовал компанию или нет, продлил подписку или отказался. Для таких случаев используют логистическую регрессию: вместо прямой линии она подбирает кривую вероятности от нуля до единицы и вместо коэффициента в баллах даёт коэффициент в виде отношения шансов — во сколько раз выше или ниже шанс события при росте фактора на единицу.
Логистическая регрессия требует больше данных, чем обычная, особенно если интересующее событие редкое: если клиентов, отказавшихся от продления, среди опрошенных всего пятнадцать из трёхсот, надёжно оценить модель с пятью-шестью предикторами уже сложно — не хватает случаев самого редкого исхода. Практическое правило — минимум несколько десятков случаев именно того результата, который встречается реже, а не общий размер выборки. При меньшем числе результат модели становится нестабильным и сильно зависит от случайного состава выборки.
Есть и промежуточный вариант между обычной и логистической регрессией, о котором стоит знать: порядковая регрессия — для случаев, когда результат не бинарный, а упорядоченный, но не непрерывный, например уровень удовлетворённости «низкий, средний, высокий» вместо балла от одного до десяти. Она учитывает порядок категорий, но не предполагает, что расстояние между «низким» и «средним» равно расстоянию между «средним» и «высоким», в отличие от обычной регрессии, которая такое равенство расстояний требует по умолчанию.
Типичные ошибки интерпретации
- Читать регрессионную связь как доказательство причинности без эксперимента.
- Сравнивать сырые, нестандартизированные коэффициенты между факторами в разных единицах.
- Включать в модель два сильно коррелирующих между собой предиктора, не проверив мультиколлинеарность.
- Судить о качестве модели по обычному R² при разном числе факторов вместо скорректированного.
- Строить модель на выборке меньше десяти-двадцати наблюдений на каждый предиктор.
- Отбрасывать факторы с низким коэффициентом как неважные, не проверив мультиколлинеарность как причину.
- Использовать обычную линейную регрессию для бинарного результата вместо логистической.
- Добавлять предикторы пост-фактум, пока какой-нибудь не окажется значимым, и не упоминать остальные попытки.
Ограничения метода
У регрессии есть жёсткие требования к данным, которые легко нарушить, даже не заметив. Она чувствительна к выбросам: один респондент с аномально низкой оценкой и большим временем ожидания способен заметно сдвинуть коэффициент, особенно на небольшой выборке. Она предполагает более или менее линейную связь между фактором и целевой переменной, а если связь на деле выглядит как порог или перевёрнутая U-образная кривая, обычная регрессия эту форму не увидит и покажет слабую или нулевую связь там, где она на самом деле сильная, просто нелинейная.
Второе ограничение — требование к размеру выборки растёт вместе с числом факторов: типичный ориентир — не меньше десяти-двадцати респондентов на каждый предиктор в модели, иначе коэффициенты становятся неустойчивыми и сильно меняются от выборки к выборке. И третье, самое важное: регрессия остаётся корреляционным методом даже при большом R² и аккуратных коэффициентах. В сервисе «До Сути» ответы выгружаются в таблицу с исходными баллами по всем вопросам, а саму регрессию считают во внешнем статистическом инструменте — полноценного регрессионного анализа внутри сервиса нет, и надёжнее сказать это прямо, чем создавать впечатление, что коэффициенты появляются сами.
На практике полезно проверять устойчивость модели: пересчитать коэффициенты, исключив по очереди пять-десять процентов респондентов со случайно выбранных концов выборки, и посмотреть, сильно ли меняется картина. Если ключевые коэффициенты остаются примерно теми же при разных подвыборках, модель устойчива и её выводам можно доверять больше. Если же порядок факторов по важности каждый раз меняется местами, это сигнал, что данных пока недостаточно для уверенных выводов, а не повод считать регрессию бесполезным методом.
С чего начать
Если раньше вы ранжировали факторы только по корреляции с NPS, первый шаг — собрать те же данные, что уже есть, в одну таблицу и построить множественную регрессию с тремя-пятью самыми вероятными предикторами. Даже на скромной выборке в сто-полтораста ответов регрессия чаще всего меняет порядок факторов по сравнению с наивным ранжированием по корреляции, и именно эта разница — самое полезное, что даёт первый расчёт. Начинать стоит с малого числа факторов: три-четыре хорошо обоснованных предиктора дадут более устойчивый и интерпретируемый результат, чем пятнадцать собранных на всякий случай.
- Проверьте корреляции между самими предикторами и уберите явных дублёров.
- Постройте модель с тремя-пятью факторами, а не со всеми доступными сразу.
- Смотрите на стандартизированные коэффициенты, а не на сырые.
- Оцените R² трезво: 0,2–0,4 на опросных данных о поведении людей — нормальный результат.
- Проверьте устойчивость модели без одного-двух респондентов с самыми крайними ответами.
Частые вопросы
Корреляция показывает, что два показателя связаны, но не разделяет вклад каждого, если факторов несколько и они сами коррелируют между собой. Регрессия оценивает вклад каждого фактора при фиксированных остальных — отвечает на вопрос, что изменится в оценке, если один фактор вырастет, а все другие останутся на месте. Для приоритизации улучшений это существеннее: наивное ранжирование по корреляции часто выдвигает вперёд факторы, которые на самом деле лишь едут на общем фоне удовлетворённости, а не двигают её сами.
Строго говоря, нет: регрессия — метод корреляционный, и высокий коэффициент не доказывает причинность так, как это делает эксперимент с реальным изменением фактора. Но даже без причинного доказательства ранжирование по регрессии полезнее ранжирования по сырой корреляции, потому что убирает искажение от факторов, связанных друг с другом через общее настроение респондента. Практический вывод: используйте регрессию для приоритизации гипотез, а окончательную проверку — через эксперимент или изменение и повторный замер.
Ориентир — не меньше десяти-двадцати респондентов на каждый предиктор в модели: для модели с четырьмя факторами это от сорока до восьмидесяти ответов, а для логистической регрессии с редким бинарным исходом требования выше и считаются от числа случаев именно редкого результата, а не от общего размера выборки. При меньшей выборке коэффициенты становятся неустойчивыми и сильно меняются от выборки к выборке, а интерпретировать такую модель рискованно.
Это мультиколлинеарность, и она делает коэффициенты ненадёжными: модель не может честно разделить вклад почти одинаковых факторов и способна даже присвоить одному из них неожиданный знак. Проверяется простым взглядом на корреляционную матрицу самих предикторов, а не только на их связь с целевой переменной. Решение — оставить один из дублирующих вопросов и убрать второй, либо объединить их через факторный анализ в одну сводную оценку и подавать в регрессию уже её.