«До Сути»← Все статьи

Метрики · 15 августа 2026 г.

Сравнение двух волн опроса: как понять, что показатель реально изменился

Чтобы сравнить две волны опроса, недостаточно вычесть одну цифру из другой. У каждой волны своя погрешность, и разница между ними имеет собственную погрешность — примерно в полтора раза больше, чем у отдельного замера. Практическое следствие: при выборке в 300 человек изменение доли меньше чем на 8 процентных пунктов вообще нельзя считать изменением, сколько бы уверенно оно ни выглядело на графике. Ниже разберём, как считать порог обнаружения, сколько ответов нужно собирать под нужную чувствительность, что делать с маленькими подгруппами и как оформить сравнение так, чтобы читатель отчёта не сделал неверный вывод.

Почему нельзя просто вычесть одну цифру из другой

Любая цифра из опроса — это оценка, а не точное значение. Когда вы получаете 42% довольных, настоящая доля в аудитории лежит где-то рядом, в интервале вокруг этой оценки, и ширина интервала зависит от числа опрошенных. Во второй волне вы получаете другую оценку — скажем, 45%, — и у неё тоже есть свой интервал. Разница в три пункта, которую вы видите, может быть настоящим изменением, а может быть результатом того, что в первый раз случайно попались люди чуть менее довольные, а во второй — чуть более. Отличить одно от другого на глаз невозможно, поэтому и нужен расчёт.

Особенно коварно это выглядит на графике. Линия, соединяющая точки 42 и 45, рисует убедительную восходящую динамику, хотя обе точки могли быть порождены одной и той же неизменной реальностью. Именно поэтому в трекингах так часто появляются красивые тренды, которые потом разворачиваются без всякой причины: люди читают колебания как движение. Первое, что стоит сделать с графиком трекинга, — нанести на него границы погрешности. Обычно после этого половина обсуждаемых изменений визуально исчезает внутри полос, и разговор сразу становится содержательнее.

Погрешность разницы, а не погрешность замера

Ключевая техническая деталь, которую пропускают чаще всего: когда вы сравниваете две волны, неопределённость складывается. У вас не одна погрешность, а две, и обе участвуют в разнице. Приблизительное правило для практики: погрешность разницы примерно в полтора раза больше погрешности одного замера при равных выборках. То есть если в каждой волне погрешность около 5 пунктов, то разница считается заметной начиная примерно с 7 пунктов, а не с 5. Именно эту величину и надо держать в голове, объявляя об изменении.

Ответов в каждой волнеПогрешность замераПорог заметной разницы
100±10 п.п.около 14 п.п.
200±7 п.п.около 10 п.п.
300±6 п.п.около 8 п.п.
500±4,4 п.п.около 6 п.п.
1000±3,1 п.п.около 4,4 п.п.
2000±2,2 п.п.около 3,1 п.п.
Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Как читать эту таблицу

Значения в таблице рассчитаны для доли около половины — это самый неблагоприятный случай, при котором погрешность максимальна. Для долей ближе к краям, скажем 10% или 90%, погрешность заметно меньше, и пороги смягчаются. Цифры округлены и нужны как рабочий ориентир, а не как точный расчёт: если решение стоит дорого, считайте под свои данные. Но даже в таком виде таблица закрывает большинство практических ситуаций, потому что главный вывод из неё один и он неприятный: на типичных для прикладных опросов выборках в двести-триста человек заметить можно только крупные сдвиги.

Отсюда следует важное для планирования правило: определитесь заранее, какое изменение вы хотите уметь замечать, и только потом выбирайте размер выборки. Если для бизнеса значим сдвиг в три пункта, а вы собираете двести ответов, замер бессмысленен — он физически не способен увидеть такое изменение и будет показывать шум. Либо увеличивайте выборку до нескольких тысяч, либо признайте, что этот показатель вы отслеживаете грубо и реагируете только на крупные движения. Оба решения нормальны; плохо только третье — собирать двести ответов и делать вид, что видно всё.

Полезно понимать и обратную сторону: увеличение выборки даёт всё меньше отдачи. Чтобы вдвое сузить погрешность, нужно вчетверо больше ответов — переход с двухсот на восемьсот сокращает порог примерно с десяти пунктов до пяти, а следующее вчетверо, до трёх тысяч двухсот, даст всего два с половиной. Поэтому гнаться за очень мелкой чувствительностью в прикладных задачах обычно нерационально: стоимость сбора растёт быстрее, чем точность. Разумная позиция — выбрать порог, при котором вы действительно готовы что-то предпринять, и не платить за различение сдвигов, на которые всё равно не будете реагировать.

Доли и средние сравниваются по-разному

Показатели из опросов бывают двух видов, и правила для них отличаются. Доли — это проценты выбравших вариант: доля довольных, доля тех, кто рекомендовал бы, доля столкнувшихся с проблемой. Для них работают пороги из таблицы выше. Средние — это средний балл по шкале, средняя оценка, средний индекс. Их погрешность зависит не только от числа ответов, но и от разброса самих оценок: если все ставят похожие баллы, среднее устойчиво даже на небольшой выборке, а если оценки разбросаны по всей шкале, среднее гуляет сильно.

Практическое следствие: для средних нельзя пользоваться готовой табличкой — нужно смотреть на разброс в своих данных. Простой способ прикинуть без формул: разбейте случайным образом ответы одной волны пополам и посчитайте среднее в каждой половине. Расхождение между половинами покажет, насколько показатель вообще устойчив на такой выборке. Если половины одной и той же волны отличаются на полбалла, то и разница в полбалла между двумя волнами ничего не значит.

Ещё одна причина осторожно относиться к средним: они скрывают структуру ответов. Средний балл 7 из 10 может означать, что почти все поставили семёрку, а может — что половина поставила десятки, а половина четвёрки. Это принципиально разные ситуации с разными выводами, но на графике трекинга они выглядят одинаково. Поэтому вместе со средним всегда полезно смотреть распределение или хотя бы долю крайних оценок. Нередко именно там и обнаруживается движение: среднее стоит на месте, а доля недовольных за два квартала выросла вдвое.

Что делать с маленькими подгруппами

Самое частое место, где ломается сравнение, — разрезы. Общая выборка в пятьсот человек выглядит солидно, но стоит разбить её по регионам или тарифам, и в каждой ячейке остаётся по сорок-пятьдесят ответов. Пороги для таких подгрупп огромны: чтобы заметить изменение на выборке в пятьдесят человек, оно должно составлять около двадцати пунктов. При этом именно в разрезах обычно и находят самые захватывающие «инсайты» — просто потому, что маленькие подгруппы скачут сильнее всего и всегда найдётся та, где цифра резко поменялась.

У этого эффекта есть и вторая сторона, о которой стоит помнить отдельно. Чем больше разрезов вы просматриваете, тем выше вероятность наткнуться на случайное различие хотя бы в одном из них — это чистая арифметика, а не невезение. Просмотрев двадцать сегментов, вы почти гарантированно найдёте один «изменившийся», даже если в реальности не изменилось ничего. Защита простая и требует дисциплины: заранее назовите два-три разреза, которые считаете главными, и смотрите сначала на них. Всё найденное в остальных разрезах считайте гипотезой для проверки в следующей волне, а не результатом.

Если в подгруппе меньше тридцати ответов, не сравнивайте её волны между собой вообще. Показывайте такие ячейки как справочные числа с явной пометкой о малой базе — или объединяйте подгруппы, пока в каждой не наберётся достаточно ответов.

Практическое правило двух волн

Помимо арифметики есть простое эмпирическое правило, которое хорошо работает в прикладных задачах: доверяйте изменению, которое подтвердилось дважды. Если показатель вырос в одной волне и продолжил расти в следующей, это гораздо надёжнее, чем однократный скачок такой же величины. Случайные колебания не имеют направления и редко повторяются два раза подряд в одну сторону, а настоящее изменение обычно проявляется устойчиво. Это правило не заменяет расчёта, но спасает в ситуации, когда считать некому и некогда.

Работает и симметричное наблюдение: если показатель дважды подряд качнулся в разные стороны примерно на одну величину, почти наверняка вы наблюдаете обычный разброс вокруг неизменного уровня. Такая пила на графике — типичный признак того, что выборка мала для выбранного показателя. Реакция на неё должна быть не содержательной, а методической: либо увеличивать сбор, либо снижать частоту замеров и смотреть на более длинные интервалы, где накопленное изменение успевает превысить порог. Пытаться объяснять каждый зубец событиями в компании — верный способ построить убедительную, но выдуманную историю.

  1. Проверьте сопоставимость волн: тот же канал, тот же сегмент, та же анкета.
  2. Сравните число ответов: если оно упало вдвое, изменение показателя может объясняться этим.
  3. Найдите порог заметной разницы по числу ответов в меньшей из волн.
  4. Сравните фактическую разницу с порогом; меньше порога — фиксируйте «без изменений».
  5. Если разница выше порога, проверьте, повторяется ли направление в следующей волне.

Как оформить сравнение в отчёте

Отчёт по двум волнам должен позволять читателю самому оценить надёжность вывода. Минимальный набор: показатель в обеих волнах, число ответов в каждой, разница и явное указание, считаете вы её значимой или нет. Формулировка «показатель вырос с 42% до 45%, разница в пределах погрешности» звучит скучнее, чем «рост на три пункта», но именно она защищает вас от неприятного разговора через квартал, когда показатель вернётся обратно. Осторожные формулировки на этом этапе — не перестраховка, а способ сохранить доверие к данным.

Отдельно стоит договориться о языке. Полезно ввести три уровня: «изменений нет» — разница в пределах порога; «есть сигнал» — разница выше порога, но подтверждения второй волной пока нет; «изменение подтверждено» — выше порога и повторилось. Три ярлыка вместо расплывчатых формулировок убирают большую часть споров на защите результатов, потому что переносят разговор с интерпретации на заранее согласованные правила. В сервисе «До Сути» ответы разбираются автоматически, но решение о том, считать ли движение показателя значимым, всё равно принимается по вашим правилам, а не сервисом.

Ограничения

Все расчёты выше отвечают на единственный вопрос: могло ли наблюдаемое различие возникнуть случайно. Они ничего не говорят о том, почему показатель изменился, и не защищают от систематических искажений. Если между волнами поменялся канал сбора или просела доля ответивших, разница может быть сколь угодно большой и статистически убедительной — и при этом полностью объясняться сменой состава респондентов, а не изменением мнений. Порог значимости — это фильтр против случайности, а не против методической ошибки, и он не заменяет проверку сопоставимости волн.

Второе ограничение практическое: статистическая значимость и практическая важность — разные вещи. На выборке в несколько тысяч человек значимым окажется сдвиг в полтора пункта, но это не значит, что ради него стоит менять продукт. И наоборот: изменение в восемь пунктов на выборке в двести человек формально не проходит порог, но если оно совпало с крупным сбоем и подтверждается жалобами в поддержку, игнорировать его глупо. Расчёт даёт основание для осторожности, а не запрет думать: решение всегда принимается с учётом остального контекста, а не по одному числу.

Типичные ошибки

С чего начать

Возьмите последние две волны своего замера и проделайте расчёт задним числом: найдите порог по числу ответов, сравните с фактической разницей и посмотрите, сколько из обсуждавшихся тогда изменений его преодолевают. По опыту, большая часть выводов оказывается колебаниями — и это самое полезное открытие, которое можно сделать за полчаса. Дальше зафиксируйте порог в шаблоне отчёта и договоритесь с командой о трёх ярлыках. С этого момента разговоры о результатах станут короче, а решения — устойчивее.

Если хочется совсем простой отправной точки, запомните одно число: на выборке около трёхсот ответов, типичной для прикладного опроса, обсуждать имеет смысл только сдвиги примерно от восьми процентных пунктов. Всё, что меньше, — это разговор о шуме, каким бы убедительным ни выглядел график. Одно это правило, применённое к следующему же отчёту, отсечёт большую часть ложных выводов, и на него не нужно ни формул, ни калькулятора.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Как понять, что разница между волнами опроса значима?

Сравните её с порогом, который зависит от числа ответов. Ориентиры для долей около половины: при 200 ответах в каждой волне заметна разница примерно от 10 процентных пунктов, при 500 — от 6, при 1000 — от 4,4. Важно, что у разницы своя погрешность, примерно в полтора раза больше, чем у отдельного замера, поэтому нельзя просто сравнивать изменение с погрешностью одной волны. Разница ниже порога — это «без изменений».

Сколько ответов нужно, чтобы заметить изменение в три процента?

Порядка двух тысяч ответов в каждой волне — при таком объёме порог заметной разницы опускается примерно до трёх пунктов. На типичных для прикладных опросов выборках в двести-триста человек изменение в три процента увидеть невозможно в принципе, оно полностью тонет в погрешности. Поэтому размер выборки нужно выбирать от обратного: сначала решить, какой сдвиг важно замечать, и уже под него планировать сбор.

Можно ли сравнивать волны по маленьким сегментам?

При базе меньше тридцати ответов — нет. Пороги для таких подгрупп огромны: на выборке в пятьдесят человек заметным будет только изменение около двадцати пунктов. При этом именно маленькие ячейки скачут сильнее всего, и всегда найдётся та, где цифра резко поменялась. Показывайте такие подгруппы как справочные числа с пометкой о малой базе или объединяйте их, пока не наберётся достаточно наблюдений.

Значимая разница доказывает, что помогли наши действия?

Нет. Расчёт значимости отвечает только на вопрос, могло ли различие возникнуть случайно. Он не объясняет причину и не защищает от методических искажений: если между волнами сменился канал сбора или упала доля ответивших, разница может быть большой и убедительной, но объясняться другим составом респондентов. Для доказательства причинно-следственной связи нужен эксперимент с контрольной группой, а не сравнение волн.

Читайте также