Метрики · 15 августа 2026 г.
Сравнение двух волн опроса: как понять, что показатель реально изменился
Чтобы сравнить две волны опроса, недостаточно вычесть одну цифру из другой. У каждой волны своя погрешность, и разница между ними имеет собственную погрешность — примерно в полтора раза больше, чем у отдельного замера. Практическое следствие: при выборке в 300 человек изменение доли меньше чем на 8 процентных пунктов вообще нельзя считать изменением, сколько бы уверенно оно ни выглядело на графике. Ниже разберём, как считать порог обнаружения, сколько ответов нужно собирать под нужную чувствительность, что делать с маленькими подгруппами и как оформить сравнение так, чтобы читатель отчёта не сделал неверный вывод.
Почему нельзя просто вычесть одну цифру из другой
Любая цифра из опроса — это оценка, а не точное значение. Когда вы получаете 42% довольных, настоящая доля в аудитории лежит где-то рядом, в интервале вокруг этой оценки, и ширина интервала зависит от числа опрошенных. Во второй волне вы получаете другую оценку — скажем, 45%, — и у неё тоже есть свой интервал. Разница в три пункта, которую вы видите, может быть настоящим изменением, а может быть результатом того, что в первый раз случайно попались люди чуть менее довольные, а во второй — чуть более. Отличить одно от другого на глаз невозможно, поэтому и нужен расчёт.
Особенно коварно это выглядит на графике. Линия, соединяющая точки 42 и 45, рисует убедительную восходящую динамику, хотя обе точки могли быть порождены одной и той же неизменной реальностью. Именно поэтому в трекингах так часто появляются красивые тренды, которые потом разворачиваются без всякой причины: люди читают колебания как движение. Первое, что стоит сделать с графиком трекинга, — нанести на него границы погрешности. Обычно после этого половина обсуждаемых изменений визуально исчезает внутри полос, и разговор сразу становится содержательнее.
Погрешность разницы, а не погрешность замера
Ключевая техническая деталь, которую пропускают чаще всего: когда вы сравниваете две волны, неопределённость складывается. У вас не одна погрешность, а две, и обе участвуют в разнице. Приблизительное правило для практики: погрешность разницы примерно в полтора раза больше погрешности одного замера при равных выборках. То есть если в каждой волне погрешность около 5 пунктов, то разница считается заметной начиная примерно с 7 пунктов, а не с 5. Именно эту величину и надо держать в голове, объявляя об изменении.
| Ответов в каждой волне | Погрешность замера | Порог заметной разницы |
|---|---|---|
| 100 | ±10 п.п. | около 14 п.п. |
| 200 | ±7 п.п. | около 10 п.п. |
| 300 | ±6 п.п. | около 8 п.п. |
| 500 | ±4,4 п.п. | около 6 п.п. |
| 1000 | ±3,1 п.п. | около 4,4 п.п. |
| 2000 | ±2,2 п.п. | около 3,1 п.п. |
Как читать эту таблицу
Значения в таблице рассчитаны для доли около половины — это самый неблагоприятный случай, при котором погрешность максимальна. Для долей ближе к краям, скажем 10% или 90%, погрешность заметно меньше, и пороги смягчаются. Цифры округлены и нужны как рабочий ориентир, а не как точный расчёт: если решение стоит дорого, считайте под свои данные. Но даже в таком виде таблица закрывает большинство практических ситуаций, потому что главный вывод из неё один и он неприятный: на типичных для прикладных опросов выборках в двести-триста человек заметить можно только крупные сдвиги.
Отсюда следует важное для планирования правило: определитесь заранее, какое изменение вы хотите уметь замечать, и только потом выбирайте размер выборки. Если для бизнеса значим сдвиг в три пункта, а вы собираете двести ответов, замер бессмысленен — он физически не способен увидеть такое изменение и будет показывать шум. Либо увеличивайте выборку до нескольких тысяч, либо признайте, что этот показатель вы отслеживаете грубо и реагируете только на крупные движения. Оба решения нормальны; плохо только третье — собирать двести ответов и делать вид, что видно всё.
Полезно понимать и обратную сторону: увеличение выборки даёт всё меньше отдачи. Чтобы вдвое сузить погрешность, нужно вчетверо больше ответов — переход с двухсот на восемьсот сокращает порог примерно с десяти пунктов до пяти, а следующее вчетверо, до трёх тысяч двухсот, даст всего два с половиной. Поэтому гнаться за очень мелкой чувствительностью в прикладных задачах обычно нерационально: стоимость сбора растёт быстрее, чем точность. Разумная позиция — выбрать порог, при котором вы действительно готовы что-то предпринять, и не платить за различение сдвигов, на которые всё равно не будете реагировать.
Доли и средние сравниваются по-разному
Показатели из опросов бывают двух видов, и правила для них отличаются. Доли — это проценты выбравших вариант: доля довольных, доля тех, кто рекомендовал бы, доля столкнувшихся с проблемой. Для них работают пороги из таблицы выше. Средние — это средний балл по шкале, средняя оценка, средний индекс. Их погрешность зависит не только от числа ответов, но и от разброса самих оценок: если все ставят похожие баллы, среднее устойчиво даже на небольшой выборке, а если оценки разбросаны по всей шкале, среднее гуляет сильно.
Практическое следствие: для средних нельзя пользоваться готовой табличкой — нужно смотреть на разброс в своих данных. Простой способ прикинуть без формул: разбейте случайным образом ответы одной волны пополам и посчитайте среднее в каждой половине. Расхождение между половинами покажет, насколько показатель вообще устойчив на такой выборке. Если половины одной и той же волны отличаются на полбалла, то и разница в полбалла между двумя волнами ничего не значит.
Ещё одна причина осторожно относиться к средним: они скрывают структуру ответов. Средний балл 7 из 10 может означать, что почти все поставили семёрку, а может — что половина поставила десятки, а половина четвёрки. Это принципиально разные ситуации с разными выводами, но на графике трекинга они выглядят одинаково. Поэтому вместе со средним всегда полезно смотреть распределение или хотя бы долю крайних оценок. Нередко именно там и обнаруживается движение: среднее стоит на месте, а доля недовольных за два квартала выросла вдвое.
Что делать с маленькими подгруппами
Самое частое место, где ломается сравнение, — разрезы. Общая выборка в пятьсот человек выглядит солидно, но стоит разбить её по регионам или тарифам, и в каждой ячейке остаётся по сорок-пятьдесят ответов. Пороги для таких подгрупп огромны: чтобы заметить изменение на выборке в пятьдесят человек, оно должно составлять около двадцати пунктов. При этом именно в разрезах обычно и находят самые захватывающие «инсайты» — просто потому, что маленькие подгруппы скачут сильнее всего и всегда найдётся та, где цифра резко поменялась.
У этого эффекта есть и вторая сторона, о которой стоит помнить отдельно. Чем больше разрезов вы просматриваете, тем выше вероятность наткнуться на случайное различие хотя бы в одном из них — это чистая арифметика, а не невезение. Просмотрев двадцать сегментов, вы почти гарантированно найдёте один «изменившийся», даже если в реальности не изменилось ничего. Защита простая и требует дисциплины: заранее назовите два-три разреза, которые считаете главными, и смотрите сначала на них. Всё найденное в остальных разрезах считайте гипотезой для проверки в следующей волне, а не результатом.
- Указывайте число ответов рядом с каждой цифрой в разрезе — это дисциплинирует читателя.
- Не выносите в выводы подгруппы с базой меньше тридцати наблюдений.
- Помните: чем больше разрезов вы просматриваете, тем выше шанс наткнуться на случайный скачок.
- Заранее решите, какие два-три разреза для вас главные, и смотрите в первую очередь на них.
Практическое правило двух волн
Помимо арифметики есть простое эмпирическое правило, которое хорошо работает в прикладных задачах: доверяйте изменению, которое подтвердилось дважды. Если показатель вырос в одной волне и продолжил расти в следующей, это гораздо надёжнее, чем однократный скачок такой же величины. Случайные колебания не имеют направления и редко повторяются два раза подряд в одну сторону, а настоящее изменение обычно проявляется устойчиво. Это правило не заменяет расчёта, но спасает в ситуации, когда считать некому и некогда.
Работает и симметричное наблюдение: если показатель дважды подряд качнулся в разные стороны примерно на одну величину, почти наверняка вы наблюдаете обычный разброс вокруг неизменного уровня. Такая пила на графике — типичный признак того, что выборка мала для выбранного показателя. Реакция на неё должна быть не содержательной, а методической: либо увеличивать сбор, либо снижать частоту замеров и смотреть на более длинные интервалы, где накопленное изменение успевает превысить порог. Пытаться объяснять каждый зубец событиями в компании — верный способ построить убедительную, но выдуманную историю.
- Проверьте сопоставимость волн: тот же канал, тот же сегмент, та же анкета.
- Сравните число ответов: если оно упало вдвое, изменение показателя может объясняться этим.
- Найдите порог заметной разницы по числу ответов в меньшей из волн.
- Сравните фактическую разницу с порогом; меньше порога — фиксируйте «без изменений».
- Если разница выше порога, проверьте, повторяется ли направление в следующей волне.
Как оформить сравнение в отчёте
Отчёт по двум волнам должен позволять читателю самому оценить надёжность вывода. Минимальный набор: показатель в обеих волнах, число ответов в каждой, разница и явное указание, считаете вы её значимой или нет. Формулировка «показатель вырос с 42% до 45%, разница в пределах погрешности» звучит скучнее, чем «рост на три пункта», но именно она защищает вас от неприятного разговора через квартал, когда показатель вернётся обратно. Осторожные формулировки на этом этапе — не перестраховка, а способ сохранить доверие к данным.
Отдельно стоит договориться о языке. Полезно ввести три уровня: «изменений нет» — разница в пределах порога; «есть сигнал» — разница выше порога, но подтверждения второй волной пока нет; «изменение подтверждено» — выше порога и повторилось. Три ярлыка вместо расплывчатых формулировок убирают большую часть споров на защите результатов, потому что переносят разговор с интерпретации на заранее согласованные правила. В сервисе «До Сути» ответы разбираются автоматически, но решение о том, считать ли движение показателя значимым, всё равно принимается по вашим правилам, а не сервисом.
Ограничения
Все расчёты выше отвечают на единственный вопрос: могло ли наблюдаемое различие возникнуть случайно. Они ничего не говорят о том, почему показатель изменился, и не защищают от систематических искажений. Если между волнами поменялся канал сбора или просела доля ответивших, разница может быть сколь угодно большой и статистически убедительной — и при этом полностью объясняться сменой состава респондентов, а не изменением мнений. Порог значимости — это фильтр против случайности, а не против методической ошибки, и он не заменяет проверку сопоставимости волн.
Второе ограничение практическое: статистическая значимость и практическая важность — разные вещи. На выборке в несколько тысяч человек значимым окажется сдвиг в полтора пункта, но это не значит, что ради него стоит менять продукт. И наоборот: изменение в восемь пунктов на выборке в двести человек формально не проходит порог, но если оно совпало с крупным сбоем и подтверждается жалобами в поддержку, игнорировать его глупо. Расчёт даёт основание для осторожности, а не запрет думать: решение всегда принимается с учётом остального контекста, а не по одному числу.
Типичные ошибки
- Сравнивать цифры напрямую, не учитывая, что у разницы своя погрешность, больше чем у замера.
- Строить график по точкам без полос погрешности и обсуждать нарисованный тренд.
- Делать выводы по подгруппам с базой в двадцать-тридцать ответов.
- Просматривать десятки разрезов и выносить в отчёт единственный, где что-то «изменилось».
- Планировать размер выборки, не решив заранее, какое изменение нужно уметь замечать.
- Считать статистическую значимость доказательством того, что изменение вызвано вашими действиями.
- Путать статистическую значимость с практической важностью показателя для бизнеса.
- Смотреть только на средний балл, не заглядывая в распределение и долю крайних оценок.
С чего начать
Возьмите последние две волны своего замера и проделайте расчёт задним числом: найдите порог по числу ответов, сравните с фактической разницей и посмотрите, сколько из обсуждавшихся тогда изменений его преодолевают. По опыту, большая часть выводов оказывается колебаниями — и это самое полезное открытие, которое можно сделать за полчаса. Дальше зафиксируйте порог в шаблоне отчёта и договоритесь с командой о трёх ярлыках. С этого момента разговоры о результатах станут короче, а решения — устойчивее.
Если хочется совсем простой отправной точки, запомните одно число: на выборке около трёхсот ответов, типичной для прикладного опроса, обсуждать имеет смысл только сдвиги примерно от восьми процентных пунктов. Всё, что меньше, — это разговор о шуме, каким бы убедительным ни выглядел график. Одно это правило, применённое к следующему же отчёту, отсечёт большую часть ложных выводов, и на него не нужно ни формул, ни калькулятора.
Частые вопросы
Сравните её с порогом, который зависит от числа ответов. Ориентиры для долей около половины: при 200 ответах в каждой волне заметна разница примерно от 10 процентных пунктов, при 500 — от 6, при 1000 — от 4,4. Важно, что у разницы своя погрешность, примерно в полтора раза больше, чем у отдельного замера, поэтому нельзя просто сравнивать изменение с погрешностью одной волны. Разница ниже порога — это «без изменений».
Порядка двух тысяч ответов в каждой волне — при таком объёме порог заметной разницы опускается примерно до трёх пунктов. На типичных для прикладных опросов выборках в двести-триста человек изменение в три процента увидеть невозможно в принципе, оно полностью тонет в погрешности. Поэтому размер выборки нужно выбирать от обратного: сначала решить, какой сдвиг важно замечать, и уже под него планировать сбор.
При базе меньше тридцати ответов — нет. Пороги для таких подгрупп огромны: на выборке в пятьдесят человек заметным будет только изменение около двадцати пунктов. При этом именно маленькие ячейки скачут сильнее всего, и всегда найдётся та, где цифра резко поменялась. Показывайте такие подгруппы как справочные числа с пометкой о малой базе или объединяйте их, пока не наберётся достаточно наблюдений.
Нет. Расчёт значимости отвечает только на вопрос, могло ли различие возникнуть случайно. Он не объясняет причину и не защищает от методических искажений: если между волнами сменился канал сбора или упала доля ответивших, разница может быть большой и убедительной, но объясняться другим составом респондентов. Для доказательства причинно-следственной связи нужен эксперимент с контрольной группой, а не сравнение волн.