«До Сути»← Все статьи

Методика · 15 августа 2026 г.

Контрольная группа в опросе: как доказать, что показатель изменили вы

Контрольная группа — это часть аудитории, которую вы намеренно оставляете без изменений, чтобы сравнить её с той частью, где изменения внедрили. Без неё любой рост показателя после нововведения остаётся совпадением во времени: рынок, сезон и действия конкурентов меняются сами по себе, и приписать движение своей работе нельзя. С контролем вопрос решается прямо: если в одной группе показатель вырос, а в сопоставимой другой остался прежним, разница между ними и есть эффект вашего действия. Ниже разберём три рабочие схемы, размеры групп, правила деления аудитории и случаи, когда контроль применять не стоит.

Зачем нужна контрольная группа

Обычный трекинг устроен так: вы что-то поменяли, через квартал замерили показатель и увидели рост. Кажется, что связь очевидна. Но в тот же квартал изменилось многое другое: сезон, курс, поведение конкурентов, состав клиентской базы, погода в конце концов. Отделить вклад вашего нововведения от всего этого фона невозможно в принципе — вы наблюдаете один вариант развития событий и не знаете, что было бы, не сделай вы ничего. Контрольная группа как раз и даёт этот недостающий вариант: она показывает, куда показатель двинулся бы сам.

Именно поэтому контроль — не украшение методики, а единственный способ перейти от наблюдения к доказательству. Разница между «после запуска новой поддержки удовлетворённость выросла на шесть пунктов» и «в группе с новой поддержкой удовлетворённость выросла на шесть пунктов, в контрольной осталась на месте» огромна. Первое утверждение живёт ровно до первого скептического вопроса, второе выдерживает разбор. Если по итогам замера предстоит решение о деньгах или людях, стоит потратить силы на вторую формулировку.

Что контроль доказывает, а что нет

Контрольная группа отвечает на один вопрос: было ли ваше вмешательство причиной наблюдаемой разницы. Она не отвечает на вопросы «насколько эффект сохранится», «повторится ли он на другой аудитории» и «окупится ли внедрение». Эффект, измеренный на трёх сотнях клиентов за квартал, может исчезнуть при раскате на всю базу — просто потому, что в пилотной группе оказались более отзывчивые люди или потому, что новизна сама по себе давала прибавку. Это отдельный класс ограничений, и контроль от них не спасает.

Полезно сразу разделять два вопроса, которые в обсуждениях постоянно смешивают. Первый: «сработало ли это вообще» — на него контрольная группа отвечает уверенно. Второй: «сколько мы на этом заработаем» — на него не отвечает никакая опросная схема, потому что между изменением мнения и изменением денег лежит длинная цепочка. Рост удовлетворённости на шесть пунктов не конвертируется в выручку по известному курсу; он лишь означает, что клиентам стало заметно лучше. Требовать от опроса финансовой оценки эффекта бессмысленно, и лучше договориться об этом до запуска эксперимента, а не после.

СхемаКогда применимаЧто доказывает
Параллельные группыИзменение можно дать части клиентовЭффект вмешательства напрямую
До и после с контролемЕсть замер до измененияЭффект с поправкой на общий фон
Поэтапный раскатВнедрение идёт волнами по сегментамЭффект на каждом этапе
Только до и послеРазделить аудиторию невозможноНичего; это наблюдение, не доказательство
Сравнение с похожим сегментомКонтроль задним числомСлабое основание, много оговорок
Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Как правильно делить аудиторию

Единственный надёжный способ — случайное распределение. Каждый клиент попадает в основную или контрольную группу по жребию, без участия здравого смысла. Соблазн разделить осмысленно — по регионам, по менеджерам, по тарифам — почти всегда губит эксперимент: группы получаются разными не только по вмешательству, но и по десятку других признаков, и разницу в итоге объяснить нечем. Случайность нужна именно затем, чтобы все прочие различия распределились между группами примерно поровну, включая те, о которых вы не подумали.

После деления обязательно проверьте, что группы действительно похожи. Сравните их по ключевым признакам: возрасту, давности отношений, тарифу, частоте покупок, региону. При случайном делении и достаточном размере они совпадут почти точно; заметное расхождение означает, что либо выборка мала, либо деление прошло не так случайно, как задумано. Эту проверку стоит делать до начала вмешательства — потом менять состав групп уже нельзя, а знать об их несопоставимости лучше заранее.

Отдельно стоит подумать о взаимном влиянии групп. В корпоративной среде клиенты общаются между собой, сотрудники сидят в одном кабинете, а пользователи обсуждают новинки в чатах — и контрольная группа быстро узнаёт о том, чего её лишили. Иногда это просто портит замер, иногда вызывает недовольство. Снижают риск двумя способами: делят не отдельных людей, а целые изолированные единицы — офисы, города, команды, — либо выбирают для эксперимента изменения, невидимые со стороны. Если ни то ни другое невозможно, лучше честно заложить взаимное влияние в оговорки к результату.

Три рабочие схемы

Первая и самая чистая — параллельные группы: часть клиентов получает изменение, часть нет, обе опрашиваются одновременно. Вторая — до и после с контролем: вы замеряете обе группы до вмешательства и после, а эффектом считаете не разницу «после минус до», а разницу этих разниц между группами. Такая схема надёжнее, потому что снимает исходное различие групп и общий фоновый сдвиг сразу. Третья — поэтапный раскат: изменение внедряется волнами, и те сегменты, до которых очередь ещё не дошла, временно работают контролем.

Поэтапный раскат особенно удобен практически, потому что не требует никого лишать нововведения навсегда — все получат его, просто в разное время. Это снимает главное организационное возражение против контрольных групп и заодно даёт несколько независимых замеров эффекта вместо одного. Минус в том, что этапы разнесены во времени, а значит, между ними успевают вклиниться другие изменения — и чем длиннее раскат, тем слабее сравнение поздних этапов с ранними.

Схема «до и после с контролем» заслуживает отдельного пояснения, потому что именно её чаще всего применяют неправильно. Считать нужно четыре числа: показатель основной группы до и после, показатель контрольной до и после. Эффектом будет разница разниц — насколько сильнее изменилась основная группа по сравнению с контрольной. Типичная ошибка здесь в том, что берут только два числа из четырёх: смотрят на изменение в основной группе и упоминают контрольную лишь как фон. Тогда весь смысл схемы теряется, и вы возвращаетесь к обычному наблюдению до и после.

Какого размера нужны группы

Размер определяется не долей от базы, а тем, какой эффект вы хотите уметь заметить. Логика та же, что при сравнении волн: вы сравниваете два показателя, у каждого своя погрешность, и разница должна её превысить. Для ориентира: чтобы уверенно увидеть эффект в десять процентных пунктов, нужно порядка двухсот ответов в каждой группе; для пяти пунктов — уже около восьмисот. Речь именно об ответах, а не о размере групп: если отвечает каждый четвёртый, группы должны быть вчетверо больше.

Отсюда следует неприятный вывод для небольших компаний: при базе в несколько сотен клиентов корректный эксперимент способен заметить только очень крупные эффекты, порядка пятнадцати-двадцати пунктов. Это не повод отказываться от контроля вовсе, но повод изменить ожидания: такой эксперимент отвечает на вопрос «изменилось ли хоть что-нибудь заметное», а не «на сколько именно». Иногда разумнее не дробить маленькую базу, а провести качественное исследование — десяток разговоров с клиентами скажет о причинах больше, чем эксперимент, лишённый чувствительности.

Считайте нужный размер до запуска, а не после. Эксперимент, в котором эффект физически невозможно заметить, — это потраченный квартал и ложный вывод «изменений нет», который потом годами мешает вернуться к хорошей идее.

Чего нельзя делать при делении

Список короткий, но каждый пункт встречается регулярно. Нельзя менять состав групп по ходу эксперимента — например, переводить недовольных клиентов из контрольной группы в основную, чтобы им помочь. Нельзя давать группам разные каналы опроса или разные тексты приглашения. Нельзя останавливать эксперимент в тот момент, когда разница выглядит красиво: остановка по достижении желаемого результата гарантированно завышает эффект. И нельзя сравнивать группы, если контрольная случайно узнала о нововведении и начала им пользоваться.

Про остановку стоит сказать подробнее, потому что ошибка выглядит совершенно безобидно. Разница между группами колеблется в течение всего эксперимента, и рано или поздно она случайно окажется большой. Если в этот момент эксперимент прекратить и объявить результат, вы систематически завышаете эффект — просто потому, что выбрали самый удачный момент из многих. Защита простая: срок окончания фиксируется до старта и не сдвигается ни в какую сторону. Заглядывать в промежуточные данные не запрещено, но принимать решение по ним нельзя.

  1. Определите заранее, какой эффект считаете значимым, и посчитайте нужный размер групп.
  2. Разделите аудиторию случайно и проверьте сопоставимость групп по ключевым признакам.
  3. Зафиксируйте дату окончания эксперимента до его начала и не сдвигайте её.
  4. Опрашивайте обе группы одинаково и одновременно.
  5. Сравните разницу разниц: изменение в основной группе минус изменение в контрольной.

Когда контроль неуместен

Контрольная группа означает, что часть людей намеренно не получает улучшение. Иногда это неприемлемо. Если речь идёт об исправлении явного дефекта, о безопасности или о выполнении обещания клиенту, держать контрольную группу нельзя — вы сознательно оставляете людей в худшем положении ради чистоты замера. То же касается внутренних опросов: контрольная группа сотрудников, которых не перевели на удобный график ради эксперимента, создаёт понятное ощущение несправедливости, и цена этого обычно выше ценности полученных данных.

В таких случаях выручает поэтапный раскат: все получают изменение, но в разной очерёдности, и очерёдность определяется жребием. Формально это тот же контроль, этически — обычная последовательность внедрения. Если и раскат невозможен, честнее отказаться от доказательства причинности и прямо признать, что вы наблюдаете совпадение по времени. Такой вывод скромнее, но он по крайней мере не выдаёт наблюдение за эксперимент.

Есть и промежуточный вариант, который часто выручает: сравнение с похожим сегментом задним числом. Вы внедрили изменение для всех, но нашли группу клиентов, до которых оно по техническим причинам не дошло, и сравниваете с ней. Это заметно слабее настоящего контроля, потому что группы не случайны и различаются неизвестно чем ещё, — но всё же лучше, чем ничего. Главное при таком подходе — не выдавать его за эксперимент и перечислить в отчёте, чем именно сравниваемые группы могут отличаться помимо вмешательства.

Ограничения

Контрольная группа доказывает эффект в конкретных условиях конкретного периода на конкретной аудитории. Перенос результата за эти границы всегда остаётся допущением. Отдельная и часто недооценённая проблема — эффект новизны: любое изменение поначалу даёт прибавку просто потому, что оно новое, и через несколько месяцев эффект тает. Поэтому для решений о масштабном внедрении полезно замерить группы не один раз, а дважды с разрывом в квартал, и посмотреть, сохранилась ли разница. В сервисе «До Сути» опрос можно повторить с той же анкетой на нужном сегменте, но само деление на группы и дисциплина эксперимента остаются вашей задачей — инструмент опроса здесь ничего не решает.

Типичные ошибки

С чего начать

Возьмите ближайшее запланированное изменение, которое затрагивает не всех клиентов сразу, и превратите его в эксперимент почти без дополнительных усилий: определите жребием, кто получит его первым, замерьте показатель в обеих частях до и после, сравните разницу разниц. Это не требует ни особых инструментов, ни отдельного бюджета — только решения принять очерёдность случайно, а не по удобству. Один такой эксперимент обычно убеждает команду сильнее любых рассуждений о методологии: впервые становится видно, какая часть привычной динамики действительно ваша заслуга.

Будьте готовы к тому, что первый честный эксперимент чаще всего разочаровывает. Изменение, в которое все верили, оказывается неотличимым от контроля, а привычный квартальный рост обнаруживается и в группе, где ничего не делали. Это нормальный и, пожалуй, самый ценный результат: он экономит следующие месяцы работы, которые ушли бы на масштабирование того, что не работает. Смысл контрольной группы не в том, чтобы подтверждать удачные решения, а в том, чтобы вовремя отличать их от совпадений — и второе на практике встречается чаще.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Зачем нужна контрольная группа, если есть замеры до и после?

Потому что между замерами меняется не только ваше нововведение: сезон, рынок, конкуренты, состав базы. Сравнение «до и после» не позволяет отделить ваш вклад от этого фона — вы наблюдаете один вариант развития событий и не знаете, что было бы без вмешательства. Контрольная группа как раз показывает этот второй вариант. Эффектом считается разница разниц: изменение в основной группе минус изменение в контрольной.

Как правильно разделить клиентов на группы?

Только случайным жребием, без осмысленного отбора. Деление по регионам, менеджерам или тарифам создаёт группы, которые отличаются не только вмешательством, но и десятком других признаков, и разницу потом объяснить нечем. После деления проверьте сопоставимость групп по ключевым признакам — возрасту, тарифу, давности отношений. При достаточном размере они совпадут почти точно, заметное расхождение означает слишком маленькую выборку.

Сколько человек должно быть в контрольной группе?

Размер определяется тем, какой эффект вы хотите уметь заметить, а не долей от базы. Ориентир: чтобы уверенно увидеть разницу в десять процентных пунктов, нужно около двухсот ответов в каждой группе, для пяти пунктов — примерно восемьсот. Считать нужно именно ответы: если отвечает каждый четвёртый, сами группы должны быть вчетверо больше. Расчёт делается до запуска, иначе эксперимент рискует не заметить эффект в принципе.

Этично ли лишать часть клиентов улучшения ради эксперимента?

Не всегда. Если речь об исправлении дефекта, о безопасности или о выполнении обещания клиенту, контрольная группа неприемлема. То же касается внутренних опросов, где неравенство условий создаёт понятное ощущение несправедливости. Выход — поэтапный раскат: изменение получают все, но очерёдность определяется жребием, и те, до кого очередь ещё не дошла, временно выполняют роль контроля. Формально это тот же эксперимент.

Читайте также