Методика · 15 августа 2026 г.
Контрольная группа в опросе: как доказать, что показатель изменили вы
Контрольная группа — это часть аудитории, которую вы намеренно оставляете без изменений, чтобы сравнить её с той частью, где изменения внедрили. Без неё любой рост показателя после нововведения остаётся совпадением во времени: рынок, сезон и действия конкурентов меняются сами по себе, и приписать движение своей работе нельзя. С контролем вопрос решается прямо: если в одной группе показатель вырос, а в сопоставимой другой остался прежним, разница между ними и есть эффект вашего действия. Ниже разберём три рабочие схемы, размеры групп, правила деления аудитории и случаи, когда контроль применять не стоит.
Зачем нужна контрольная группа
Обычный трекинг устроен так: вы что-то поменяли, через квартал замерили показатель и увидели рост. Кажется, что связь очевидна. Но в тот же квартал изменилось многое другое: сезон, курс, поведение конкурентов, состав клиентской базы, погода в конце концов. Отделить вклад вашего нововведения от всего этого фона невозможно в принципе — вы наблюдаете один вариант развития событий и не знаете, что было бы, не сделай вы ничего. Контрольная группа как раз и даёт этот недостающий вариант: она показывает, куда показатель двинулся бы сам.
Именно поэтому контроль — не украшение методики, а единственный способ перейти от наблюдения к доказательству. Разница между «после запуска новой поддержки удовлетворённость выросла на шесть пунктов» и «в группе с новой поддержкой удовлетворённость выросла на шесть пунктов, в контрольной осталась на месте» огромна. Первое утверждение живёт ровно до первого скептического вопроса, второе выдерживает разбор. Если по итогам замера предстоит решение о деньгах или людях, стоит потратить силы на вторую формулировку.
Что контроль доказывает, а что нет
Контрольная группа отвечает на один вопрос: было ли ваше вмешательство причиной наблюдаемой разницы. Она не отвечает на вопросы «насколько эффект сохранится», «повторится ли он на другой аудитории» и «окупится ли внедрение». Эффект, измеренный на трёх сотнях клиентов за квартал, может исчезнуть при раскате на всю базу — просто потому, что в пилотной группе оказались более отзывчивые люди или потому, что новизна сама по себе давала прибавку. Это отдельный класс ограничений, и контроль от них не спасает.
Полезно сразу разделять два вопроса, которые в обсуждениях постоянно смешивают. Первый: «сработало ли это вообще» — на него контрольная группа отвечает уверенно. Второй: «сколько мы на этом заработаем» — на него не отвечает никакая опросная схема, потому что между изменением мнения и изменением денег лежит длинная цепочка. Рост удовлетворённости на шесть пунктов не конвертируется в выручку по известному курсу; он лишь означает, что клиентам стало заметно лучше. Требовать от опроса финансовой оценки эффекта бессмысленно, и лучше договориться об этом до запуска эксперимента, а не после.
| Схема | Когда применима | Что доказывает |
|---|---|---|
| Параллельные группы | Изменение можно дать части клиентов | Эффект вмешательства напрямую |
| До и после с контролем | Есть замер до изменения | Эффект с поправкой на общий фон |
| Поэтапный раскат | Внедрение идёт волнами по сегментам | Эффект на каждом этапе |
| Только до и после | Разделить аудиторию невозможно | Ничего; это наблюдение, не доказательство |
| Сравнение с похожим сегментом | Контроль задним числом | Слабое основание, много оговорок |
Как правильно делить аудиторию
Единственный надёжный способ — случайное распределение. Каждый клиент попадает в основную или контрольную группу по жребию, без участия здравого смысла. Соблазн разделить осмысленно — по регионам, по менеджерам, по тарифам — почти всегда губит эксперимент: группы получаются разными не только по вмешательству, но и по десятку других признаков, и разницу в итоге объяснить нечем. Случайность нужна именно затем, чтобы все прочие различия распределились между группами примерно поровну, включая те, о которых вы не подумали.
После деления обязательно проверьте, что группы действительно похожи. Сравните их по ключевым признакам: возрасту, давности отношений, тарифу, частоте покупок, региону. При случайном делении и достаточном размере они совпадут почти точно; заметное расхождение означает, что либо выборка мала, либо деление прошло не так случайно, как задумано. Эту проверку стоит делать до начала вмешательства — потом менять состав групп уже нельзя, а знать об их несопоставимости лучше заранее.
Отдельно стоит подумать о взаимном влиянии групп. В корпоративной среде клиенты общаются между собой, сотрудники сидят в одном кабинете, а пользователи обсуждают новинки в чатах — и контрольная группа быстро узнаёт о том, чего её лишили. Иногда это просто портит замер, иногда вызывает недовольство. Снижают риск двумя способами: делят не отдельных людей, а целые изолированные единицы — офисы, города, команды, — либо выбирают для эксперимента изменения, невидимые со стороны. Если ни то ни другое невозможно, лучше честно заложить взаимное влияние в оговорки к результату.
- Делите случайно, а не по регионам, менеджерам или удобству внедрения.
- Проверьте сопоставимость групп по ключевым признакам до начала эксперимента.
- Фиксируйте состав групп письменно и не меняйте его по ходу.
- Опрашивайте обе группы одинаково: тем же каналом, той же анкетой, в те же дни.
- Не сообщайте участникам, в какой они группе, — знание меняет поведение.
Три рабочие схемы
Первая и самая чистая — параллельные группы: часть клиентов получает изменение, часть нет, обе опрашиваются одновременно. Вторая — до и после с контролем: вы замеряете обе группы до вмешательства и после, а эффектом считаете не разницу «после минус до», а разницу этих разниц между группами. Такая схема надёжнее, потому что снимает исходное различие групп и общий фоновый сдвиг сразу. Третья — поэтапный раскат: изменение внедряется волнами, и те сегменты, до которых очередь ещё не дошла, временно работают контролем.
Поэтапный раскат особенно удобен практически, потому что не требует никого лишать нововведения навсегда — все получат его, просто в разное время. Это снимает главное организационное возражение против контрольных групп и заодно даёт несколько независимых замеров эффекта вместо одного. Минус в том, что этапы разнесены во времени, а значит, между ними успевают вклиниться другие изменения — и чем длиннее раскат, тем слабее сравнение поздних этапов с ранними.
Схема «до и после с контролем» заслуживает отдельного пояснения, потому что именно её чаще всего применяют неправильно. Считать нужно четыре числа: показатель основной группы до и после, показатель контрольной до и после. Эффектом будет разница разниц — насколько сильнее изменилась основная группа по сравнению с контрольной. Типичная ошибка здесь в том, что берут только два числа из четырёх: смотрят на изменение в основной группе и упоминают контрольную лишь как фон. Тогда весь смысл схемы теряется, и вы возвращаетесь к обычному наблюдению до и после.
Какого размера нужны группы
Размер определяется не долей от базы, а тем, какой эффект вы хотите уметь заметить. Логика та же, что при сравнении волн: вы сравниваете два показателя, у каждого своя погрешность, и разница должна её превысить. Для ориентира: чтобы уверенно увидеть эффект в десять процентных пунктов, нужно порядка двухсот ответов в каждой группе; для пяти пунктов — уже около восьмисот. Речь именно об ответах, а не о размере групп: если отвечает каждый четвёртый, группы должны быть вчетверо больше.
Отсюда следует неприятный вывод для небольших компаний: при базе в несколько сотен клиентов корректный эксперимент способен заметить только очень крупные эффекты, порядка пятнадцати-двадцати пунктов. Это не повод отказываться от контроля вовсе, но повод изменить ожидания: такой эксперимент отвечает на вопрос «изменилось ли хоть что-нибудь заметное», а не «на сколько именно». Иногда разумнее не дробить маленькую базу, а провести качественное исследование — десяток разговоров с клиентами скажет о причинах больше, чем эксперимент, лишённый чувствительности.
Чего нельзя делать при делении
Список короткий, но каждый пункт встречается регулярно. Нельзя менять состав групп по ходу эксперимента — например, переводить недовольных клиентов из контрольной группы в основную, чтобы им помочь. Нельзя давать группам разные каналы опроса или разные тексты приглашения. Нельзя останавливать эксперимент в тот момент, когда разница выглядит красиво: остановка по достижении желаемого результата гарантированно завышает эффект. И нельзя сравнивать группы, если контрольная случайно узнала о нововведении и начала им пользоваться.
Про остановку стоит сказать подробнее, потому что ошибка выглядит совершенно безобидно. Разница между группами колеблется в течение всего эксперимента, и рано или поздно она случайно окажется большой. Если в этот момент эксперимент прекратить и объявить результат, вы систематически завышаете эффект — просто потому, что выбрали самый удачный момент из многих. Защита простая: срок окончания фиксируется до старта и не сдвигается ни в какую сторону. Заглядывать в промежуточные данные не запрещено, но принимать решение по ним нельзя.
- Определите заранее, какой эффект считаете значимым, и посчитайте нужный размер групп.
- Разделите аудиторию случайно и проверьте сопоставимость групп по ключевым признакам.
- Зафиксируйте дату окончания эксперимента до его начала и не сдвигайте её.
- Опрашивайте обе группы одинаково и одновременно.
- Сравните разницу разниц: изменение в основной группе минус изменение в контрольной.
Когда контроль неуместен
Контрольная группа означает, что часть людей намеренно не получает улучшение. Иногда это неприемлемо. Если речь идёт об исправлении явного дефекта, о безопасности или о выполнении обещания клиенту, держать контрольную группу нельзя — вы сознательно оставляете людей в худшем положении ради чистоты замера. То же касается внутренних опросов: контрольная группа сотрудников, которых не перевели на удобный график ради эксперимента, создаёт понятное ощущение несправедливости, и цена этого обычно выше ценности полученных данных.
В таких случаях выручает поэтапный раскат: все получают изменение, но в разной очерёдности, и очерёдность определяется жребием. Формально это тот же контроль, этически — обычная последовательность внедрения. Если и раскат невозможен, честнее отказаться от доказательства причинности и прямо признать, что вы наблюдаете совпадение по времени. Такой вывод скромнее, но он по крайней мере не выдаёт наблюдение за эксперимент.
Есть и промежуточный вариант, который часто выручает: сравнение с похожим сегментом задним числом. Вы внедрили изменение для всех, но нашли группу клиентов, до которых оно по техническим причинам не дошло, и сравниваете с ней. Это заметно слабее настоящего контроля, потому что группы не случайны и различаются неизвестно чем ещё, — но всё же лучше, чем ничего. Главное при таком подходе — не выдавать его за эксперимент и перечислить в отчёте, чем именно сравниваемые группы могут отличаться помимо вмешательства.
Ограничения
Контрольная группа доказывает эффект в конкретных условиях конкретного периода на конкретной аудитории. Перенос результата за эти границы всегда остаётся допущением. Отдельная и часто недооценённая проблема — эффект новизны: любое изменение поначалу даёт прибавку просто потому, что оно новое, и через несколько месяцев эффект тает. Поэтому для решений о масштабном внедрении полезно замерить группы не один раз, а дважды с разрывом в квартал, и посмотреть, сохранилась ли разница. В сервисе «До Сути» опрос можно повторить с той же анкетой на нужном сегменте, но само деление на группы и дисциплина эксперимента остаются вашей задачей — инструмент опроса здесь ничего не решает.
Типичные ошибки
- Делить аудиторию осмысленно — по регионам или менеджерам — вместо случайного распределения.
- Не проверять сопоставимость групп до начала эксперимента.
- Останавливать эксперимент в момент, когда разница выглядит убедительно.
- Переводить клиентов между группами по ходу дела из лучших побуждений.
- Опрашивать группы разными каналами или в разное время.
- Запускать эксперимент, не посчитав, способен ли он вообще заметить нужный эффект.
- Считать однократно измеренный эффект устойчивым, не проверив его через квартал.
С чего начать
Возьмите ближайшее запланированное изменение, которое затрагивает не всех клиентов сразу, и превратите его в эксперимент почти без дополнительных усилий: определите жребием, кто получит его первым, замерьте показатель в обеих частях до и после, сравните разницу разниц. Это не требует ни особых инструментов, ни отдельного бюджета — только решения принять очерёдность случайно, а не по удобству. Один такой эксперимент обычно убеждает команду сильнее любых рассуждений о методологии: впервые становится видно, какая часть привычной динамики действительно ваша заслуга.
Будьте готовы к тому, что первый честный эксперимент чаще всего разочаровывает. Изменение, в которое все верили, оказывается неотличимым от контроля, а привычный квартальный рост обнаруживается и в группе, где ничего не делали. Это нормальный и, пожалуй, самый ценный результат: он экономит следующие месяцы работы, которые ушли бы на масштабирование того, что не работает. Смысл контрольной группы не в том, чтобы подтверждать удачные решения, а в том, чтобы вовремя отличать их от совпадений — и второе на практике встречается чаще.
Частые вопросы
Потому что между замерами меняется не только ваше нововведение: сезон, рынок, конкуренты, состав базы. Сравнение «до и после» не позволяет отделить ваш вклад от этого фона — вы наблюдаете один вариант развития событий и не знаете, что было бы без вмешательства. Контрольная группа как раз показывает этот второй вариант. Эффектом считается разница разниц: изменение в основной группе минус изменение в контрольной.
Только случайным жребием, без осмысленного отбора. Деление по регионам, менеджерам или тарифам создаёт группы, которые отличаются не только вмешательством, но и десятком других признаков, и разницу потом объяснить нечем. После деления проверьте сопоставимость групп по ключевым признакам — возрасту, тарифу, давности отношений. При достаточном размере они совпадут почти точно, заметное расхождение означает слишком маленькую выборку.
Размер определяется тем, какой эффект вы хотите уметь заметить, а не долей от базы. Ориентир: чтобы уверенно увидеть разницу в десять процентных пунктов, нужно около двухсот ответов в каждой группе, для пяти пунктов — примерно восемьсот. Считать нужно именно ответы: если отвечает каждый четвёртый, сами группы должны быть вчетверо больше. Расчёт делается до запуска, иначе эксперимент рискует не заметить эффект в принципе.
Не всегда. Если речь об исправлении дефекта, о безопасности или о выполнении обещания клиенту, контрольная группа неприемлема. То же касается внутренних опросов, где неравенство условий создаёт понятное ощущение несправедливости. Выход — поэтапный раскат: изменение получают все, но очерёдность определяется жребием, и те, до кого очередь ещё не дошла, временно выполняют роль контроля. Формально это тот же эксперимент.