«До Сути»← Все статьи

Методика · 16 сентября 2026 г.

Случайная выборка: как сформировать для опроса без перекоса

Случайная выборка — это отбор респондентов из полного списка аудитории, при котором у каждого элемента одинаковый шанс попасть в опрос, а сам отбор выполняет генератор случайных чисел, а не человек. Формируется она в три шага: получить полный и актуальный список, пронумеровать элементы, отобрать нужное количество номеров случайным образом без участия человеческого выбора на любом этапе. Метод требует списка целиком — без него случайный отбор физически невозможен, как бы честно ни хотелось его провести. Ниже — как выполнить отбор технически, чем системная выборка отличается от простой случайной и что на практике незаметно превращает «случайную» выборку в смещённую.

Что такое случайная выборка и когда она вообще возможна

Случайная выборка возможна только при одном условии: на руках есть полный список всей генеральной совокупности — базы клиентов, сотрудников, подписчиков. Без такого списка термин «случайная выборка» употребляют некорректно: нельзя случайно отобрать из того, чего целиком нет. Опрос, собранный по ссылке в соцсети или через баннер на сайте, не становится случайным оттого, что ссылку увидели «случайные» посетители, — это удобная выборка, и её смешение с формально случайной — одна из самых частых методологических ошибок в отчётах.

Второе условие — актуальность списка. Если база клиентов не обновлялась год, в ней окажутся ушедшие клиенты, задвоенные записи и неактуальные контакты, и случайный отбор из такого списка честно перенесёт весь этот мусор в выборку. Перед формированием выборки список стоит выгрузить заново, убрать дубликаты и явно нерабочие контакты — иначе случайность отбора не спасёт от смещения на входе.

Как формируется случайная выборка: пошагово

Технически процедура простая и не требует специального софта или платных инструментов. Список выгружается в таблицу, каждой строке присваивается порядковый номер, затем с помощью функции случайных чисел — в любой таблице есть встроенный генератор — каждой строке присваивается случайное значение, после чего список сортируется по этому значению, и сверху берут нужное число строк. Ключевое правило — не подглядывать в список при отборе и не редактировать порядок вручную после сортировки, каким бы удобным ни казался конкретный человек в верхней части списка.

  1. Выгрузите полный и актуальный список генеральной совокупности одной таблицей.
  2. Удалите дубликаты и заведомо нерабочие контакты до отбора, а не после.
  3. Присвойте каждой строке порядковый номер.
  4. Сгенерируйте для каждой строки случайное число встроенной функцией таблицы.
  5. Отсортируйте список по случайному числу и возьмите нужное количество строк сверху.
  6. Зафиксируйте сид генератора или сохраните исходный файл — отбор должен быть воспроизводим при проверке.
Инструмент отбораКак работаетПлюсМинус
Google Таблицы / Excel, RAND()Случайное число на строку, сортировкаДоступен всем, не требует навыков программированияЛегко случайно испортить сортировкой не всех столбцов
Python / R, random.sampleВыборка из списка функцией языкаВоспроизводимо через фиксированный сид, подходит для больших базНужен минимальный навык программирования
Встроенный рандомайзер CRM или ESPСегмент аудитории делится на случайную долюНе нужно выгружать список вручнуюАлгоритм закрыт, сложно проверить и воспроизвести
Жребий на малой аудиторииБумажки, номерки, физический розыгрышПрозрачно и понятно всем участникамРаботает только на выборках до нескольких сотен
Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Системная выборка как практичный вариант

Системная выборка — упрощённый практический родственник случайной: список не сортируют случайно, а берут каждый n-й элемент подряд, начиная со случайно выбранной точки старта. Если нужно отобрать пятьсот человек из базы в десять тысяч, шаг равен двадцати: случайно выбирают стартовую позицию от одного до двадцати, а дальше идут через двадцать элементов. Метод быстрее и проще объясняется коллегам, а по качеству почти не уступает простому случайному отбору — при одном условии: список не должен быть заранее упорядочен по признаку, который коррелирует с шагом выборки.

Именно это условие чаще всего нарушают незаметно. Если список клиентов отсортирован по дате регистрации, а шаг выборки совпадает с сезонным циклом набора клиентов, системная выборка начнёт систематически захватывать один и тот же тип клиента — например, только тех, кто пришёл в начале квартала по одной и той же рекламной кампании. Перед системным отбором стоит либо перемешать список случайно один раз, либо убедиться, что порядок в исходном списке не связан ни с одним из вопросов будущего опроса.

Отбор без возвращения и с возвращением

В опросах почти всегда используют отбор без возвращения: один человек попадает в выборку не более одного раза, что логично — нет смысла присылать анкету дважды. Формулы для расчёта погрешности при этом чуть отличаются от классических формул с возвращением, но на практике для выборок из больших списков разница пренебрежимо мала и ей обычно пренебрегают. Отбор с возвращением, где один и тот же элемент теоретически может попасться повторно, применяют почти исключительно в статистических симуляциях, а не в реальном сборе анкет.

Практическое следствие иное: при отборе без возвращения важно исключить из списка тех, кто уже участвовал в недавнем опросе на ту же тему, если задача — не перегружать одних и тех же людей рассылками. Это отдельный слой фильтрации поверх случайности, и его стоит продумать заранее: список для отбора должен формироваться уже без недавних респондентов, а не так, что их потом вручную вычёркивают из готовой случайной выборки — такое вычёркивание само по себе нарушает случайность.

Проверка качества отбора после генерации

Даже технически правильный случайный отбор стоит проверить перед рассылкой, а не доверять процедуре вслепую. Простой способ — сравнить распределение отобранной выборки с распределением всего списка по известным признакам: доле по региону, типу клиента, дате регистрации. Если эти доли близки, отбор прошёл штатно. Если выборка заметно перекошена — например, восемьдесят процентов попавших оказались из одного города при равномерном распределении в списке, — это повод перепроверить процедуру: возможно, список был отсортирован до генерации случайных чисел, и сортировка не была полностью снята.

Полезная привычка — прогонять такую сверку по умолчанию, а не только при подозрениях. Она занимает буквально пять минут и один раз уже спасала проекты, где после рассылки выяснялось, что случайный отбор случайно совпал с фильтром, оставшимся от предыдущей выгрузки, и в выборку попали только клиенты одного тарифа. Отдельно стоит зафиксировать в проектной документации дату и параметры отбора: если через месяц понадобится повторить выборку для контрольной волны, важно повторить именно ту же процедуру, а не изобретать новую на глазок каждый раз заново.

Что портит случайность на практике

Формально честный случайный отбор регулярно ломается на этапе, который к статистике отношения не имеет. Частая ситуация — не весь список сохранился в системе: часть контактов без email или телефона тихо выпала при выгрузке, и случайный отбор из «полного» списка на самом деле идёт по списку тех, у кого есть контактные данные, а это уже не то же самое. Другая ситуация — ручная правка «для здравого смысла»: аналитик видит в выборке крупного клиента и заменяет его на более типичного, разрушая случайность одним щелчком, каким бы разумным ни казался мотив.

Самая незаметная порча случайности — округление и повторный запуск генератора «чтобы список выглядел получше». Если результат отбора не понравился и генератор перезапускают до получения удобного списка, это уже не случайный отбор, а подбор под ожидания. Зафиксируйте первый результат и работайте с ним, либо честно признайте, что метод стал невероятностным.

Похожая проблема возникает при объединении нескольких источников в один список перед отбором. Если базу клиентов дополняют списком из отдельной таблицы лояльности, а совпадающие записи не дедуплицируют, часть людей получает удвоенный шанс попасть в выборку просто потому, что присутствует в списке дважды под слегка разными данными. Формально отбор остаётся случайным, но фактическая вероятность отбора для таких людей выше, чем для остальных, и итоговая выборка оказывается смещена в сторону тех, кто чаще встречается в нескольких источниках сразу — обычно это самые активные клиенты.

Случайная выборка и отклик: почему итог всё равно не идеален

Даже безупречно случайный отбор списка не гарантирует случайную выборку ответов. Из тысячи случайно приглашённых откликается обычно двести-триста, и эти двести-триста уже не случайны — они самоотобраны по готовности открыть письмо и потратить время. Это не делает случайный отбор бессмысленным: он всё ещё лучше любой альтернативы, потому что не добавляет смещения на этапе приглашения, — но итоговая точность ниже той, что дала бы формула для полного отклика, и это стоит явно отмечать в отчёте.

Частично разрыв между приглашёнными и ответившими можно оценить, сравнив известные характеристики двух групп — например, долю по типу клиента или региону, если эти данные есть в исходном списке. Если распределение ответивших заметно отличается от распределения приглашённых по известному признаку, есть основания подозревать смещение и по неизвестным признакам тоже, и тогда стоит взвесить итоговую выборку, приводя её к пропорциям исходного списка.

На отклик заметно влияет и то, как оформлено само приглашение: тема письма, время отправки, число последующих напоминаний. Два одинаково случайно отобранных списка могут дать разный отклик просто из-за разной обёртки, и это стоит учитывать при сравнении волн опроса между собой — если между волнами поменялся не только состав аудитории, но и формат приглашения, разница в результатах может объясняться этим, а не изменением мнений.

Когда случайная выборка избыточна

Строгий случайный отбор не всегда оправдан. Для быстрого пилотного опроса, где задача — набросать гипотезы перед основным исследованием, удобная выборка из активных пользователей продукта работает быстрее и почти так же полезна, если результат не выдают за окончательную оценку по всей аудитории. Для внутренних командных опросов на десять-пятнадцать человек, где список и так полностью известен и опрашивают всех, вопрос выборки вообще не стоит — это сплошное обследование, а не выборочное. Случайный отбор нужен именно тогда, когда опросить всю совокупность дорого или невозможно, а результат должен быть формально обоснован.

Есть и промежуточный случай, который на практике встречается заметно чаще, чем кажется на первый взгляд: аудитория небольшая, тысяча-полторы человек, и опросить всех технически возможно, но отклик всё равно окажется частичным. Здесь спор о случайном отборе подмножества теряет смысл — разумнее разослать приглашение сразу всем, а вопрос репрезентативности перенести на этап анализа отклика, сравнивая ответивших с полным списком по доступным признакам. Выборочный отбор в такой ситуации только добавляет лишний шаг и не решает проблему смещения отклика, которая всё равно останется главным источником неопределённости.

Ограничения

Случайная выборка не защищает от смещения отклика, не работает без полного списка и требует актуальной базы данных, которая на практике часто хуже, чем кажется её владельцам. Метод также предполагает наличие рабочего контакта с каждым отобранным — если у трети списка нет действующего email или телефона, случайность отбора не компенсирует эту дыру, она просто переносится в итоговую выборку как ещё одно смещение. И наконец, случайный отбор ничего не говорит о качестве самих ответов: недобросовестный или невнимательный респондент, попавший в выборку случайно, всё равно портит данные.

Ещё одно практическое ограничение — время. Случайный отбор из готового списка занимает минуты, но получение самого списка в актуальном виде часто требует запроса к другому отделу, согласования доступа к персональным данным и выгрузки из системы, которая для этого не предназначена. На проектах с жёстким дедлайном это оказывается более узким местом, чем сама процедура выборки, и закладывать время на получение списка стоит отдельной строкой в плане, а не считать его формальностью в один клик.

Типичные ошибки

С чего начать

Проверьте для своей задачи одну вещь: существует ли действительно полный список аудитории или это только часть, до которой есть контактный доступ. Если список неполный, честно решите — работать с ним как с доступной частью совокупности и не переносить выводы на тех, кого в нём нет, либо сначала дособрать недостающие контакты. Дальше отбор технически занимает пять минут в любой таблице, и куда важнее не сама процедура, а дисциплина не трогать результат после того, как генератор случайных чисел отработал.

После отбора список приглашённых переносится в рассылку. В сервисе «До Сути» ссылку на опрос можно разослать точечно по готовому списку контактов, но саму случайность отбора — кого включить в этот список — обеспечивает не инструмент рассылки, а процедура формирования выборки, описанная выше.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Можно ли считать выборку случайной, если люди отвечали по ссылке из соцсети?

Нет. Случайная выборка требует, чтобы отбор шёл из полного списка генеральной совокупности через генератор случайных чисел, и у каждого элемента списка был известный шанс попасть в опрос. Ссылка в соцсети доступна не всей аудитории, а только тем, кто увидел пост, и дальше отвечают не случайно отобранные, а сами откликнувшиеся. Это удобная выборка — она может быть полезна для пилота или сбора гипотез, но формальные доверительные интервалы для неё не считаются, и выдавать её за случайную методологически неверно.

Чем системная выборка отличается от простой случайной?

В простой случайной выборке каждому элементу списка присваивают случайное число и берут нужное количество после сортировки. В системной выборке случайно выбирают только стартовую точку, а дальше берут каждый n-й элемент подряд с фиксированным шагом. Системная выборка проще в исполнении и почти так же надёжна, но ломается, если список заранее отсортирован по признаку, который совпадает по периодичности с шагом отбора, — тогда выборка систематически захватывает один и тот же тип элементов.

Что делать, если список аудитории неполный или устарел?

Строго говоря, случайная выборка возможна только из того списка, который есть, — и результат тогда распространяется именно на эту доступную часть совокупности, а не на всех, включая тех, кого в списке нет. Перед отбором список стоит выгрузить заново, удалить дубликаты и явно нерабочие контакты, чтобы хотя бы минимизировать шум внутри доступной части. Если недостающая часть велика и важна для выводов, честнее сначала дособрать контакты, чем делать вид, что случайный отбор компенсирует дыры в базе.

Почему случайно отобранная выборка всё равно даёт смещённый результат?

Потому что случайность отбора не гарантирует полный отклик. Из тысячи случайно приглашённых людей отвечают обычно двести-триста, и эти ответившие уже не случайны — они самоотобраны по готовности потратить время на опрос. Метод остаётся лучшим доступным вариантом, потому что не добавляет смещения на этапе приглашения, но итоговая точность ниже расчётной по формуле для полного отклика. Оценить масштаб разрыва можно, сравнив известные характеристики приглашённых и ответивших.

Читайте также