«До Сути»← Все статьи

Методика · 24 сентября 2026 г.

Сколько открытых ответов нужно, чтобы сделать надёжный вывод

Сколько открытых ответов нужно для надёжного анализа, зависит от задачи: чтобы просто перечислить, какие темы вообще есть в массиве, обычно достаточно тридцати-пятидесяти ответов — дальше новые темы почти перестают появляться, это называется насыщением. Но если задача — точно посчитать долю каждой темы и сравнить сегменты между собой, тридцати ответов категорически мало, а нужный объём считается уже не по ощущению насыщения, а по обычной логике доверительного интервала, как для любой доли в выборке. Путаница между этими двумя вопросами — главная причина, почему одни исследователи останавливаются на пятнадцати ответах, а другие требуют тысячу там, где хватило бы полусотни. Ниже разберём оба случая отдельно и дадим практические пороги для типичных задач.

Два разных вопроса под одной формулировкой

«Сколько ответов на самом деле нужно» — формулировка, которая скрывает под собой два совершенно разных вопроса, и путать их — источник почти всех споров про объём выборки для открытых вопросов. Первый: сколько нужно, чтобы узнать, какие темы вообще встречаются в ответах. Это задача на полноту перечня, и здесь работает логика насыщения — читаете ответы один за другим, пока новые не перестают появляться. Второй вопрос: сколько нужно, чтобы точно сказать, что тема A встречается у стольких-то процентов респондентов. Это уже задача на точность оценки доли, и здесь насыщение вообще ни при чём — тут работает обычная статистика выборок.

Такое смешение двух по сути разных вопросов на практике регулярно даёт две симметричные и одинаково вредные ошибки, которые встречаются почти в каждой команде, впервые столкнувшейся с анализом открытых ответов. Первая — остановиться на пятнадцати интервью или коротких ответах и после этого уверенно заявить, что «тридцать восемь процентов клиентов жалуются на цену»: перечень тем такая выборка, возможно, и покрывает полностью, но проценты по ней считать некорректно. Вторая ошибка — требовать тысячу ответов там, где нужен был просто список тем для брифа дизайнеру: полнота перечня достигается на порядок меньшим объёмом, и лишние девятьсот ответов не добавляют новых тем, а просто стоят времени.

Насыщение: сколько нужно, чтобы узнать темы

Насыщение — это тот самый момент, когда очередные десять внимательно прочитанных ответов не добавляют ни одной новой темы к уже собранному списку. На практике это происходит быстрее, чем кажется интуитивно: для относительно однородной аудитории и конкретного вопроса первые пятнадцать-двадцать ответов обычно дают три четверти всех тем, которые вообще встретятся, а полное насыщение по большинству прикладных задач наступает в районе тридцати-пятидесяти ответов. Дальнейшее чтение полезно не для новых тем, а для уточнения относительной частоты уже найденных — но это уже вопрос точности, а не полноты.

ЗадачаЛогика оценкиПрактический порог
Список тем для брифа командеНасыщение30–50 ответов
Черновой кодбук перед массовой разметкойНасыщение50–80 ответов
Точная доля темы по всей выборкеТочность оценки доли200+ ответов, зависит от требуемой погрешности
Сравнение доли темы между двумя сегментамиТочность оценки доли100–150 на каждый сегмент как ориентир
Генерация гипотез для будущего количественного опросаНасыщение20–30 ответов

Скорость насыщения сильно зависит от однородности аудитории и узости вопроса. Узкий вопрос про конкретную функцию продукта насыщается быстро — вариантов ответа объективно немного. Широкий вопрос вроде «что вы думаете о компании в целом» может не насытиться и на сотне ответов, потому что тем действительно много и они слабо повторяются. Если после пятидесяти прочитанных ответов список тем продолжает расти почти линейно, это не повод механически читать дальше — это сигнал, что вопрос сформулирован слишком широко и его стоит сузить для следующей волны.

Как проверить насыщение на практике

Проверка насыщения не требует специального инструмента или отдельного софта — для неё вполне достаточно вести самый простой журнал прямо по ходу последовательного чтения ответов. Разбейте массив на порции по десять ответов и после каждой порции фиксируйте: сколько новых тем появилось. Как только подряд две порции не добавляют ни одной новой темы, можно останавливаться с достаточной уверенностью, что для целей перечня список полон. Если вы читаете сразу весь массив без такой разбивки, ощущение насыщения легко спутать с усталостью от чтения — оба чувства похожи, но означают разное.

  1. Разбейте массив открытых ответов на порции по десять.
  2. После каждой порции фиксируйте число новых тем письменно, а не по памяти.
  3. Остановитесь, когда две порции подряд не добавили ни одной новой темы.
  4. Если объём массива меньше порога насыщения — прочитайте его целиком и не считайте перечень окончательным.
Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Точность доли: сколько нужно для цифры в отчёте

Как только вы хотите не перечислить темы, а сказать «эта тема встречается у стольких-то процентов», логика насыщения перестаёт применяться, и вступает обычная статистика выборок — та же самая, что используется для расчёта размера выборки любого закрытого вопроса. Чем меньше ответов закодировано, тем шире доверительный интервал вокруг посчитанной доли, и при малом числе ответов интервал становится настолько широким, что сама цифра теряет практический смысл. Условный пример: доля пятнадцать процентов на тридцати ответах имеет интервал примерно от пяти до тридцати процентов — с таким разбросом цифру нельзя использовать для сравнения волн.

Практическое следствие: для сравнения долей между двумя волнами или двумя сегментами нужно в разы больше ответов, чем для простого перечня тем. Ориентировочно от ста до полутора сотен закодированных ответов на сегмент — уже рабочий минимум, при котором изменение доли на десять процентных пунктов действительно можно интерпретировать как реальный сдвиг, а не как шум выборки. Меньшие объёмы годятся для наблюдения общей картины, но не для решений, где цена ошибки высока.

Итеративный сбор: докидывать ответы порциями

Совсем не обязательно собирать сразу все ответы целиком и уже потом одним махом решать постфактум, хватило ли собранного объёма для нужной задачи. Разумнее итеративный подход: собрать первую порцию, прочитать её на насыщение и одновременно прикинуть точность по интересующим темам, а затем решить — хватает объёма для задачи или нужна вторая порция. Это особенно удобно, когда открытый вопрос идёт в длинной анкете и ответы поступают постепенно, а не одним файлом после закрытия сбора: черновой анализ можно начинать раньше официального дедлайна.

Итеративный сбор экономит время именно потому, что для перечня тем и для точной доли пороги очень разные, и без промежуточной проверки легко либо остановиться слишком рано для точности, либо продолжать собирать данные намного дольше, чем требовалось для простого перечня. Проверка после каждой порции — это пять минут работы, которые часто экономят целый лишний день сбора данных, не добавляющих ничего нового к уже понятной картине.

Разные сегменты требуют отдельного расчёта

Довольно частая ошибка на практике — считать насыщение и точность по всему собранному массиву целиком, когда на самом деле важно сравнение между группами. Если задача — понять, отличаются ли жалобы новых клиентов от жалоб давних, насыщение и точность нужно достигать по каждой группе отдельно, а не суммарно. Триста ответов, из которых двести восемьдесят от давних клиентов и всего двадцать от новых, дают надёжную картину по давним и практически бесполезную — по новым, хотя общий объём выглядит внушительно.

Что делать, если ответов объективно мало

Открытые вопросы на практике часто заполняет лишь меньшинство респондентов, даже когда само поле не является строго обязательным для всех участников опроса, и в итоге реальный доступный объём для анализа может незаметно оказаться в несколько раз меньше того, что изначально планировалось и ожидалось командой. В этой ситуации честнее не притворяться, что цифры точные, а явно понизить уровень заявляемой уверенности: вместо «двадцать пять процентов клиентов жалуются на X» написать «среди сорока ответивших на открытый вопрос жалобы на X встречались чаще остальных тем». Формулировка длиннее, зато не вводит читателя в заблуждение относительно точности данных, стоящих за ней.

Никогда не объединяйте малый массив открытых ответов в одну общую долю без указания абсолютного числа ответивших. «Тридцать процентов» без числа за скобками читается как надёжная статистика, а «трое из десяти» — сразу видно, насколько осторожно к этому стоит относиться. Обе формулировки математически описывают одно и то же, но вторая честнее по умолчанию.

Как объём открытых ответов связан с общей выборкой

Итоговое число открытых ответов почти никогда не равно числу респондентов опроса — обязательные открытые вопросы редкость, а необязательные заполняет заметно меньшая доля. По опыту прикладных опросов доля заполнивших произвольный открытый вопрос колеблется примерно от пятнадцати до сорока процентов от всех респондентов, и заранее закладывать общий объём выборки нужно с учётом этого разрыва: если для анализа открытых ответов нужно двести штук, а заполняет их каждый четвёртый, общая выборка должна быть около восьмисот, а не двухсот респондентов.

В сервисе «До Сути» доля заполнивших конкретное открытое поле видна сразу же в общей статистике по вопросу, без отдельного подсчёта вручную, и это удобно использовать на этапе планирования следующей волны: если в прошлый раз открытое поле заполнили только пятая часть респондентов, для нужного объёма открытых ответов в следующий раз выборку стоит закладывать заведомо больше, а не рассчитывать её так, будто ответит каждый.

Пример: разные пороги для одной и той же задачи

Возьмём условный пример, где цифры взяты только для иллюстрации логики. Команда собирает открытые ответы про причины отказа от продления подписки. После тридцати ответов список тем стабилизируется: цена, отсутствие нужной функции, переход к конкуренту, технические проблемы — новых категорий больше не появляется. Для брифа команде разработки этого достаточно: список тем полон, и по нему уже можно расставлять приоритеты для обсуждения.

Но когда руководство просит точную цифру — «на сколько процентов цена важнее конкурентов как причина отказа», — тех же тридцати ответов уже не хватает. Чтобы уверенно сравнить две доли между собой, нужно расширить массив минимум до сотни-полутора сотен ответов на каждую сравниваемую категорию. Одна и та же задача на словах — «разобраться в причинах отказа» — при более пристальном взгляде оказывается двумя разными задачами с разным нужным объёмом данных, и это стоит проговорить с заказчиком результата до начала сбора, а не после того, как выяснится нехватка данных.

Ограничения

Все пороги, названные и перечисленные выше, — это лишь практические ориентиры, а не строгие формулы с полной гарантией: реальное насыщение зависит от узости вопроса и однородности аудитории и может наступить и раньше тридцати ответов, и позже восьмидесяти. Второе ограничение — оценка доверительного интервала для доли по открытым ответам предполагает, что кодирование выполнено последовательно по одному и тому же кодбуку; если критерии разметки менялись по ходу работы, формальный расчёт точности теряет смысл, каким бы большим ни был объём. Наконец, само насыщение — качественное суждение исследователя, а не автоматически вычисляемая величина, и разные люди могут остановиться на разном объёме, читая один и тот же массив.

Типичные ошибки

С чего начать

Прежде чем собирать данные, договоритесь с заказчиком результата, какой из двух вопросов на самом деле нужен: список причин для обсуждения на встрече команды или точная цифра для сравнения с прошлым периодом. Этот разговор занимает пять минут, но снимает большую часть последующих споров о том, «хватило ли данных» — обычно спор возникает именно потому, что задача изначально не была явно определена ни одной из сторон, а не потому, что кто-то ошибся в подсчёте нужного объёма.

Сначала определите, какой из двух вопросов вам на самом деле нужен: перечень тем или точная доля. Для перечня читайте ответы по порядку и остановитесь, когда десять подряд не добавят ничего нового — обычно это тридцать-пятьдесят ответов. Для точной доли считайте нужный объём как для обычной выборки, с поправкой на долю заполнивших открытое поле, и закладывайте не менее ста-полутора сотен закодированных ответов на каждый сегмент, который собираетесь сравнивать. Смешивать эти два расчёта — самый быстрый способ получить цифру, которая выглядит точной и таковой не является.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Сколько открытых ответов нужно, чтобы узнать основные темы?

Обычно тридцать-пятьдесят ответов достаточно для насыщения — момента, когда очередные десять прочитанных ответов не добавляют новых тем к уже собранному списку. Скорость насыщения зависит от узости вопроса: узкий вопрос про конкретную функцию насыщается быстрее, широкий вопрос вроде общего мнения о компании может не насытиться и на сотне ответов. Если список тем продолжает расти почти линейно после полусотни ответов, это сигнал сузить формулировку вопроса, а не читать дальше без разбора.

Можно ли посчитать процент по тридцати открытым ответам?

Формально можно посчитать, но доверять цифре нельзя. Насыщение отвечает на вопрос, какие темы вообще есть, а не на вопрос, насколько каждая из них распространена. На тридцати ответах доверительный интервал вокруг доли настолько широк, что пятнадцать процентов могут на деле означать что угодно от пяти до тридцати. Для надёжной доли, которую можно сравнивать между волнами, нужно от ста до полутора сотен закодированных ответов, а не тридцать, собранных ради перечня тем.

Нужно ли одинаковое число ответов для каждого сегмента при сравнении?

Насыщение и точность доли нужно оценивать по каждому сегменту отдельно, а не по всей выборке суммарно. Триста ответов, из которых двести восемьдесят от одного сегмента и всего двадцать от другого, дают надёжную картину только по первому. Если задача — сравнить сегменты между собой, стоит заранее спланировать сопоставимый объём открытых ответов в каждом, а не полагаться на то, что общий большой массив автоматически покрывает все группы поровну.

Как учесть, что открытый вопрос заполняет не каждый респондент?

Число открытых ответов почти никогда не равно числу респондентов опроса: необязательное открытое поле заполняет обычно от пятнадцати до сорока процентов участников. При планировании выборки эту долю нужно закладывать заранее — если для анализа нужно двести открытых ответов, а заполняет их примерно каждый четвёртый, общая выборка должна быть около восьмисот респондентов, а не двухсот. Фактическую долю заполнивших стоит проверять по прошлым волнам, а не угадывать.

Читайте также