Методика · 24 сентября 2026 г.
Кодирование открытых ответов: как построить систему категорий
Кодирование открытых ответов — это разметка текстовых ответов опроса заранее описанными категориями, чтобы превратить свободный текст в данные, которые можно посчитать и сравнить по сегментам. Без кодирования открытый вопрос остаётся набором цитат: их можно вставить в отчёт, но нельзя проверить статистически и нельзя сравнить волну с волной. С кодированием те же ответы превращаются в доли по темам — сколько человек жаловались на цену, сколько на скорость доставки, сколько хвалили конкретную функцию. Метод простой по идее и трудоёмкий на практике: основная работа — не сама разметка, а построение системы категорий, которая не пересекается и не оставляет ответы без места. Ниже разберём, как строить такую систему, сколько категорий разумно, когда нужен второй кодировщик и как использовать результат не только в таблице, но и в отчёте.
Что такое кодирование и зачем оно нужно
Открытый вопрос в анкете собирает текст, а не число, и это одновременно его сила и слабость. Сила в том, что человек формулирует своими словами и говорит о том, о чём вы не догадались спросить в закрытом списке. Слабость в том, что сто текстовых ответов невозможно предъявить руководству как аргумент — сто цитат никто не читает целиком, а выборочные примеры легко подобрать так, чтобы подтвердить любую заранее готовую мысль. Кодирование решает именно эту проблему: каждому ответу присваивается одна или несколько категорий из заранее описанного списка, и дальше с категориями можно работать как с обычными закрытыми вариантами — считать доли, строить график, сравнивать сегменты.
Нужно оно не всегда. Если открытых ответов пришло пятнадцать и вы прочитали их за пять минут, формальное кодирование — лишняя работа, читайте и выписывайте наблюдения вручную. Кодирование окупается, когда ответов от полусотни и больше, когда результат нужно показать в цифрах, а не в цитатах, и когда вопрос повторяется от волны к волне и важно отследить, растёт доля жалоб на конкретную тему или падает. Ниже речь именно про этот сценарий — регулярный или разовый количественный разбор большого массива текста.
Открытое и закрытое кодирование
Есть два подхода к тому, откуда берутся категории. Закрытое кодирование — вы формулируете список категорий заранее, до чтения ответов, на основе гипотезы, прошлой волны или здравого смысла о продукте. Открытое кодирование — категории рождаются из самого текста: вы читаете первую порцию ответов без предварительного списка и выписываете темы по мере того, как они встречаются. У каждого подхода своя цена ошибки. Закрытый список, составленный кабинетно, почти всегда что-то упускает и вынуждает раздувать категорию «другое» до трети всех ответов — это верный признак, что список не соответствует реальным темам.
На практике почти никто не использует подходы в чистом виде — работает гибрид. Берёте черновой список из двух-трёх очевидных категорий, которые точно понадобятся, и читаете первую пятую часть массива, дополняя список темами, которые не укладываются в черновик. После этой пробной проходки список стабилизируется, и по нему уже кодируется весь массив целиком, включая уже прочитанные ответы — их нужно переразметить по финальной версии, а не оставлять размеченными по черновику.
Как построить кодбук — систему категорий
Кодбук — это не просто список названий, а документ, по которому два разных человека разметят один и тот же ответ одинаково. У каждой категории должно быть название, короткое определение своими словами, пример реальной или похожей на реальную цитаты и явное указание, что в категорию не входит. Последний пункт кажется избыточным, пока не столкнёшься с пограничным случаем: ответ «долго везут» — это категория «скорость доставки» или «логистика в целом», если в кодбуке есть обе? Без явно прописанной границы кодировщик решает это на глаз, и решения расходятся от ответа к ответу.
- Название категории — короткое, без двусмысленности.
- Определение своими словами — не пересказ названия, а объяснение границы.
- Пример-цитата — реальный или характерный ответ, попадающий именно сюда.
- Что НЕ входит — явное разграничение с соседними похожими категориями.
- Правило по множественным темам — можно ли присвоить ответу два кода сразу.
Отдельно нужно решить вопрос множественного кодирования: может ли один ответ получить сразу два кода. Ответ «дорого и долго везут» логично разметить и как «цена», и как «скорость доставки» — оба утверждения в тексте есть, и урезать до одной категории значит терять данные. Но тогда при подсчёте долей сумма процентов по категориям превысит сто, и это нужно явно пометить в отчёте, иначе читатель решит, что где-то ошибка в расчётах.
Сколько категорий — оптимальный диапазон
Слишком мало категорий — теряется смысл кодирования: если весь массив укладывается в три широких темы, вы могли бы разметить его без формального кодбука за то же время. Слишком много — кодбук становится непригоден для использования: кодировщик не удерживает в голове двадцать пять тонких различий, начинает путать соседние категории, а итоговая таблица с тридцатью строками по два процента каждая нечитаема в отчёте. Рабочий ориентир для большинства опросов — от восьми до пятнадцати содержательных категорий плюс обязательные служебные: «другое» и «не по теме / нечитаемый ответ».
Категории с частотой ниже двух-трёх процентов по итогу кодирования стоит объединять в более широкую группу для отчёта, но не на этапе разметки — размечайте подробно, укрупняйте потом. Причина простая: пока вы не увидели итоговое распределение, невозможно заранее угадать, какие темы окажутся редкими, а объединять их до подсчёта — значит принимать решение вслепую. Держите подробный код на уровне сырых данных и укрупнённую версию отдельно, для графика и презентации.
Межкодерная надёжность: когда нужен второй кодировщик
Один и тот же ответ два разных человека иногда размечают по-разному даже по хорошо написанному кодбуку — это называется расхождением между кодировщиками, и оно есть всегда, вопрос только в размере. Для внутреннего разбора, где решение принимает та же команда, что и кодировала, одного кодировщика обычно достаточно: риск в том, что систематическая ошибка одного человека останется незамеченной, но для рабочих выводов это приемлемо. Для исследования, на основании которого принимается дорогое решение или которое публикуется наружу, нужен второй кодировщик хотя бы на части массива.
Проверка простая и не требует сложной статистики для прикладных задач: дайте второму человеку размеченные вами же категории и попросите независимо закодировать пятнадцать-двадцать процентов того же массива, не видя ваших меток. Сравните совпадения. Если расхождение выше пятой части ответов, проблема почти всегда не в кодировщиках, а в самом кодбуке — где-то есть нечёткая граница между категориями, и её нужно переписать раньше, чем размечать оставшуюся часть массива.
Инструменты для кодирования
Для большинства прикладных задач хватает обычной таблицы: столбец с исходным текстом ответа, столбец или несколько столбцов под коды, отдельный лист под сам кодбук с определениями. Это медленнее специализированного софта, зато не требует обучения и прозрачно для всей команды — любой человек открывает файл и видит логику разметки. Специализированные инструменты для качественного анализа удобнее на массивах от пары тысяч ответов и при повторяющемся кодировании из волны в волну: они ускоряют поиск по тексту и хранят кодбук версионно, но добавляют порог входа и почти всегда избыточны для разового опроса.
| Способ | Подходит для объёма | Порог входа | Главный риск |
|---|---|---|---|
| Таблица вручную | До нескольких сотен ответов | Низкий | Медленно на большом массиве |
| Специализированный софт | От тысячи и больше | Средний, нужно освоить | Избыточен для разового опроса |
| Кодирование вдвоём в общей таблице | Любой объём с проверкой | Низкий | Нужна синхронизация версий кодбука |
| Готовая типология из прошлой волны | Повторяющийся трекинг | Низкий | Устаревает, если продукт меняется |
Автоматическая предварительная сортировка по ключевым словам иногда ускоряет черновой проход: можно быстро найти все ответы со словом «дорого» и предварительно пометить кандидатов в категорию «цена». Но это именно черновик, а не замена ручного прочтения — ответ «не дорого, а совсем не дорого» формально содержит слово «дорого» и попадёт не в ту категорию, если довериться поиску без проверки человеком. Автоматизация экономит время на поиске, а не на решении, куда отнести пограничный случай.
Частые ловушки при разметке
Первая и самая частая ловушка — дрейф определений по ходу работы. В начале дня кодировщик трактует категорию «скорость» узко, только про доставку, а к вечеру, устав держать границу в голове, начинает относить туда же жалобы на медленную загрузку сайта. Итоговая разметка получается неоднородной внутри самой себя: первая половина массива размечена строже второй. Лечится это простым правилом — возвращаться к письменному определению в кодбуке каждые полсотни ответов, а не полагаться на память о том, что решили утром.
- Прочитайте пятую часть массива и составьте черновой кодбук с примерами.
- Проверьте черновик на следующей десятой части: что не влезает, добавьте категорию.
- Зафиксируйте финальный кодбук и переразметьте уже прочитанные ответы по нему.
- Разметьте весь массив, возвращаясь к определениям каждые полсотни ответов.
- Дайте второму человеку закодировать независимо пятнадцать-двадцать процентов.
- Сравните расхождения, при необходимости уточните формулировки и досчитайте.
- Укрупните редкие категории для итогового графика, сохранив подробный код в сырых данных.
Вторая ловушка — короткие неинформативные ответы вроде «всё хорошо» или «нормально». Их нельзя честно отнести ни к одной содержательной категории, и заталкивать их в «другое» вместе с действительно разнородными ответами искажает картину: доля «другого» вырастает не потому, что тем много, а потому, что часть людей просто не захотела разворачивать мысль. Разумное решение — завести отдельную служебную категорию «нет содержательного ответа» и не смешивать её с настоящим «другое».
Как использовать код в отчёте
Итог кодирования — это частотная таблица или график: категория и доля ответов, в неё попавших. Голая таблица работает хуже, чем таблица с одной-двумя живыми цитатами на каждую крупную категорию — цифра говорит, насколько тема распространена, а цитата объясняет, что именно люди имеют в виду под сухим названием. Порядок категорий в графике имейте смысл располагать по убыванию частоты, а не в произвольном порядке, иначе главный вывод теряется среди второстепенного.
Экспорт открытых ответов из формы в таблицу — обязательный технический шаг перед кодированием, и удобнее, когда сервис отдаёт их вместе с остальными данными по респонденту, а не отдельным файлом без привязки. В «До Сути» открытые ответы выгружаются в общую таблицу вместе с закрытыми вопросами того же респондента, так что готовый код по открытому вопросу сразу можно сопоставить с сегментом — например, посмотреть, отличается ли структура жалоб у новых клиентов от структуры у давних.
Ограничения метода
Кодирование не устраняет субъективность, а лишь делает её явной и проверяемой — окончательное решение, к какой категории отнести пограничный ответ, всё равно принимает человек. Метод также плохо работает на очень коротких ответах: если люди в среднем пишут два-три слова, содержательных категорий получится мало, и почти весь смысл придётся черпать из немногочисленных развёрнутых ответов, что смещает картину в пользу тех, кто вообще склонен писать длинно. И наконец, кодирование — это разовый снимок текущей формулировки открытого вопроса: если вопрос переформулировать в следующей волне, темы ответов сместятся вместе с формулировкой, и сравнение волн придётся делать с этой оговоркой.
Стоит помнить и о ресурсной цене метода: качественное кодирование пятисот ответов с проверкой вторым человеком легко занимает два полных рабочих дня, и об этом нужно предупреждать до старта, а не по факту срыва сроков. Если времени объективно нет, честнее сократить объём выборки для кодирования до случайных ста-двухсот ответов и явно указать в отчёте, что цифры получены по подвыборке, чем размечать весь массив наспех и выдавать за точный результат разметку, которую никто не проверял.
Типичные ошибки
- Составлять кодбук кабинетно, не проверив его на реальных ответах.
- Оставлять границы категорий неявными и решать пограничные случаи на глаз.
- Разрешать «другому» разрастаться до трети массива без анализа причин.
- Менять строгость определений по ходу дня без письменной фиксации.
- Кодировать в одиночку решение, от которого зависит дорогой вывод.
- Смешивать короткие неинформативные ответы с настоящим «другим».
- Считать проценты по множественным кодам, не поясняя в отчёте, что сумма больше ста.
- Полагаться на автоматический поиск по ключевым словам без проверки пограничных случаев.
- Укрупнять редкие категории до расчёта итогового распределения, а не после.
С чего начать
Возьмите тридцать-пятьдесят открытых ответов из последнего опроса и попробуйте закодировать их с нуля за один присест: прочитайте, выпишите пять-восемь черновых категорий с примерами, разметьте весь набор, посчитайте доли. Час работы даст либо рабочий кодбук, который можно применить к остальному массиву, либо понимание, что вопрос сформулирован слишком широко и собирает слишком разнородные ответы для одного набора категорий. Оба результата полезны и дешевле, чем размечать тысячу ответов по кодбуку, который не работает с первой сотни.
Частые вопросы
Чтение даёт впечатление и позволяет процитировать несколько ярких примеров, но не даёт цифр: нельзя сказать, сколько процентов респондентов жаловались на конкретную тему, и нельзя сравнить волну с волной. Кодирование присваивает каждому ответу категорию из заранее описанного списка, после чего с категориями работают как с обычными закрытыми вариантами — считают доли, строят график, сравнивают сегменты. Плата за это — время на построение кодбука и саму разметку, которая на большом массиве занимает часы.
Для большинства опросов рабочий диапазон — восемь-пятнадцать содержательных категорий плюс служебные «другое» и «не по теме». Меньше — теряется смысл формального кодирования, массив можно разобрать и без него. Больше — кодировщик перестаёт удерживать тонкие различия в голове, начинает путать соседние категории, а итоговая таблица становится нечитаемой в отчёте. Редкие категории с частотой ниже двух-трёх процентов укрупняют для презентации уже после подсчёта, а не на этапе разметки.
Для внутреннего рабочего разбора обычно достаточно одного человека. Для исследования, на основании которого принимается дорогое решение или которое публикуется наружу, стоит дать второму человеку независимо закодировать пятнадцать-двадцать процентов массива и сравнить расхождения. Если совпадение ниже примерно восьмидесяти процентов, проблема чаще всего в самом кодбуке — где-то нечётко описана граница между категориями, и её нужно переписать, а не просто доверять более опытному кодировщику.
Частично. Поиск по ключевым словам ускоряет черновой проход: можно быстро найти кандидатов в категорию и предварительно их пометить. Но это черновик, а не готовое решение — фразы вроде «не дорого» формально содержат слово-триггер и попадут не в ту категорию без проверки человеком. Полноценная замена ручного кодирования автоматикой для содержательных, неоднозначных категорий в прикладных опросах пока даёт заметную долю ошибок на пограничных формулировках.