«До Сути»← Все статьи

Метрики · 12 сентября 2026 г.

Номинальная шкала в опросах: как анализировать категории без порядка

Номинальная шкала — это уровень измерения, на котором значения вопроса опроса представляют собой категории без какого-либо порядка между собой: выбранный город, канал связи, ответ на вопрос с несколькими вариантами. Над такими данными законны только подсчёт частот и доли каждой категории, мода как единственная содержательная «средняя величина», и проверка связи с другой категориальной переменной критерием хи-квадрат. Считать среднее арифметическое, ранжировать категории или измерять расстояние между ними бессмысленно, даже если в базе данных они закодированы цифрами для удобства хранения. Ниже — какие вопросы анкеты дают номинальные данные, что с ними можно делать и какие ошибки чаще всего встречаются на практике.

Что такое номинальная шкала

Номинальная шкала — самый простой из четырёх уровней измерения в классификации психолога Стэнли Стивенса: значения на ней — это категории, между которыми нет ни порядка, ни расстояния, только различие. Слово «номинальная» происходит от латинского nomen — «имя»: категория выполняет роль имени, ярлыка, а не числа в математическом смысле, даже если для удобства хранения в базе данных ей присвоен числовой код.

Отличительный признак номинальной шкалы — вариантов ответа можно переставить местами в любом порядке, и смысл вопроса не изменится. Список «чат, почта, телефон» ничем не хуже списка «почта, телефон, чат» — оба описывают один и тот же набор равноправных категорий. Как только порядок вариантов начинает нести смысл — «редко, иногда, часто» — шкала перестаёт быть номинальной и становится порядковой, что разобрано в отдельной статье про порядковую шкалу.

Полезная проверочная эвристика — представить, что варианты ответа записаны на отдельных карточках и перемешаны: если после перемешивания вопрос анкеты остаётся таким же понятным и полным, как был, шкала номинальная. Если перемешивание карточек делает вопрос бессмысленным или неполным — например, для шкалы «от 1 до 5» перепутанный порядок сразу разрушает саму идею оценки, — перед вами уже не номинальная, а порядковая шкала.

Какие вопросы анкеты дают номинальные данные

Типичные номинальные вопросы в опросе — это выбор одного варианта из списка равноправных категорий: пол, регион проживания, используемый мессенджер, источник, из которого респондент узнал о продукте, выбранный тариф без встроенной иерархии. Сюда же относятся вопросы с множественным выбором, где отмечается несколько категорий сразу, — каждый вариант в них по-прежнему остаётся отдельной номинальной переменной да/нет.

Отдельный практический случай — открытый вопрос, ответы на который затем группируются в категории вручную при анализе: например, ответ на вопрос «что вам не понравилось» разбивается на темы «цена», «качество», «доставка», «сервис». После такой группировки данные становятся номинальными независимо от того, что исходно это был текст, — и с ними работают ровно те же правила, что и с закрытым вопросом-списком.

Что законно считать по номинальным данным

Первая и главная законная операция — подсчёт частоты каждой категории: сколько раз и какая доля респондентов выбрала каждый вариант. Это простое действие покрывает большинство практических задач анализа номинального вопроса — понять, какой канал связи популярнее, каким мессенджером пользуется большинство аудитории.

Вторая законная операция — мода: категория, которая встречается чаще всех остальных. Это единственная содержательная характеристика «типичного значения» для номинальной шкалы — ни среднее, ни медиана для неё не определены математически корректно. Третья операция — проверка связи с другой категориальной переменной критерием хи-квадрат: например, отличается ли распределение выбранного канала связи в зависимости от сегмента клиента, что подробно разобрано в статье о критерии хи-квадрат.

На практике эти три операции — частоты, мода, хи-квадрат — редко применяются по отдельности: типичный отчёт по номинальному вопросу начинается с таблицы частот, продолжается модой как headline-цифрой и заканчивается проверкой связи с ключевым сегментирующим признаком, если она содержательно интересна. Такой порядок логичен: частоты дают общую картину, мода — самую компактную сводку для презентации, а хи-квадрат отвечает на вопрос, стоит ли вообще считать разницу между сегментами значимой, а не случайным шумом конкретной выборки.

Чего делать с номинальными данными нельзя

Главный запрет — среднее арифметическое. Даже если категории в таблице закодированы цифрами 1, 2, 3 для компактности хранения, применение к этому столбцу функции среднего даёт число вроде 1,8, которое не соответствует ни одной реальной категории и не имеет содержательного смысла — это распространённая, но методологически пустая операция.

Второй запрет — ранжирование категорий и вычисление расстояния между ними: сказать, что канал «почта» на 0,5 «дальше» от канала «чат», чем канал «телефон», бессмысленно, потому что у номинальной шкалы нет направления и единицы измерения расстояния. Третий частый соблазн — построить линейный график или диаграмму рассеяния по номинальным категориям на оси, что визуально подразумевает порядок и расстояние там, где их на самом деле нет. Четвёртый, менее очевидный запрет — вычислять стандартное отклонение или дисперсию по номинальному столбцу: обе операции опираются на то же среднее, которое для номинальной шкалы уже бессмысленно, и наследуют его бессодержательность автоматически.

Бинарная шкала — частный случай номинальной

Вопрос с двумя вариантами ответа — да/нет, купил/не купил — формально номинальная шкала с двумя категориями, но на практике её часто называют отдельно, бинарной или дихотомической, потому что для неё доступен дополнительный удобный приём: закодировать один вариант как 0, а другой как 1, и тогда среднее значение такого столбца превращается в долю единиц — то есть в ту же самую частоту категории, но выраженную одним числом.

Этот приём — не исключение из правила «нельзя считать среднее по номинальным данным», а частный случай, где среднее по закодированному 0/1 столбцу математически совпадает с долей, и потому оказывается законным именно для бинарной переменной. Для номинальной шкалы с тремя и более категориями такой трюк не работает: закодировать три равноправные категории одним числовым столбцом без потери смысла нельзя.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Как проверить связь двух номинальных переменных

Когда нужно понять, связаны ли между собой два номинальных вопроса — например, зависит ли выбранный канал связи от того, из какого источника пришёл клиент, — прямая корреляция здесь неприменима: коэффициент корреляции Пирсона и Спирмена требуют хотя бы порядковой шкалы. Инструмент для двух номинальных переменных — критерий хи-квадрат: он сравнивает наблюдаемые частоты сочетаний категорий в таблице сопряжённости с частотами, ожидаемыми при полной независимости переменных.

Для оценки силы такой связи, а не только её значимости, используют коэффициент V Крамера — он не зависит от размера выборки и показывает, насколько сильно категории двух переменных связаны друг с другом, в диапазоне от нуля до единицы. Полный разбор расчёта, условий применимости и типичных ловушек хи-квадрата — в отдельной статье.

Результат хи-квадрата и V Крамера стоит всегда сопровождать самой таблицей сопряжённости в процентах, а не приводить только итоговые цифры теста: числа «хи-квадрат значим, V Крамера 0,3» ничего не говорят о направлении связи — какая именно категория с какой сочетается чаще, — а таблица долей отвечает на этот вопрос напрямую и понятна коллегам без объяснения статистики за ней.

Кодирование для статистического анализа: dummy-переменные

Многие статистические методы и модели — регрессия, факторный анализ — математически работают только с числами и не умеют напрямую принимать текстовую категорию. Стандартное решение — кодирование фиктивными, или dummy-переменными: категория с k вариантами превращается в k-1 бинарных столбцов, каждый из которых отвечает на вопрос «относится ли наблюдение к этой конкретной категории», а один вариант остаётся базовым уровнем для сравнения.

Важно не путать это техническое кодирование с изменением уровня измерения: после превращения в dummy-переменные данные по-прежнему остаются номинальными по своей природе, просто представлены в форме, пригодной для расчёта в конкретном статистическом методе. Интерпретировать коэффициент при dummy-переменной в регрессии нужно как разницу по сравнению с базовым уровнем, а не как непрерывное числовое изменение.

Отдельная практическая деталь — выбор базового уровня при dummy-кодировании. Если в анализе участвует переменная «канал связи» с вариантами чат, почта, телефон, базовым разумно выбрать самый массовый или самый привычный вариант — например, чат, — тогда коэффициенты при остальных dummy-переменных будут читаться как «отличие от типичного канала», что интуитивно понятнее произвольно выбранного базового уровня и облегчает интерпретацию результатов модели для нестатистической аудитории.

Скрытые ловушки: дубликаты категорий и категория «другое»

Номинальные данные особенно уязвимы к тихой ошибке, которая не видна в самом вопросе анкеты, а проявляется только при анализе ответов: одна и та же категория может попасть в выгрузку под разными названиями. Открытый вопрос об источнике трафика, обработанный без строгого списка вариантов, легко даёт вперемешку «Вконтакте», «ВК», «vk.com» и «vkontakte» — для респондента и для смысла это одна категория, а для программы подсчёта частот — четыре разные, каждая с маленькой долей. Итоговая таблица частот в этом случае занижает долю самой популярной категории и создаёт впечатление более раздробленного распределения, чем есть на самом деле.

Стандартный способ защиты — закрытый список вариантов вместо открытого поля везде, где список категорий можно предсказать заранее, и нормализация текста (единый регистр, убранные пробелы, сведение синонимов) там, где открытый вопрос неизбежен. Вторая частая ловушка — категория «другое»: если на неё приходится заметная доля ответов, например больше 15%, это сигнал, что список вариантов в анкете был неполным, а не что респонденты действительно принадлежат к разнородному остатку. В этом случае осмысленный шаг — прочитать текстовые уточнения к «другому» и вынести самые частые из них в отдельные полноценные категории при следующей волне опроса.

Третья практическая деталь — согласованность кодирования категорий между волнами одного трекингового опроса. Если в одной волне канал связи кодировался как «чат / почта / телефон», а в следующей добавился вариант «мессенджер», прямое сравнение долей по волнам исказится: часть респондентов, которые раньше выбрали бы «чат», в новой волне разошлись между «чат» и «мессенджер», и падение доли «чат» будет выглядеть как реальный тренд, хотя это артефакт изменения списка вариантов. Правило здесь простое: любое изменение списка номинальных категорий в анкете стоит документировать отдельно и обязательно учитывать при сравнении результатов до и после изменения.

Визуализация номинальных данных: какие графики подходят

Тип графикаПодходит для номинальных данныхПочему
Столбчатая диаграммаДаПорядок столбцов произволен, высота — частота
Круговая диаграммаДа, при небольшом числе категорийПоказывает долю каждой категории от целого
Линейный графикНетПодразумевает порядок и тренд по оси, которых нет
Диаграмма рассеянияНетТребует числовой оси с расстоянием между значениями

Правило простое: график должен визуально обещать не больше, чем на самом деле есть в данных. Столбчатая диаграмма ничего не обещает сверх частоты — столбцы можно переставлять местами без потери смысла. Линейный график неявно говорит «между этими точками есть путь и направление», а для номинальных категорий такого пути не существует, и читатель отчёта рискует увидеть в графике тренд там, где его нет и не может быть. Сортировать столбцы по убыванию частоты, а не по алфавиту или произвольному порядку из формы опроса, — простой приём, который почти всегда делает диаграмму нагляднее без каких-либо дополнительных расчётов.

Круговую диаграмму стоит использовать только при небольшом числе категорий — до пяти-шести — и только когда доли действительно составляют вместе 100%. При большем числе категорий или при множественном выборе, где сумма долей превышает 100%, круговая диаграмма искажает восприятие сильнее, чем помогает, и лучше подходит обычная столбчатая.

Типичные ошибки

Практический чек-лист

  1. Проверьте, есть ли в вариантах ответа содержательный порядок — если нет, шкала номинальная.
  2. Посчитайте частоту и долю каждой категории как основную характеристику распределения.
  3. Определите моду — самую частую категорию — если нужна одна сводная цифра.
  4. Для связи с другой категориальной переменной используйте критерий хи-квадрат и V Крамера.
  5. Для регрессии или факторного анализа закодируйте категорию dummy-переменными, а не одним числовым столбцом.
  6. Выбирайте столбчатую или круговую диаграмму для визуализации, а не линейный график.

С чего начать

Возьмите любой вопрос анкеты с выбором одного варианта из списка без порядка — канал связи, источник трафика, регион — и постройте по нему простую таблицу частот. Если нужно проверить связь с другим категориальным вопросом, добавьте таблицу сопряжённости и посчитайте хи-квадрат во внешнем статистическом инструменте после выгрузки ответов. В сервисе «До Сути» такой вопрос с вариантами ответа собирается стандартной формой, а расчёт частот, хи-квадрата и построение графика выполняются уже после экспорта данных в таблицу или статистический пакет.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Что такое номинальная шкала в опросе?

Номинальная шкала — уровень измерения, на котором значения представляют собой категории без порядка между собой: пол, регион, выбранный канал связи, источник трафика. Единственные законные операции над такими данными — подсчёт частоты и доли каждой категории, определение моды как самой частой категории и проверка связи с другой категориальной переменной критерием хи-квадрат. Считать среднее арифметическое или ранжировать категории по номинальной шкале некорректно, даже если в таблице они закодированы числами для удобства хранения данных.

Можно ли считать среднее по номинальным данным?

Нет, за одним исключением — бинарной переменной с двумя вариантами, закодированной как 0 и 1, где среднее математически совпадает с долей единиц. Для номинальной шкалы с тремя и более равноправными категориями среднее арифметическое не имеет смысла: даже если категории пронумерованы в базе данных цифрами 1, 2, 3 для удобства хранения, эти цифры — просто ярлыки, а не числа, над которыми законна арифметика. Правильная сводная характеристика для такой шкалы — мода, а не среднее.

Как проверить связь двух номинальных переменных?

Для проверки связи между двумя категориальными переменными без порядка используется критерий хи-квадрат: он сравнивает наблюдаемые частоты сочетаний категорий в таблице сопряжённости с частотами, которые ожидались бы при их полной независимости. Коэффициенты корреляции Пирсона и Спирмена здесь неприменимы, потому что оба требуют хотя бы порядковой шкалы. Для оценки силы связи, а не только её статистической значимости, дополнительно рассчитывают коэффициент V Крамера, не зависящий от размера выборки.

Какой график подходит для номинальных данных?

Столбчатая диаграмма и, при небольшом числе категорий, круговая — оба варианта не подразумевают порядка между категориями и показывают только частоту или долю каждой из них. Линейный график и диаграмма рассеяния для номинальных данных не подходят: оба визуально обещают порядок, направление и расстояние между точками, которых у категорий без ранга не существует, и читатель отчёта рискует увидеть тренд там, где его нет. Порядок столбцов на диаграмме можно выбирать произвольно, например по убыванию частоты для наглядности.

Читайте также