Настало время уточнить, какой позиции мы придерживаемся в споре, о котором вы, вероятно, даже не слышали.
На самом деле слово
Мы пытались придерживаться правил языка, говоря
Основы сводной статистики
Данные не всегда выглядят как набор или электронная таблица. Часто они бывают представлены в виде сводной статистики. Сводная статистика позволяет получить информацию о наборе данных.
Три самых распространенных понятия сводной статистики – среднее значение, медиана и мода, с которыми вы, вероятно, уже хорошо знакомы. Тем не менее мы хотим потратить несколько минут на обсуждение этих понятий, поскольку часто замечаем, что в разговорной речи слова «нормальный», «обычный», «типичный» и «средний» используются в качестве синонимов для них. Чтобы избежать путаницы, давайте проясним, что же означают эти понятия.
– Среднее значение – это сумма всех имеющихся у вас чисел, деленная на их количество. Нахождение среднего значения дает вам представление о том, какой вклад в общую сумму вносит каждое из наблюдений, когда все они имеют одно и то же значение.
– Медиана – это средняя точка диапазона значений, отсортированных по порядку.
– Мода – это число, которое встречается в наборе данных чаще всех остальных.
Среднее значение, медиана и мода называются мерами положения или мерами центральной тенденции. Меры вариации – дисперсия, размах и стандартное отклонение – являются мерами разброса. Номер положения указывает, где именно в числовом ряду находится типичное значение, а разброс говорит о том, насколько другие числа отклоняются от этого значения.
В качестве примера возьмем числа 7, 5, 4, 8, 4, 2, 9, 4 и 100. В данном случае среднее значение равно 15,89, медиана – 5, а мода – 4. Обратите внимание на то, что среднее значение 15,89 не присутствует среди исходных значений. Такое случается очень часто: среднее количество людей в домохозяйстве в США в 2018 году составляло 2,63 человека; звезда баскетбола Леброн Джеймс набирает в среднем 27,1 очка за игру.
Распространенная ошибка – использование среднего значения как средней точки данных, которой является медиана. Может показаться, что половина значений должна быть выше среднего, а половина – ниже. Но это не так. Чаще всего большинство значений находятся либо ниже, либо выше среднего. Например, у подавляющего большинства людей количество пальцев превышает среднее значение (которое составляет 9 с чем-то).
Чтобы избежать путаницы и недоразумений, мы рекомендуем использовать среднее значение, медиану и моду вместо таких понятий, как «обычный», «типичный» или «нормальный».
Подведение итогов
В этой главе мы преподали вам основы языка, на котором вы можете говорить о данных на рабочем месте. В частности, мы обсудили:
– данные, наборы данных и различные названия строк и столбцов в них;
– числовые данные (непрерывные и дискретные);
– категориальные данные (порядковые и номинальные);
– экспериментальные данные и данные наблюдений;
– структурированные и неструктурированные данные;
– меры центральной тенденции.
Теперь, когда вы освоили терминологию, пора приступать к статистическому осмыслению имеющихся данных.
Глава 3
Готовьтесь мыслить статистически
«Статистическим называется особый стиль мышления, который сочетает в себе элементы детективной работы и скептицизма, а также предполагает использование альтернативных подходов к решению проблемы»[13]