Предвзятость выборки возникает тогда, когда имеющиеся у вас данные систематически отклоняются или отличаются от тех данных, которые вас интересуют. Предвзятость выборки часто обнаруживается по косвенным признакам после принятия множества решений на основе данных, плохо отражающих ту проблему, для решения которой они были собраны. Систематическая неспособность получить предсказанный данными результат заставляет аналитиков вернуться к началу и проверить корректность исходных данных.
Если вы захотите узнать рейтинг одобрения политика на основе опроса избирателей, состоящих в его политической партии, ваша выборка будет предвзятой. Хороший план эксперимента позволяет предотвратить эту проблему.
В своей работе вы можете столкнуться с изначально предвзятыми данными. Данные наблюдений особенно подвержены подобной предвзятости. Вопрос: «Зачем данные были собраны?» поможет вам понять их назначение. При сборе подобных данных редко принимаются меры для обеспечения их непредвзятости.
Вам следует рассматривать все данные наблюдений как изначально предвзятые. Вам не нужно их отбрасывать, но вы всегда должны учитывать их недостатки.
Представьте, что в зарплатной ведомости компании вы видите цифру 50 000 000 долларов США рядом с именем нового управляющего. Вы бы посчитали это значение выбросом? Что бы вы с ним сделали?
Выбросы – это точки данных, которые значительно отличаются от всех остальных. Обнаружение выбросов должно спровоцировать дискуссию о том, какие данные следует исключить из анализа. Если кому-то не нравится влияние экстремального значения на результат анализа, это еще не значит, что от этого значения следует избавиться. Для удаления точки данных необходимо иметь хорошее обоснование.
Произвольное присвоение точкам данных статуса выбросов может привести к тому, что ваша выборка станет предвзятой. В случае исключения выброса исходная точка данных и причина ее исключения должны быть задокументированы и доведены до сведения остальных, особенно если это исключение привело к существенному изменению результата.
Какие данные я не вижу?
Отсутствующие данные – это данные, которые либо не были зафиксированы (не имеют источника), либо вы их просто еще не видели. Рассмотрим следующие примеры:
– Данные о неполной занятости не учитываются при определении уровня безработицы.
– Компания, инвестирующая во взаимные фонды, «списывает» активы с плохой доходностью, в результате чего долгосрочная доходность оставшихся фондов в среднем оказывается выше.
– В истории «Челленджера» не было учтено 16 из 23 точек данных, связанных с полетами этого космического челнока.
Всегда стоит задумываться об информации, которая не была закодирована в рассматриваемых вами данных. Играйте в детектива[32].
Отсутствующие значения – это буквально дыры в наборе данных. Они представляют собой точки данных, которые не были собраны, или исключенные выбросы (см. предыдущий раздел). Отсутствующие значения представляют проблему, но ее можно решить. Итак, всегда стоит спросить: «Как вы поступили с отсутствующими значениями?»
Предположим, вы работаете в компании, выпускающей кредитные карты, и собираете такие данные заявителей, как имя, адрес, возраст, статус занятости, доход, ежемесячные расходы на жилье и количество имеющихся банковских счетов. Ваша задача – предсказать, не просрочат ли эти заявители платеж в следующем году. Однако несколько заявителей не указывают свои доходы, из-за чего в системе сохраняется пробел – отсутствующее значение.
Вернемся к истории происхождения данных. Эта история начинается с подачи заявки на получение кредитной карты. Возможно, заявитель не указал свой доход, потому что думал, что ему откажут в выдаче кредитной карты, если его доход окажется слишком низким. Это означает, что сам факт отсутствия этого значения может говорить о возможной просрочке платежа в будущем. Такую информацию ни в коем случае не стоит отбрасывать!
Понимая это, дата-сайентист может создать новый категориальный признак под названием «Доход указан?» и ввести значение 1, если человек указал свой доход, и 0, если он этого не сделал. Таким образом, можно закодировать отсутствующие данные с помощью специальной категориальной переменной.
Мы часто верим в возможность измерить все и вся. Однако при анализе сложных идей, прежде чем что-то измерять, вам необходимо выяснить, позволяют ли предоставленные данные это сделать. Например, подумайте вот о чем:
– Как бы вы измерили лояльность клиента к вашей компании?
– Какие данные вы использовали бы для измерения «капитала бренда» или «репутации»?
– Какие данные могут показать, насколько сильно вы любите своего ребенка? Или домашнего любимца?