Читаем Разберись в Data Science полностью

В последующие десятилетия статистики, инженеры и исследователи тщательно изучали данные[27], связанные с катастрофой «Челленджера». С помощью этого реального сценария мы хотели продемонстрировать вам те вопросы, с которыми приходится сталкиваться специалистам по работе с данными. В статье, опубликованной в престижном журнале Journal of the American Statistical Association (JASA), издаваемом Американской статистической ассоциацией, был представлен анализ, который мы воссоздали на рис. 4.4. Он говорит о том, что при отрицательных температурах пять из шести основных уплотнительных колец могут выйти из строя. При составлении этого графика использовались данные, которые не были учтены накануне запуска шаттла. В статье говорится о том, что «статистическая наука могла внести ценный вклад в процесс принятия решения о запуске»[28].

Хотели бы вы увидеть такой же график накануне важной презентации?

Комментарий Алекса по поводу данных о состоянии «Челленджера»

Внимательные читатели, вероятно, заметили небольшое расхождение между данными, представленными на рис. 4.1, и графиками из отчета комиссии Роджерса на рис. 4.2 и 4.3. На рис. 4.1 температуре 53 °F (12 °C) соответствуют два инцидента, а на рис. 4.2 и 4.3 – три. (Все остальные точки данных совпадают.) Дело в том, что конструкция космического челнока предусматривала шесть основных и шесть второстепенных уплотнительных колец. Третий инцидент при температуре 53 °F (12 °C), отмеченный на рис. 4.2 и 4.3, произошел со второстепенным уплотнительным кольцом и был единственным случаем подобного повреждения, имевшим место в ходе 23 полетов, предшествовавших катастрофе. Приведенный здесь анализ сосредоточен на шести основных уплотнительных кольцах, как и анализ, приведенный в статье в журнале JASA.

История «Челленджера» демонстрирует довольно распространенное и пугающее явление. Мы часто сосредоточиваемся на данных, которые, как нам кажется, кодируют нужную нам информацию, отбрасывая при этом те данные, которые мы считаем несущественными. Мы признаем, что далеко не во всех ситуациях последствия могут быть столь же ужасными, как в случае с «Челленджером», когда на карту было поставлено так много.

Мы не утверждаем, что анализ полного набора данных позволил бы принять правильное решение. Никто не может знать это наверняка. Другие факторы тоже, безусловно, сыграли свою роль. Мы просто хотим сказать, что спор с данными часто помогает сделать дополнительные открытия.

И в этом смысле история, рассказанная данными о состоянии «Челленджера», вполне ясна. Однако большинство компаний не спорят со своими данными, развивая вместо этого культуру принятия. Результат этого – систематические провалы проектов по работе с данными, обусловленные неготовностью задавать важные вопросы.

Итак, цель этой главы – научить вас спорить с данными и задавать правильные вопросы.

<p>Расскажите мне историю происхождения данных</p>

Все данные берутся из какого-то источника, который нам не следует игнорировать. Итак, мы предлагаем вам спросить: «Каково происхождение этих данных?»

Этот вопрос нравится нам тем, что он является открытым и позволяет быстро оценить согласованность сырых данных с заданным относительно них вопросом. Кроме того, для ответа на него не требуются ни математические, ни статистические знания. Еще важнее то, что сам вопрос создает ощущение открытости и укрепляет доверие к последующим результатам (или заставляет сомневаться в них).

Внимательно проанализируйте ответ на предмет возможных проблем с корректностью и целостностью данных, обусловленных особенностями создавшего их лица или организации.

В частности, постарайтесь получить ответы на следующие вопросы:

– Кто собирал данные?

– Как собирались эти данные? Это данные наблюдений или экспериментальные данные?

<p><emphasis>Кто собирал данные?</emphasis></p>

Задавая этот вопрос, мы пытаемся, во-первых, установить, откуда именно были получены данные, а во-вторых, выявить возможные проблемы, связанные с их происхождением, чтобы при необходимости задать дополнительные вопросы.

Перейти на страницу:

Все книги серии Мировой компьютерный бестселлер

Похожие книги

1С: Бухгалтерия 8 с нуля
1С: Бухгалтерия 8 с нуля

Книга содержит полное описание приемов и методов работы с программой 1С:Бухгалтерия 8. Рассматривается автоматизация всех основных участков бухгалтерии: учет наличных и безналичных денежных средств, основных средств и НМА, прихода и расхода товарно-материальных ценностей, зарплаты, производства. Описано, как вводить исходные данные, заполнять справочники и каталоги, работать с первичными документами, проводить их по учету, формировать разнообразные отчеты, выводить данные на печать, настраивать программу и использовать ее сервисные функции. Каждый урок содержит подробное описание рассматриваемой темы с детальным разбором и иллюстрированием всех этапов.Для широкого круга пользователей.

Алексей Анатольевич Гладкий

Программирование, программы, базы данных / Программное обеспечение / Бухучет и аудит / Финансы и бизнес / Книги по IT / Словари и Энциклопедии
1С: Управление торговлей 8.2
1С: Управление торговлей 8.2

Современные торговые предприятия предлагают своим клиентам широчайший ассортимент товаров, который исчисляется тысячами и десятками тысяч наименований. Причем многие позиции могут реализовываться на разных условиях: предоплата, отсрочка платежи, скидка, наценка, объем партии, и т.д. Клиенты зачастую делятся на категории – VIP-клиент, обычный клиент, постоянный клиент, мелкооптовый клиент, и т.д. Товарные позиции могут комплектоваться и разукомплектовываться, многие товары подлежат обязательной сертификации и гигиеническим исследованиям, некондиционные позиции необходимо списывать, на складах периодически должна проводиться инвентаризация, каждая компания должна иметь свою маркетинговую политику и т.д., вообщем – современное торговое предприятие представляет живой организм, находящийся в постоянном движении.Очевидно, что вся эта кипучая деятельность требует автоматизации. Для решения этой задачи существуют специальные программные средства, и в этой книге мы познакомим вам с самым популярным продуктом, предназначенным для автоматизации деятельности торгового предприятия – «1С Управление торговлей», которое реализовано на новейшей технологической платформе версии 1С 8.2.

Алексей Анатольевич Гладкий

Финансы / Программирование, программы, базы данных