Добавлен: 06.11.2023
Просмотров: 197
Скачиваний: 3
ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.
Федеральное государственное бюджетное образовательное учреждение высшего образования «НАЦИОНАЛЬНЫЙ ИССЛЕДОВАТЕЛЬСКИЙ МОСКОВСКИЙ ГОСУДАРСТВЕННЫЙ СТРОИТЕЛЬНЫЙ УНИВЕРСИТЕТ» Институт цифровых технологий и моделирования в строительстве Кафедра Информатики и прикладной математики ДОМАШНЕЕ ЗАДАНИЕпо дисциплине«Математические методы обработки больших данных»Тема: «Разведывательный анализ данных»Выполнил студентИСАм 1-4, Богачев А.В.Проверила:доц. Горбунова Т.Н.Москва 2022СОДЕРЖАНИЕ
ВВЕДЕНИЕ 3
ОСНОВНАЯ ЧАСТЬ 4
1.Первичный анализ данных 4
2.Выявление ошибок и выбросов 7
3.Устранение ошибок и выбросов 8
4.Сортировка данных 9
5.Построение модели 9
ЗАКЛЮЧЕНИЕ 12
СПИСОК ЛИТЕРАТУРЫ 13
ВВЕДЕНИЕЦель этого курса — научиться писать программы, решающие научные задачи. Язык программирования Python обладает ясным и понятным синтаксисом, и потому легко учится и хорошо подходит для введения в программирование. Это позволит нам не отвлекаться от решаемой задачи на особенности языка и их объяснение, позволит естественным образом последовательно вводить новые инструменты.Целью домашней работы является освоение таких элементов разведывательного анализа данных, как первичный анализ данных выбранного файла, выявить наличие ошибочных данных и выбросов, их фильтрация (сортировка), построение качественной модели данных. ОСНОВНАЯ ЧАСТЬДля анализа данных был выбран датасет состоящий из данных о технических характеристиках персональных компьютеров и их стоимости (Computers.csv). Данный датасет был получен с бесплатного сайта с базами данных https://vincentarelbundock.github.io/Rdatasets/datasets.html.
Определяем, что данный датесет состоит из 6258 строк и 11 столбцов. Так как столбец «Numbers» дублирует столбец с порядковым номером строки, который создает подгруженная библиотека «pandas», удаляем данный столбец из датасета, алгоритм приведен на рисунке 2. Далее нам необходимо определить наличие ячеек с отсутствующей информацией, алгоритм по поиску данных ячеек приведен на рисунке 3.
Согласно алгоритму, приведенному на рисунке 3, мы определили, что в данном датасете отсутствуют пустые ячейки без данных. Для учебных целей добавим в загруженный датасет пустые ячейки, а также обнулим некоторые числовые данные с целью создания ошибочных данных. Определим количество пустых ячеек в искусственно обновленном файле (см. рис. 4).
Далее определяем тип информации в каждом столбце, текстовая или числовая (см. рис. 5).
Далее определим, данные по каждому столбцу (количество занятых ячеек, среднее значение, минимальное значение, максимальное значение и т.д.) (см.рис.6).
Определяем наличие выбросов для столбца «price» (см. рис. 7). Полученные результаты показывают, что выбросы в данном столбце присутствуют. Также согласно рисунку 6 мы можем определить, что в некоторых столбцах есть ошибочные значения равные нулю.
Определяем границы выбросов (см. рис. 9).
Устраняем выбросы, выходящие за границы квартилей (границы допустимых значений) (см. рис. 10). Также по рисунку 10 видно, что строки с нулевым значением также отброшены. Повторяем данный алгоритм ко всему датасету.
Построим отдельную матрицу с наиболее коррелирующими столбцами «price», «hd» и «ram» (см. рис. 13).
Строим модель и определяем ее качество (см. рис. 14).
Так как коэффициент детерминации заключен в пределах от 0,5 до 0,8, согласно рисунку 14, то качество полученной модели является удовлетворительным. ЗАКЛЮЧЕНИЕВ результате выполнения домашней работы и оформления отчета мною были освоены такие элементы разведывательного анализа данных, как первичный анализ данных выбранного файла, выявить наличие ошибочных данных и выбросов, их фильтрация (сортировка), построение качественной модели данных. СПИСОК ЛИТЕРАТУРЫ
ВВЕДЕНИЕ 3
ОСНОВНАЯ ЧАСТЬ 4
1.Первичный анализ данных 4
2.Выявление ошибок и выбросов 7
3.Устранение ошибок и выбросов 8
4.Сортировка данных 9
5.Построение модели 9
ЗАКЛЮЧЕНИЕ 12
СПИСОК ЛИТЕРАТУРЫ 13
-
Первичный анализ данных
|
| Рисунок 1. Общий вид датасета |
Определяем, что данный датесет состоит из 6258 строк и 11 столбцов. Так как столбец «Numbers» дублирует столбец с порядковым номером строки, который создает подгруженная библиотека «pandas», удаляем данный столбец из датасета, алгоритм приведен на рисунке 2. Далее нам необходимо определить наличие ячеек с отсутствующей информацией, алгоритм по поиску данных ячеек приведен на рисунке 3.
|
| Рисунок 2. Исправленная шапка датасета |
|
| Рисунок 3. Количество ячеек с отсутствующей информацией в каждом столбце |
|
| Рисунок 4. Новое количество ячеек с отсутствующей информацией в каждом столбце |
|
| Рисунок 5. Информация о данных столбцов в датасете |
|
| Рисунок 6. Данные об информации в каждом столбце |
-
Выявление ошибок и выбросов
Определяем наличие выбросов для столбца «price» (см. рис. 7). Полученные результаты показывают, что выбросы в данном столбце присутствуют. Также согласно рисунку 6 мы можем определить, что в некоторых столбцах есть ошибочные значения равные нулю.
|
| Рисунок 7. Новое количество ячеек с отсутствующей информацией в каждом столбце |
-
Устранение ошибок и выбросов
|
| Рисунок 8. Удаление строк с пустыми ячейками и новое количество строк |
|
| Рисунок 9. Определение границ выбросов |
|
| Рисунок 10. Данные об обновленных значениях столбца «price» |
-
Сортировка данных
|
| Рисунок 11. Отфильтрованные данные |
-
Построение модели
|
| Рисунок 12. Корреляционная матрица для всего датасета |
|
| Рисунок 13. Корреляционная матрица для наиболее подходящих столбцов |
|
| Рисунок 14. Показатели качества созданной модели |
-
Python в рамках курса Big Data [электронный ресурс] // ПЯВУ для студентов МГСУ : [сайт]. URL: https://www.sites.google.com/site/mgsuzsp/python-big-data (дата обращения: 04.06.2022). -
Программирование и научные вычисления на языке Python [электронный ресурс] // Викиверситет : [сайт]. URL: https://ru.wikiversity.org/wiki/Программирование_и_научные_вычисления_на_языке_Python (дата обращения: 04.06.2022). -
Datasets : [сайт]. URL: https://vincentarelbundock.github.io/Rdatasets/datasets.html (дата обращения: 04.06.2022).