Добавлен: 24.04.2023
Просмотров: 1080
Скачиваний: 24
ВВЕДЕНИЕ
Машинное обучение – это обширный раздел связанный с искусственным интеллектом. Машинное обучение изучает методы построения алгоритмов, которые способны самостоятельно изучаться или воспринимать опыт и знания у экспертов в виде базы знаний.
Сама идея создания искусственного интеллекта или правильнее сказать подобия человека, который будет моделировать человеческий разум для решения сложных задач зародилась ещё в древние времена. Но первым экспериментатором и по совместительству родоначальником искусственного интеллекта необходимо считать ученого и философа родившийся в Майорке (нынешней Испании) Раймонд Луллий, который в 14 веке попытался создать механическую машину для решения различных задач, на основе разработанной им классификации понятий, связанные с комбинаторикой. И после него было много попыток продолжения этой идеи создания нечто похожего на разум.
Окончательное рождение искусственного интеллекта как научного направления произошло только после создания ЭВМ в 40-х годах ХХ века, людям уже тогда было любопытно, могут ли компьютеры обучаться. Если мы осознаем, как запрограммировать их для самообучения, чтобы они улучшались автоматически от каждого байта информации в нем, то исходом может быть... Представьте человека который выучился в мед. Вузе, данный врач способен определить болезнь и какие виды лечения более эффективны, а теперь представьте, что те же знания и опыт множества врачей передать компьютеру, но накапливая опыт он способен это делать быстрее и точнее, а также при обнаружение новых болезней сможет определить угрозу новой болезни и выявить максимально эффективные способы лечения. Но в отличие от человека это можно будет делать без посещения врача или просто анализировать результаты исследований и выдавать высокоточные «врачебные рекомендации». Или дома, обучающиеся на опыте, оптимизировать энергетические издержки, основываясь на обычных данных употребления энергии его жителями; или персональная компьютерная программа, которая изучает изменения интересов своих пользователей, чтобы поместить на передний план, главным образом, ту новость из сегодняшних утренних газет, которая была бы уместна конкретному пользователю.
Умение научить компьютер самообучению могло бы открыть новые уровни знания, компетентности, производительности. И подробное понимание информационной обработки алгоритмов для машинного обучения могло бы привести также к лучшему пониманию человеческой обучающей способности.
Целью данной курсовой работы является разбор понятий и определений, которые связанны с машинным обучением, как работает машинное обучение, где уже работает машинное обучение, как может помочь в экономике машинное обучение и какие проблемы для экономики ещё не решены.
Глава 1: Анализ проблемной области и постановка задач
-
-
Интеллектуальный анализ данных
-
Интеллектуальный анализ данных представляет собой процесс обнаружения пригодных к использованию сведений в крупных наборах данных. В интеллектуальном анализе данных применяется математический анализ для выявления закономерностей и тенденций, существующих в данных. Обычно такие закономерности нельзя обнаружить при традиционном просмотре данных, поскольку связи слишком сложны, или из-за чрезмерного объема данных. Таким образом получаем что у нас есть некая информация, которую будем анализировать математическими, статистическими и другими методами для понимая, что из себя представляет данная информация и на сколько она полезна.
Давайте чуть подробнее разберемся как формируется весь процесс интеллектуального анализ в машинном обучении:
- Подготовка данных к анализу.
Термин "OLAP" напрямую связан с таким термином как "хранилище данных".
Данные в хранилище данных попадают из оперативных систем (транзакционных систем или OLTP-систем,), которые работают с маленькими по размерам данными, но подгружаемые огромным потоком, и они предназначены для автоматизации бизнес-процессов. Кроме того, хранилище может пополняться за счет внешних источников, как например статистические отчеты.
Задача хранилища - предоставить данные для анализа в одном месте в простой и удобной для системы структуре, для последующей работы с данными внутри неё.
Так же причиной появления отдельного хранилища служит сложные аналитические запросы к оперативной информации, которые тормозят текущую работу компании, надолго блокируя таблицы данных и захватывая ресурсы сервера, а могу при слабых мощностях серверов и вовсе оставить (повиснуть) рабочий процесс.
Централизованная и удобная структура - это далеко не все, что нужно для аналитики данных, так же необходимы инструмент для просмотра и визуализации информации. Традиционные отчеты, лишены гибкости из-за чего невозможно получить желаемого представления данных. Таким инструментом и выступает OLAP, который позволяет разворачивать и сворачивать данные в простые и удобные кучки информации для восприятия.
Хотя OLAP и не представляет собой необходимый атрибут хранилища данных, он все чаще и чаще применяется для анализа накопленных в этом хранилище сведений.
Оперативные данные собираются из разных источников, очищаются, интегрируются и складываются в реляционное хранилище. При этом они уже доступны для анализа при помощи различных средств построения отчетов. Затем данные подготавливаются для OLAP-анализа. Они могут быть загружены в специальную базу данных OLAP или оставлены в реляционном хранилище. Важнейшим его элементом являются метаданные, т. е. информация о структуре, размещении и трансформации данных. Благодаря им обеспечивается эффективное взаимодействие различных компонентов хранилища.
Как итог, можно определить OLAP как совокупность средств многомерного анализа данных, накопленных в хранилище.
Оперативный анализ данных.
В основе концепции OLAP лежит принцип многомерного представления данных. Недостатком реляционной модели, в первую очередь можно назвать невозможность объединять, просматривать и анализировать данные с точки зрения множественности измерений. В 1993 году британский ученый Эдгар Кодд и определил общие требования к системам OLAP, расширяющие функциональность реляционных систем управления базы данных(СУБД) и включающим многомерный анализ как одну из своих характеристик.
По мнению Эдгара Кодда, многомерное концептуальное представление данных представляет собой множественную перспективу, состоящую из нескольких независимых измерений, вдоль которых могут быть проанализированы определенные совокупности данных.
Одновременный анализ по нескольким измерениям и есть как раз многомерный анализ. Каждое измерение включает направления консолидации данных, состоящие из серии последовательных уровней обобщения, где каждый вышестоящий уровень соответствует большей степени агрегации данных по соответствующему измерению.
К примеру, измерение «Исполнитель» может определяться направлением консолидации, состоящим из следующих уровней: предприятие, управление, подразделение, отдел (рис.1). Измерение «Время» может даже включать два направления консолидации: 1 уровень: год, квартал, месяц и день; 2 уровень: номер недели и день; всё из-за того, что счет времени по месяцам и по неделям несовместим. В этом случае становится возможным произвольный выбор желаемого уровня детализации информации по каждому из измерений.
Операция спуска соответствует движению от высших ступеней консолидации к низшим; напротив, операция подъема означает движение от низших уровней к высшим:
Рис.1 Уровни детализации информации.
- Интеллектуальный анализ данных (Data Mining)
Основу методов data mining составляют всевозможные методы классификации, моделирования и прогнозирования.
Основная цель технологии – поиск и выявление в данных скрытые связи и взаимозависимости с целью наглядного представления результатов вычислений (визуализация), что позволяет использовать инструментарий data mining людьми, не имеющими специальной математической подготовки. Технология включает в себя методы поиска новой информации в данных, подразумевающие использование математических алгоритмов (статистика, оптимизация, корреляция и др.), позволяющих находить эти зависимости и синтезировать дедуктивную информацию.
- Извлечение знаний из баз данных
Технология представляет новое направление в области data mining, где процесс поиска закономерностей в данных рассматривается как процесс машинного обучения. Технология объединяет в себе вопросы моделирования закономерностей и зависимостей в базах данных, а также определяет математические методы построения систем добычи новых данных на основе методов классификации, кластеризации, построения деревьев решений и др.
-
-
Обнаружение знаний в базах данных
-
Термин «Обнаружение знаний в базах данных», или сокращенно KDD (Knowledge Discovery in Databases), относится к широкому процессу поиска знаний в данных и подчеркивает «высокоуровневое» применение определенных методов интеллектуального анализа данных. Он представляет интерес для исследователей в области машинного обучения, распознавания образов, баз данных, статистики, искусственного интеллекта, приобретения знаний для экспертных систем и визуализации данных.
Объединяющей целью процесса обнаружения знаний в базах данных является извлечение знаний из данных в контексте больших баз данных.
Это достигается путем использования методов (алгоритмов) интеллектуального анализа данных для извлечения (идентификации) того, что считается знаниями, в соответствии со спецификациями мер и пороговых значений, с использованием базы данных вместе с любой необходимой предварительной обработкой, подвыборкой и преобразованиями этой базы данных
Краткое описание шагов процесса KDD:
1. отбор данных, где данные, относящиеся к задаче анализа, взяты из базы данных;
2. очистка данных, то есть управление шумными, ошибочными, отсутствующими (перебойными) или несоответствующими данными;
3. интегрирование данных (обогащение), где множественные разнородные данные могут быть объединены в один;
- преобразование данных (кодирование), где данные преобразованы или объединены в формы, соответствующие различным алгоритмам анализа данных;
- добыча знаний из данных, который является существенным процессом, где интеллектуальные методы применяются, чтобы извлечь скрытое и ценное знание из данных;
- представление знания - это представление добытого знания пользователю с помощью визуализации и методов представления знания.
Рис.2 процесс KDD
-
-
Data mining (добыча знаний из данных)
-
Двумя первостепенными целями интеллектуального анализа данных на практике являются предсказание и описание.
- Прогнозирование предполагает использование некоторых переменных или полей в базе данных для прогнозирования неизвестных или будущих значений других переменных, представляющих интерес.
- Описание фокусируется на поиске интерпретируемых человеком паттернов, описывающих данные.
Относительная важность прогнозирования и описания для конкретных приложений интеллектуального анализа данных может значительно различаться. Однако в контексте KDD описание имеет тенденцию быть более важным, чем предсказание. Это в отличие от приложений распознавания образов и машинного обучения (таких как распознавание речи), где прогнозирование часто является основной целью процесса KDD.
Цели прогнозирования и описания достигаются с помощью следующих основных задач интеллектуального анализа данных:
- Классификация - это изучение функции, которая отображает (классифицирует) элемент данных в один из нескольких предопределенных классов.
- Регрессия - это изучение функции, которая отображает элемент данных в вещественные переменные прогнозирования.
- Кластеризация - это общая описательная задача, при которой каждый стремится определить конечный набор категорий или кластеров для описания данных.