Добавлен: 24.04.2023
Просмотров: 1085
Скачиваний: 24
Можно сказать, что интеллектуальный анализ данных (IDA) имеет дело с приложением методов Искусственного интеллекта для анализа данных, пересекая разнообразие дисциплин. Эти методы включают: все области визуализации данных, предварительной обработки данных (объединение, редактирование, преобразование, фильтрование, осуществление выборки), разработка данных, data mining - методы базы данных и приложения, использование знаний проблемной области в анализе данных, эволюционных алгоритмах, машинном обучении, нейронных сетях, нечеткой логике, статистическом распознавании образов, фильтровании знания, и последующей обработке.
Машинное обучение, интеллектуальный анализ данных, добыча знаний из данных, нахождение закономерностей в базах данных, можно сказать, относятся к одной и той же междисциплинарной области. Это трудно, если вообще возможно, совместить в общем определении несоизмеримые области с их собственными установленными специализациями, такие как: нечеткие наборы (fuzzy sets), нейронные сети (neural networks), эволюционное вычисление (evolutionary computation), машинное обучение (machine learning), методы Байеса и т.д. Обычно один или группа исследователей, если находят область, которая слегка отличается от уже существующей, то организовывают пресс-конференцию, публикуют в журналах, утверждаются профессорством и т.д. Это то, что и случалось с областями близкими к искусственному интеллекту в течение последних двух десятилетий. Добыча знаний из данных (DM), нахождение закономерностей в базах данных (KDD), вычислительный интеллект (CI), машинное обучение (ML), интеллектуальный анализ данных (IDA) - все эти области, очень пересекающиеся, с очень подобным направлениями и прикладными областями. Действительно трудно найти явную границу различия между ними. Но можно сформулировать некоторые отличия:
- IDA относительно новое направление и применяется больше в анализе данных в медицине и исследованиях, научной работе. Методы использованный - также из статистики и машинного обучения;
- ML - это область информатики, направление искусственного интеллекта, которое концентрируется на теоретических основах. Задачи классификации (распознавания образов) решаются методами машинного обучения чаще, чем задачи регрессии (численный прогноз). С технической точки зрения, большинство задач ML могут быть сформулированы как задачи аппроксимации функции.
- DM и KDD обычно предназначены для очень больших баз данных и связаны с приложениями в банковских, финансовых услугах и управлениях cсредствами клиента. Используемые методы, главным образом, из статистики и машинного обучения.
В результате проделанной работы была построена приблизительная диаграмма соотношений дисциплин, на которой я попыталась показать зависимость data mining (добыча знаний из данных) и knowledge discovery in databases (обнаружение знаний в базах данных), роль KDD в процессе интеллектуального анализа данных. Требовалось определить влияние машинного обучения на все эти дисциплины, выяснить какие методы какой дисциплины больше используются и какие более важные.
Из диаграммы видно, что интеллектуальный анализ данных является наиболее общей дисциплиной, которая включает в себя и KDD и DM соответственно, так как DM является одним из этапов нахождения знания в базах данных.
Влияние машинного обучения играет значительную роль, оно является теоретическим базисом для извлечения знаний. Все перечисленные дисциплины используют многие методы заимствованные из этого направления искусственного интеллекта: деревья решений, модель и деревья регрессии, искусственные нейронные сети, методы Байеса, включая вероятностные сети (belief networks), укрепление обучения (Q-обучение), Статистическая теория изучения и Машины Вектора Основания (SVM).
Рис5. Диаграмма соотношений
Интеллектуальный анализ данных включает в себя множество процессов, в том числе и нахождение знаний в базах данных (КДД).
Процесс нахождения знаний состоит из таких этапов: отбор данных, очистка данных, интегрирование данных, преобразование данных, добыча знаний из данных, представление знания.
Data mining (подготовка, понижение, обнаружение нового знания) использует такие методы: автоматическая классификация, распознавание изображений (также называют анализом данных), идентификация тенденций (включая Статистические методы подобно ARIMA), нормализация данных, сглаживание, восстановление данных, ассоциативные правила и деревья решений, нейронные сети, нечеткие системы, эволюционные и другие глобальные методы оптимизации, некоторое из которых взяты из машинного обучения.
-
-
Проблемы, решаемые методами машинного обучения
-
В последние годы машинное обучение и искусственный интеллект приобрели известность благодаря тому, что Google, Microsoft Azure и Amazon предлагают свои платформы облачного машинного обучения. Но удивительно, что мы испытываем машинное обучение, не зная этого. Наиболее распространенными вариантами использования являются маркировка изображений с помощью Facebook и обнаружение спама почтовыми провайдерами. Теперь Facebook автоматически помечает загруженные изображения, используя технику распознавания лиц (изображений), а Gmail распознает шаблон или выбранные слова для фильтрации спам-сообщений. Давайте посмотрим на некоторые важные бизнес-проблемы, решаемые с помощью машинного обучения.
- Ручной ввод данных
Неточность и дублирование данных являются основными проблемами бизнеса для организации, которая хочет автоматизировать свои процессы. Алгоритмы машинного обучения (ML) и алгоритмы прогнозного моделирования могут значительно улучшить ситуацию. Программы ML используют обнаруженные данные для улучшения процесса по мере выполнения дополнительных расчетов. Таким образом, машины могут научиться выполнять трудоемкую документацию и задачи ввода данных. Кроме того, работники умственного труда теперь могут тратить больше времени на решение более важных задач. Компания Arria разработала технологию обработки естественного языка, которая сканирует тексты и определяет отношения между концепциями для написания отчетов.
- Обнаружение спама
Обнаружение спама - самая ранняя проблема, решаемая машинным обучением. Четыре года назад поставщики услуг электронной почты использовали существующие методы, основанные на правилах, для удаления спама. Но теперь фильтры спама сами создают новые правила, используя машинное обучение. Благодаря «нейронным сетям» в своих фильтрах спама, Google теперь может похвастаться 0,1 процентами спама. Подобные мозгу «нейронные сети» в своих фильтрах спама могут научиться распознавать нежелательную почту и фишинговые сообщения, анализируя правила на огромной коллекции компьютеров. В дополнение к обнаружению спама, сайты социальных сетей используют машинное обучение как способ выявления и фильтрации злоупотреблений.
- Рекомендация продукта
Обучение без учителя позволяет использовать систему рекомендаций по продукту. Учитывая историю покупок для покупателя и большой запас товаров, модели машинного обучения могут идентифицировать те товары, в которых этот покупатель будет заинтересован и может совершить покупку. Алгоритм идентифицирует скрытый образец среди предметов и сосредотачивается на группировании подобных продуктов в кластеры. Модель этого процесса принятия решения позволила бы программе давать рекомендации клиенту и мотивировать покупки продукта. У компаний электронной коммерции, таких как Amazon, есть такая возможность. Фейсбук обучает неконтролируемое обучение вместе с информацией о местоположении, чтобы рекомендовать пользователям подключаться к другим пользователям.
- Медицинский диагноз
Машинное обучение в медицинской сфере улучшит здоровье пациента с минимальными затратами. В случаях использования ML ставят почти идеальные диагнозы, рекомендуют лучшие лекарства, прогнозируют повторную госпитализацию и выявляют пациентов с высоким риском. Общая цель состоит в том, чтобы уменьшить количество ранних госпитализаций за счет выявления ключевых факторов риска, которые вызывают повторную госпитализацию. Эти прогнозы основаны на наборе данных анонимных записей о пациентах и симптомов, выставленных пациентом. Принятие решения машинным обучением происходит быстрыми темпами, несмотря на множество препятствий, которые могут быть преодолены практиками и консультантами, которые знают правовые, технические и медицинские препятствия.
- Сегментация клиентов
Сегментация клиентов, прогнозирование оттока клиентов и прогнозирование продолжительности жизни клиента (LTV) являются основными проблемами, с которыми сталкивается любой маркетолог. Предприятия располагают огромным количеством маркетинговых релевантных данных из различных источников, таких как электронная кампания, посетители сайта и данные о потенциальных клиентах. Используя интеллектуальный анализ данных и машинное обучение, можно получить точный прогноз для отдельных маркетинговых предложений и стимулов. Используя машинное обучение, опытные маркетологи могут устранить догадки, связанные с маркетингом, управляемым данными. Например, с учетом модели поведения пользователя в течение пробного периода и прошлых поведений всех пользователей можно предсказать идентификацию вероятности перехода на платную версию. Модель этой проблемы решения позволила бы программе инициировать вмешательства клиента, чтобы убедить клиента перейти на раннюю стадию или лучше участвовать в испытании.
- Финансовый анализ
Благодаря большому объему данных, количественному характеру и точным историческим данным, машинное обучение может использоваться в финансовом анализе. Существующие варианты использования машинного обучения в финансах включают алгоритмическую торговлю, управление портфелем, обнаружение мошенничества и андеррайтинг кредита. Машинное обучение может позволить проводить постоянную оценку данных для обнаружения и анализа аномалий и нюансов, чтобы повысить точность моделей и правил. Будущие приложения ML в сфере финансов включают чат-ботов и диалоговые интерфейсы для обслуживания клиентов, безопасности и анализа настроений.
- Распознавание изображений
Компьютерное зрение производит числовую или символическую информацию из изображений и многомерных данных. Он включает в себя машинное обучение, интеллектуальный анализ данных, обнаружение базы данных и распознавание образов. Потенциальное деловое использование технологии распознавания изображений можно найти в здравоохранении, автомобилях, в маркетинговых кампаниях и т.д. Компания Baidu разработала прототип DuLight для слабовидящих, который включает в себя технологию компьютерного зрения, чтобы захватить окружение и передать интерпретацию через наушник. Маркетинговые кампании, основанные на распознавании изображений, такие как Makeup Genius от L'Oreal, способствуют социальному обмену и вовлечению пользователей.
Большинство приведенных выше вариантов использования основаны на отраслевой проблеме. Эта настройка требует высококвалифицированных ученых данных или консультантов по машинному обучению. Платформы машинного обучения, без сомнения, ускорят анализ, помогая предприятиям выявлять риски и предоставлять более качественные услуги. Но качество данных является основным камнем преткновения для многих предприятий. Таким образом, помимо знания алгоритмов машинного обучения, предприятиям необходимо структурировать данные перед использованием моделей данных машинного обучения.
-
-
Проблемы не решенные машинным обучением в экономике.
-
- Прогноз
Стандартные эконометрические модели хорошо подходят для понимания причинно-следственных связей между различными аспектами экономики, но, когда дело доходит до прогнозирования, они имеют тенденцию «перетекать» выборки и иногда плохо обобщают новые невидимые данные.
Сосредоточив внимание на проблемах прогнозирования, модели машинного обучения могут вместо этого минимизировать ошибку прогнозирования, компенсируя смещение и дисперсию. Более того, хотя эконометрические модели лучше всего сохранять относительно простыми и легко интерпретируемыми, методы машинного обучения способны обрабатывать огромные объемы данных, часто без ущерба для интерпретации.
- Эмпирический анализ.
Вторая тема заключается в том, что ключевым преимуществом машинного обучения является то, что он рассматривает эмпирический анализ как «алгоритмы», которые оценивают и сравнивают многие альтернативные модели. Этот подход контрастирует с экономикой, где в принципе исследователь выбирает модель, основанную на принципах, и оценивает ее один раз. Третья тема касается «аутсорсинга» выбора модели по алгоритму. Хотя он достаточно хорошо справляется с «простыми» проблемами, он не очень подходит для задач, представляющих наибольший интерес для эмпирических исследователей в области экономики, таких как причинно-следственная связь, где, как правило, нет объективной оценки основной истины, доступной для сравнения. Наконец, в документе отмечается, что алгоритмы также должны быть изменены, чтобы обеспечить действительные доверительные интервалы для оценочных эффектов, когда данные используются для выбора модели.