Добавлен: 24.04.2023
Просмотров: 1082
Скачиваний: 24
- С кластеризацией тесно связана задача оценки плотности вероятности, которая состоит из методов оценки, основанной на данных, совместной многовариантной функции плотности вероятности всех переменных / полей в базе данных.
- Суммирование включает в себя методы поиска компактного описания для подмножества данных.
-
Моделирование зависимостей состоит в нахождении модели, которая описывает существенные зависимости между переменными.
Модели зависимости существуют на двух уровнях:
- Структурный уровень модели специфицирует (часто графически) какие переменные локально зависят друг от друга;
- Количественный уровень модели определяет сильные стороны зависимостей, используя некоторую числовую шкалу.
-
Обнаружение изменений и отклонений направлено на выявление наиболее значительных изменений данных по ранее измеренным или нормативным значениям.
-
Machine learning (машинное обучение)
-
Алгоритмы машинного обучения используют статистику для поиска шаблонов в огромных объемах данных. И данные здесь включают в себя множество вещей - цифры, слова, изображения, щелчки… Если информация может храниться в цифровом виде, она может быть введена в алгоритм машинного обучения.
Обозначим входной набор данных как X и набор выходных данных как Y. Будет принято, что i-ый элемент X (обозначенный как xi) имеет соответствующий выходной элемент yi. Пара {xi, yi} названа тогда примером. Элементы X также могут быть названы входными примерами (отдельными случаями).
Рис. 3 Машинное обучение.
Рисунок 4 показывает процесс машинного обучения. ML модель, на основе примеров данных, пробует "учить" целевую функцию Y=f(X), которая характеризует поведение реальной системы.
Обучение - это процесс уменьшения отличий между наблюдаемыми данными и модели выхода (погрешность модели). После изучения, модель ML, пополняемая новыми входами, может прогнозировать, какой для новой входного xi генерируется набор выходных данных yi, величина которого близка к той, что произвела бы реальная система.
Вообще говоря, задача машинного обучения содержит три больших компонента: образцовая архитектура (или функциональный класс) М., который имеет набор регулируемых параметров P и измеренных данных D. Пример М. может быть многочлен данного порядка, где P - коэффициенты. Цель состоит в том, чтобы определить образцовую архитектуру М. и величины параметров P, которые могут привести к лучшему соглашению, в некотором роде, между прогнозами модели и данными D.
Рис. 4 Линейная регрессия, как модель машинного обучения.
Один из самых простых примеров модели машинного обучения - модель линейной регрессии (М. - линейная функция); в этом на основе наблюдений алгоритм обучен, приблизительно воспроизводить действительное значение. Методы машинного обучения позволяют построить модели, которые являются намного более точными, чем линейные.
-
-
Основные алгоритмы моделей машинного обучения (методы принятия решений)
-
Провести сравнительный анализ основных направлений искусственного интеллекта, найти соотношение и взаимосвязь таких дисциплин: машинное обучение, интеллектуальный анализ данных, добыча знаний из данных, нахождение закономерностей в базах данных.
- Дерево принятия решений
Это метод поддержки принятия решений, основанный на использовании древовидного графа: модели принятия решений, которая учитывает их потенциальные последствия (с расчётом вероятности наступления того или иного события), эффективность, ресурсозатратность.
Для бизнес-процессов это дерево складывается из минимального числа вопросов, предполагающих однозначный ответ — «да» или «нет». Последовательно дав ответы на все эти вопросы, мы приходим к правильному выбору. Методологические преимущества дерева принятия решений – в том, что оно структурирует и систематизирует проблему, а итоговое решение принимается на основе логических выводов.
- Наивная байесовская классификация
Наивные байесовские классификаторы относятся к семейству простых вероятностных классификаторов и берут начало из теоремы Байеса, которая применительно к данному случаю рассматривает функции как независимые (это называется строгим, или наивным, предположением). На практике используется в следующих областях машинного обучения:
- определение спама, приходящего на электронную почту;
- автоматическая привязка новостных статей к тематическим рубрикам;
- выявление эмоциональной окраски текста;
- распознавание лиц и других паттернов на изображениях.
- Метод наименьших квадратов
Всем, кто хоть немного изучал статистику, знакомо понятие линейной регрессии. К вариантам её реализации относятся и наименьшие квадраты. Обычно с помощью линейной регрессии решают задачи по подгонке прямой, которая проходит через множество точек. Вот как это делается с помощью метода наименьших квадратов: провести прямую, измерить расстояние от неё до каждой из точек (точки и линию соединяют вертикальными отрезками), получившуюся сумму перенести наверх. В результате та кривая, в которой сумма расстояний будет наименьшей, и есть искомая (эта линия пройдёт через точки с нормально распределённым отклонением от истинного значения).
Линейная функция обычно используется при подборе данных для машинного обучения, а метод наименьших квадратов – для сведения к минимуму погрешностей путем создания метрики ошибок.
- Логистическая регрессия
Логистическая регрессия – это способ определения зависимости между переменными, одна из которых категориально зависима, а другие независимы. Для этого применяется логистическая функция (аккумулятивное логистическое распределение). Практическое значение логистической регрессии заключается в том, что она является мощным статистическим методом предсказания событий, который включает в себя одну или несколько независимых переменных. Это востребовано в следующих ситуациях:
- кредитный скоринг;
- замеры успешности проводимых рекламных кампаний;
- прогноз прибыли с определённого товара;
- оценка вероятности землетрясения в конкретную дату.
- Метод опорных векторов (SVM)
Это целый набор алгоритмов, необходимых для решения задач на классификацию и регрессионный анализ. Исходя из того, что объект, находящийся в N-мерном пространстве, относится к одному из двух классов, метод опорных векторов строит гиперплоскость с мерностью (N – 1), чтобы все объекты оказались в одной из двух групп. На бумаге это можно изобразить так: есть точки двух разных видов, и их можно линейно разделить. Кроме сепарации точек, данный метод генерирует гиперплоскость таким образом, чтобы она была максимально удалена от самой близкой точки каждой группы.
SVM и его модификации помогают решать такие сложные задачи машинного обучения, как сплайсинг ДНК, определение пола человека по фотографии, вывод рекламных баннеров на сайты.
- Метод ансамблей
Он базируется на алгоритмах машинного обучения, генерирующих множество классификаторов и разделяющих все объекты из вновь поступающих данных на основе их усреднения или итогов голосования. Изначально метод ансамблей был частным случаем байесовского усреднения, но затем усложнился и оброс дополнительными алгоритмами:
- бустинг (boosting) – преобразует слабые модели в сильные посредством формирования ансамбля классификаторов (с математической точки зрения это является улучшающим пересечением);
- бэггинг (bagging) – собирает усложнённые классификаторы, при этом параллельно обучая базовые (улучшающее объединение);
- корректирование ошибок выходного кодирования.
Метод ансамблей – более мощный инструмент по сравнению с отдельно стоящими моделями прогнозирования, поскольку:
- он сводит к минимуму влияние случайностей, усредняя ошибки каждого базового классификатора;
- уменьшает дисперсию, поскольку несколько разных моделей, исходящих из разных гипотез, имеют больше шансов прийти к правильному результату, чем одна отдельно взятая;
- исключает выход за рамки множества: если агрегированная гипотеза оказывается вне множества базовых гипотез, то на этапе формирования комбинированной гипотезы оно расширяется при помощи того или иного способа, и гипотеза уже входит в него.
- Алгоритмы кластеризации
Кластеризация заключается в распределении множества объектов по категориям так, чтобы в каждой категории – кластере – оказались наиболее схожие между собой элементы.
- Кластеризировать объекты можно по разным алгоритмам. Чаще всего используют следующие:
- на основе центра тяжести треугольника;
- на базе подключения;
- сокращения размерности;
- плотности (основанные на пространственной кластеризации);
- вероятностные;
- машинное обучение, в том числе нейронные сети.
Алгоритмы кластеризации используются в биологии (исследование взаимодействия генов в геноме, насчитывающем до нескольких тысяч элементов), социологии (обработка результатов социологических исследований методом Уорда, на выходе дающим кластеры с минимальной дисперсией и примерно одинакового размера) и информационных технологиях.
- Метод главных компонент (PCA)
Метод главных компонент, или PCA, представляет собой статистическую операцию по ортогональному преобразованию, которая имеет своей целью перевод наблюдений за переменными, которые могут быть как-то взаимосвязаны между собой, в набор главных компонент – значений, которые линейно не коррелированы.
Практические задачи, в которых применяется PCA, – визуализация и большинство процедур сжатия, упрощения, минимизации данных для того, чтобы облегчить процесс обучения. Однако метод главных компонент не годится для ситуаций, когда исходные данные слабо упорядочены (то есть все компоненты метода характеризуются высокой дисперсией). Так что его применимость определяется тем, насколько хорошо изучена и описана предметная область.
- Сингулярное разложение
В линейной алгебре сингулярное разложение, или SVD, определяется как разложение прямоугольной матрицы, состоящей из комплексных или вещественных чисел. Так, матрицу M размерностью [m*n] можно разложить таким образом, что M = UΣV, где U и V будут унитарными матрицами, а Σ – диагональной.
Одним из частных случаев сингулярного разложения является метод главных компонент. Самые первые технологии компьютерного зрения разрабатывались на основе SVD и PCA и работали следующим образом: вначале лица (или другие паттерны, которые предстояло найти) представляли в виде суммы базисных компонент, затем уменьшали их размерность, после чего производили их сопоставление с изображениями из выборки. Современные алгоритмы сингулярного разложения в машинном обучении, конечно, значительно сложнее и изощрённее, чем их предшественники, но суть их в целом нем изменилась.
- Анализ независимых компонент (ICA)
Это один из статистических методов, который выявляет скрытые факторы, оказывающие влияние на случайные величины, сигналы и пр. ICA формирует порождающую модель для баз многофакторных данных. Переменные в модели содержат некоторые скрытые переменные, причем нет никакой информации о правилах их смешивания. Эти скрытые переменные являются независимыми компонентами выборки и считаются негауссовскими сигналами.
В отличие от анализа главных компонент, который связан с данным методом, анализ независимых компонент более эффективен, особенно в тех случаях, когда классические подходы оказываются бессильны. Он обнаруживает скрытые причины явлений и благодаря этому нашёл широкое применение в самых различных областях – от астрономии и медицины до распознавания речи, автоматического тестирования и анализа динамики финансовых показателей.
Глава 2: Выявление соотношение дисциплин и как машинное обучение помогает.
-
-
Анализ соотношений дисциплин.
-
В анализе проблемной области были рассмотрены основные понятия данных дисциплин, которые требуется соотнести. Для наглядности существующей проблемы взаимосвязи некоторых направлений искусственного интеллекта, определения были приведены из нескольких источников. Как было показано, из-за новизны самой науки существует множество мнений, определений, классификаций. В связи с бурным развитием этого направления информатики мы сталкиваемся с проблемой однозначности.