Файл: Технологии интеллектуального анализа данных (Технологии интеллектуального анализа данных)..pdf

ВУЗ: Не указан

Категория: Реферат

Дисциплина: Не указана

Добавлен: 06.07.2023

Просмотров: 138

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

3.8. Обработка с запоминанием

При всех основных методах часто имеет смысл записывать и

впоследствии изучать полученную информацию. Для некоторых методов это

совершенно очевидно. Например, при построении последовательных моделей и

обучении в целях прогнозирования анализируются исторические данные из

разных источников и экземпляров информации.

В других случаях этот процесс может быть более ярко выраженным.

Деревья решений редко строятся один раз и никогда не забываются. При

выявлении новой информации, событий и точек данных может понадобиться

построение дополнительных ветвей или даже совершенно новых деревьев.

Некоторые из этих процессов можно автоматизировать. Например,

построение прогностической модели для выявления мошенничества с

кредитными картами сводится к определению вероятностей, которые можно

использовать для текущей транзакции, с последующим обновлением этой

модели при добавлении новых (подтвержденных) транзакций. Затем эта

информация регистрируется, так что в следующий раз решение можно будет

принять быстрее.

4. ПОЛУЧЕНИЕ И ПОДГОТОВКА ДАННЫХ

Сам интеллектуальный анализ данных опирается на построение

подходящей модели и структуры, которые можно использовать для обработки,

выявления и создания необходимой информации. Независимо от формы и

структуры источника данных, информация структурируется и организуется в

соответствии с форматом, который позволяет выполнять интеллектуальный

анализ данных с максимально эффективной моделью.

Подумайте о комбинировании бизнес-требований по интеллектуальному

анализу данных с выявлением существующих переменных (покупатель,

стоимость, страна) и созданием новых переменных, которые можно

использовать для анализа данных на подготовительном этапе.

Аналитические переменные для данных, полученных из множества

различных источников, можно составить в единую, определенную структуру

(например, создать класс покупателей определенных уровней и возрастов или

класс ошибок определенного типа).

В зависимости от источника данных важно выбрать правильный способ

построения и преобразования этой информации, каким бы ни был метод


окончательного анализа данных. Этот шаг также ведет к более сложному

процессу выявления, сбора, упрощения или расширения информации в

соответствии с входными данными (см. рисунок 5).

Рисунок 5. Подготовка данных

Источник данных, местоположение и база данных влияют на то, как

будет обрабатываться и объединяться информация.

4.1. Опора на SQL

Наиболее простым из всех подходов часто служит опора на базы данных

SQL. SQL (и соответствующая структура таблицы) хорошо понятен, но

структуру и формат информации нельзя игнорировать полностью. Например,

при изучении поведения пользователей по данным о продажах в модели данных

SQL (и интеллектуального анализа данных в целом) существуют два основных

формата, которые можно использовать: транзакционный и поведенческодемографический.

При работе с InfoSphere Warehouse создание поведенческодемографической модели в целях анализа данных о покупателях для понимания

моделей их поведения предусматривает использование исходных данных SQL,

основанных на информации о транзакциях, и известных параметров

покупателей с организацией этой информации в заранее определенную

табличную структуру. Затем InfoSphere Warehouse может использовать эту

информацию для интеллектуального анализа данных методом кластеризации и

классификации с целью получения нужного результата. Демографические

данные о покупателях и данные о транзакциях можно скомбинировать, а затем

преобразовать в формат, который допускает анализ определенных данных, как

показано на рисунке 6.

Рисунок 6. Специальный формат анализа данных

Например, по данным о продажах можно выявить тенденции продаж

конкретных товаров. Исходные данные о продажах отдельных товаров можно

преобразовать в информацию о транзакциях, в которой идентификаторы

покупателей сопоставляются с данными транзакций и кодами товаров.

Используя эту информацию, легко выявить последовательности и отношения

для отдельных товаров и отдельных покупателей с течением времени. Это

позволяет InfoSphere Warehouse вычислять последовательную информацию,

определяя, например, когда покупатель, скорее всего, снова приобретет тот же

товар.

Из исходных данных можно создавать новые точки анализа данных.

Например, можно развернуть (или доработать) информацию о товаре путем

сопоставления или классификации отдельных товаров в более широких