Файл: Операции, производимые с данными (Описание работы с данными).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 31.03.2023

Просмотров: 188

Скачиваний: 1

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Среди выделенных для анализа типов в исследовании будут интересовать два основных из них: окна по времени обработки и окна по времени события.

2.4 Подход к решению поставленных задач

Задачей данного параграфа является определение основных недостатков имеющихся систем обработки потоковой информации в выбранной области. Определение недостатков будет осуществляться в рамках сравнения имеющихся решений визуализации и анализа данных в режиме реального времени в формате Таблицы 2.

Таблица 2 Сравнение систем визуализации данных

Наименование критерия

Power BI

Google Data Studio

Tableau

Бесплатная версия необходима для оттачивания необходимости приобретения компанией инструмента (специфика компании часто влияет на выбор инструментария).

Имеет свободную версию для использования для любого количества отчетов единовременно.

Имеет свободную версию для использования, однако только для 5ти отчетов единовременно.

2 недели бесплатной версии с ограниченным функционалом.

Стоимость

+

+++

+++

Коннекторы данных

Все доступные на сегодняшний день инструменты обработки данных в режиме реального времени, включая GA и Microsoft Azure.

Только инструменты GA360.

Сложная и самостоятельная настройка всех гибких коннекторов данных.

На основе такого важного критерия как совместимость инструмента с источниками данных реального времени для постоянного отслеживания изменения в показателях был выбран такой инструмент как PowerBI. При этом стоит отметить, что PowerBI имеет интересное представление данных которые анализируется посредством встроенных мощных скрипnов обработки данных на языке R.

Был разработан сам R-скрипт для реализации поставленных в рамках проектирования карты вычисляемых показателей маркетинговых компаний статистическими методами анализа данных.

ggplot(data1, aes(paste(substr(date,1,4),"-",substr(date,5,6),"-", substr(date,7,8),sep=""),total_pageviews_per_user)) + geom_boxplot()

p1 + labs(title="Avg Pageviews for Users with Purchase", x = "Date", y = "Pageviews")

p1 + ylim(c(0,y_max))

p1 + theme(axis.text.x = element_text(angle = 35, hjust = 1))


Рисунок 1 Средние просмотры страниц с транзакциями


ggplot(data2, aes(paste(substr(date,1,4),"-",substr(date,5,6),"-",

substr(date,7,8),sep=""),total_pageviews_per_user)) + geom_boxplot()

p2 + labs(title="Avg Pageviews for Users without Purchase",

x = "Date", y = "Pageviews")

p2 + ylim(c(0,y_max))

p2 + theme(axis.text.x = element_text(angle = 35, hjust = 1))

Рисунок 2 Средние просмотры страниц без транзакций

Параграф 3.3.2 Средний доход по отношению к сеансу пользователя

par(mfrow=c(1,1))

ggplot(data3, aes(x = medium,y=avg_rev_per_visit,

fill=sessions,label=sessions))+

geom_bar(stat="identity")+scale_fill_gradient(low = colors()[600],

high = colors()[639])

p3 + geom_text(data=data3,aes(x=medium,

label=paste("$",round(avg_rev_per_visit,2)),

vjust=-0.5))

p3+ labs(title="Avg Revenue/Session by Medium", x = "medium",

y = "Avg Reveune per Session")

p3 + theme(plot.title = element_text(size = rel(2)))

Рисунок 3 Средний доход по отношению к сеансу пользователя

Параграф 3.3.3 Лучшие компании по доходам по отношению к сессиям

par(mfrow=c(1,1))

ggplot(data4, aes(x = campaign,y=avg_rev_per_visit,fill=sessions,

label=sessions))+geom_bar(stat="identity")+

scale_fill_gradient(low = colors()[600], high = colors()[639])

p4 + geom_text(data=data4,aes(x=campaign,label=paste("$",

round(avg_rev_per_visit,2)),vjust=-0.5))

p4 + labs(title="Top Campaigns by Rev/Session (min 10 sess)",

x = "campaign", y = "Avg Reveune per Session")

p4 + theme(plot.title = element_text(size = rel(2)))

p4 + theme(axis.text.x = element_text(angle = 25, hjust = 1))

Рисунок 4 Лучшие компании по доходам по отношению к сессиям

Параграф 3.3.4 Категория закупок продукта по средним показателям

par(mfrow=c(1,1))

qplot(category,data=data5, weight=value, geom="histogram",

fill = medium, horizontal=TRUE)+coord_flip()

p5 + labs(title="Category of Product Purchase by Medium (a)",

x = "Product Category", y = "Transactions")

p5+ theme(plot.title = element_text(size = rel(2)))

p5 + theme(axis.text.x = element_text(angle = 25, hjust = 1))

.

Рисунок 5 Категория закупок продукта по средним показателям


Параграф 3.3.5 Товарная категория закупки по средним показателям

par(mfrow=c(1,1))

ggplot(data5, aes(medium,category)) + geom_tile(aes(fill=value))+

scale_fill_gradient(name="transactions",low = "grey",high = "blue")

p6 + labs(title="Category of Product Purchase by Medium (b)",

x = "medium", y = "product category")

p6 + theme(plot.title = element_text(size = rel(2)))

Рисунок 6 Товарная категория закупки по средним показателям

Параграф 3.3.6 Вероятность продукта для указания и/или привлечения дополнительных транзакций

par(mfrow=c(1,1))

ggplot(data9, aes(x = prod_name,y=perc,fill=transactions.y,

label=perc))+

geom_bar(stat="identity")+scale_fill_gradient(name="transactions",

low = colors()[600], high = colors()[639])

p7 + geom_text(data=data9,aes(x=prod_name,

label=paste(round(perc*100,1),"%"),vjust=-0.5))

p7 + labs(title="Percentage of Transactions resulting in Future rn

Additional Transactions by same User", x = "Product Name",

y = "Percentage of Transactions")

p7 + theme(plot.title = element_text(size = rel(2)))

p7 + theme(axis.text.x = element_text(angle = 45, hjust = 1))

Рисунок 7 Вероятность продукта для указания и/или привлечения дополнительных транзакций

Заключение

В ходе информационного процесса данные преобразуются из одного вида в другой с помощью различных методов. Обработка данных включает в себя множество операций. По мере развития научно-технического прогресса и общего усложнения связей в человеческом обществе возрастают неуклонно трудозатраты на обработку данных. Прежде всего, это связано с постоянным усложнением условий управления производством и обществом. Второй фактор, также вызывающий общее увеличение объемов обрабатываемых данных, связан с научно-техническим прогрессом, а именно с быстрыми темпами появления и внедрения новых носителей данных, средств их хранения и доставки.

В структуре возможных операций с данными можно выделить следующие:

• сбор - накопление информации с целью обеспечения достаточной полноты для принятия решений;


• формализация - приведение данных, поступающих из разных источников, к одинаковой форме, чтобы сделать их сопоставимыми между собой, то есть повысить их уровень доступности;

• фильтрация - отсеивание «лишних» данных, в которых нет необходимости для принятия решений; при этом должен уменьшаться уровень «шума», а достоверность и адекватность данных должны возрастать;

• сортировка - упорядочение данных по заданному признаку с целью удобства использования; эта процедура повышает доступность информации;

• архивация - организация хранения данных в удобной и легкодоступной форме; служит для снижения экономических затрат по хранению данных и повышает общую надежность информационного процесса в целом;

• защита - комплекс мер, направленных на предотвращение утраты, воспроизведения и модификации данных;

• транспортировка - прием и передача (доставка и поставка) данных между удаленными участниками информационного процесса; при этом источник данных в информатике принято называть сервером, а потребителя - клиентом;  

• преобразование данных - перевод данных из одной формы в другую или из одной структуры в другую. Преобразование данных часто связано с изменением типа носителя, например книги можно хранить в обычной бумажной форме, но можно использовать для этого и электронную форму, и микрофотопленку. Необходимость в многократном преобразовании данных возникает также при их транспортировке, особенно если она осуществляется средствами, не предназначенными для транспортировки данного вида данных.

В рамках работы было найдено новое решение для предоставления достаточных данных специалистам по принятию управленческих решений в рамках маркетинговых компаний и выполнены все поставленные задачи в направлении решения стратегических задач выбранной компании.

Рассмотренное решение является инновационным и рядовым в сфере внутреннего анализа данных. Главным направлением дальнейшего развития исследования можно рассмотреть в двух задачах:

1) Настройка полной визуализации с участием отображения всех необходимых метрик в рамках выбранной компании.

2) Разработка подхода к анализу кросс-продаж и выбору продукта в качестве того, который может принести превосходную прибыль компании в паре с уже имеющимся передовиком отрасли.

3) Кластеризация имеющихся пользователей и унификация интерфейса главного потребителя.


Список использованной литературы

  1. x
  2. x
  3. Когаловский М.Р. Глоссарий по стандартам платформы XML. Версия 7 (17-12-2006). // Электронные библиотеки. – М.: ИРИО, 2006.
  4. The World Wide Web Consortium (W3C). XQuery 1.0: An XML Query Language : W3C Recommendation / Boag S. et al. (eds.). – 2007, 23 Jan.
  5. The World Wide Web Consortium (W3C). XQuery Update Facility 1.0 : W3C Working Draft / Chamberlin D. et al. (eds.). – 2007, 28 Aug.
  6. Лизоркин Д.А., Лисовский К.Ю. SXML: XML-документ как S-выражение // Электронные библиотеки. – М.: ИРИО, 2003. – Т. 6, вып. 2. – ISSN 1562-5419 = Russian digital libraries journal.
  7. The World Wide Web Consortium (W3C). XML Information Set : W3C recommendation / Cowan J., Tobin R. (eds.). – 2nd edition. – 2004, 4 Feb.
  8. Kiselyov O. SXML specification / Rev. 3.0. – ACM SIGPLAN Notices. – New York: ACM Press, 2002. – Vol. 37, N 6. – pp. 52-58. – ISSN 0362-1340.
  9. Kiselyov O. A better XML parser through functional programming : Proc. Practical Aspects of Declarative Languages: 4th int. symposium, PADL'2002, Portland, 19-20 Jan., 2002 // Lecture Notes in Computer Science / Krishnamurthi S., Ramakrishnan C.R. (eds.). – Springer-Verlag Heidelberg, 2002. – Vol. 2257. – pp. 209-224. – ISSN: 0302-9743.
  10. Лизоркин Д.А. Оптимизация вычисления обратных осей языка XML Path при его реализации функциональными методами // Сборник трудов Института системного программирования РАН / Под ред. чл.-корр. РАН Иванникова В.П. – М.: ИСП РАН, 2004. – Т. 8, ч. 2. – 214 c. – с. 93-119. – ISBN 5-89823-026-2.
  11. Abelson H., Sussman G.J., Sussman J. Structure and Interpretation of Computer Programs. – 2nd ed. – London; New York: The MIT Press; McGraw Hill, 1996. – 657 pp. – ISBN 0-262-01153-0.
  12. Boehm H.-J. Space efficient conservative garbage collection : Proc. conf. on Programming Language Design and Implementation (SIGPLAN'93), Albuquerque, NM, Jun. 1993 // ACM SIGPLAN Notices. – New York: ACM Press, 1993. – Vol. 28(6). – pp. 197-206; New York: ACM Press, 2004. – Vol. 39, issue 4. – pp. 490-501. – ISSN 0362-1340.
  13. Lehti P. Design and Implementation of a Data Manipulation Processor for a XML Query Language : Ph.D. thesis. – 2001, Aug.
  14. Консорциум W3C. Язык XML Path (XPath) версия 1.0 = XML Path Language (XPath) Version 1.0 : Рекомендация Консорциума W3C / Под ред. Clark J., DeRose S.; пер. с англ. Усманов Р. – 1999, 16 ноя.
  15. S. S. Chawathe, A. Rajaraman, H. Garcia-Molina and J. Widom. Change Detection in Hierarchically Structured Information. Technical report; detailed version of paper appearing in SIGMOD 1996.
  16. Igor Tatarinov, Zachary G. Ives, Alon Y. Halevy, Daniel S. Weld. Updating XML : Proc. ACM SIGMOD int. conf. on Management of Data (SIGMOD'01), Santa Barbara, California, 21-24 May, 2001 // SIGMOD Conference / Aref W.G. (ed.). – New York: ACM Press, 2001. – pp. 413-424. – ISBN 1-58113-332-4.
  17. Лизоркин Д.А., Лисовский К.Ю. Язык XML Path (XPath) и его функциональная реализация SXPath // Электронные библиотеки. – М.: ИРИО, 2003. – Т. 6, вып. 4. – ISSN 1562-5419 = Russian digital libraries journal.
  18. A. Laux, L. Martin. XUpdate update language : XML:DB Working Draft. – 14 Sep, 2000.
  19. Лизоркин Д.А., Лисовский К.Ю. Реализация XLink – языка ссылок XML – с помощью функциональных методов // Программирование. – М.: Наука, 2005. – N 1. – С. 52-72. – ISSN 0361-7688 = Programming and computer software.
  20. Лизоркин Д.А. Язык запросов к совокупности XML-документов, соединенных при помощи ссылок языка XLink // Сборник трудов Института системного программирования РАН / Под ред. чл.-корр. РАН Иванникова В.П. – М.: ИСП РАН, 2004. – Т. 8, ч. 2. – 214 c. – с. 121-153. – ISBN 5-89823-026-2; Программирование. – М.: Наука, 2005. – N 3. – ISSN 0361-7688 = Programming and computer software.
  21. The World Wide Web Consortium (W3C). Extensible Markup Language (XML) 1.0 (Fourth Edition) : W3C Recommendation / Bray T. et al. (eds.). – 2006, 16 Aug.
  22. Лизоркин Д.А., Лисовский К.Ю. Пространства имен в XML и SXML // Электронные библиотеки. – М.: ИРИО, 2003. – Т. 6, вып. 3. – ISSN 1562-5419 = Russian digital libraries journal.
  23. Лизоркин Д.А. Функциональные методы обработки XML-данных / Ph.D. thesis = Диссертация на соискание ученой степени кандидата физико-математических наук по специальности 05.13.11. – 2005, 11 ноя.
  24. Кузнецов С.Д. Современные технологии баз данных : Годовой курс для студентов 3-го курса. – Центр Информационных Технологий.
  25. Гарсиа-Молина Г., Ульман Дж.Д., Уидом Дж. Системы Баз Данных. Полный курс / Пер. с англ. Варакина С.А.; под ред. Слепцова А.В. – М,: Вильямс, 2003. – 1088 с.: ил. – ISBN 5-8459-0384-X (рус.)
  26. Гринев М., Кузнецов С.Д, Фомичев А. XML-СУБД Sedna: технические особенности и варианты использования // Открытые системы. – 2004, вып 8.