Файл: Операции, производимые с данными (Описание работы с данными).pdf
Добавлен: 31.03.2023
Просмотров: 181
Скачиваний: 1
СОДЕРЖАНИЕ
Глава 1. Основные понятия области решений операций, производимые с данными
Глава 2. Описание работы с данными
2.1 Предпосылки актуальности проведения исследования
2.2 Постановка проблемы и задач исследования
2.3 Инструментальные методы и средства поставленной проблемы
ВВЕДЕНИЕ
Сегодня объемы данных растут, а темпы роста данных постоянно ускоряются. Данные датчиков, логи файловых систем, социальные сети и другие источники, приносящие объём, скорость и разнообразные данные, которые намного превосходят по качеству и количеству обычный хранимые данные в базах.
Организации, ориентированные на яркую перспективу развития, творчески используют все новые источники для достижения беспрецедентных преимуществ и конкурентного превосходства на рынке. Это не так просто, как поместить все эти данные в одном месте. Реальная стоимость использования этих данных для бизнеса расшифровывается с помощью подробного рассмотрения конкретных случаев использования и кейсов в рамках дальнейшего анализа. Применение конкретных кейсов может сильно различаться между отделами и отраслями. Хотя встречаются и интересные технические проблемы, связанные с интеграцией и управлением всеми имеющимися источниками данных, с которыми сталкивается каждый крупный игрок.
Организации должны сначала найти достаточное количество времени, чтобы определить и отточить оптимальное использование или варианты использования для своих собственных бизнес потребностей каждого имеющегося решения на рынке. Это и есть важнейший первый шаг, который поможет понять основные веяния. Такие бизнес веяния могут быть использованы бизнесом в целях улучшения результатов, которые можно достичь с помощью используемых кейсов в рамках анализа данных.
Таким образом, целью моей работы является:
- разработка концепции нового инструмента помощи принятия управленческих решений в рамках крупных маркетинговых компаний (вся карта вычисляемых показателей также разрабатывается самостоятельно автором работы).
Для достижения поставленной цели автором были поставлены следующие задачи:
- определить основные составляющие тенденций систем обработки потоковой информации;
- определить основные недостатки имеющихся систем обработки потоковой информации в выбранной области;
- составить карту вычисляемых показателей маркетинговых компаний для определения ценности принимаемого решения бизнес подразделением;
- разработать концепцию нового инструмента на основе выбранных решений, решающее проблему принятия управленческих решений в рамках крупных маркетинговых компаний бизнеса с использованием полученных знаний по тенденциям в сфере потоковых данных.
Объектом исследования в моей работе является деятельность компании, являющейся одним из лидеров продаж строительных материалов на рынке России.
Предметом исследования в работе является процесс принятия управленческих решений в рамках маркетинговых компаний, связанных с действиями digital департамента компании - интернет канал продаж и привлечения новой аудитории.
Глава 1. Основные понятия области решений операций, производимые с данными
Термин «потоковая передача» сегодня имеет историю развития, аналогичную термину «большие данные», а конкретнее обозначает слишком разнородное и разнообразное множество вещей. Суть проблемы данных терминов в том, что их описание было сформировано исторически в просторечии нежели в формате подачи конкретной информации о том, что это и как это работает. Неизбежно это приводит к отсутствию окончательного сложившегося корректного понимания в отношении того, что же на самом деле такое потоковая передача или что могут делать потоковые систем в действительности. Зачастую существующая терминология не только ограничивает характеристики описываемого далее механизма прикрывая все классическим термином обывателей «потоковые данные», а более того – приписывает дополнительные ложные характеристики, например, приблизительность результатов обработки данных.
Стоит понимать, что корректно разработанные системы анализа потоковых данных способны производить такие же (и даже более) корректные результаты, как и любое уже существующее решение на основе пакетного метода.
С целью снизить вероятность разобщения терминологического единства исследования и отсутствия некорректного понимания ограничений используемого механизма стоит определить единое понимание термина «потоковая передача», которого будет придерживаться автор в работе. При составлении такого понятия я буду опираться на такую сторону изначального обывательского термина как «подход», разработанный на основе идеологии работы с бесконечными наборами данных в памяти, и оперировать не единым определением, а характеристиками, свойственными данному «подходу»:
- Безграничные данные в качестве источника информации для анализа в модели. В данном свойстве мы поговорим о типах постоянно растущих сетов данных. Такие данные априори зачастую называются пользователями как «потоковые данные». Однако, данная формулировка достаточно однобока, ввиду того, что при такой формулировке и «потоковый» процесс обработки данных и «пакетный» процесс обработки данных являются одинаковыми (так как могут работать с любым объемом данных при корректном использовании подхода), но целью составления определения является попытка отметки яркого отличия. Таким образом, отметим ключевое отличие между двумя типами наборов данных для разных подходов в разрезе их «конечности/непрерывности»: в своем исследовании я буду ссылаться именно на бесконечный «потоковый» набор данных как на бесконечный и непрерывный поток информации, в то время как «пакетный» набор данных при такой стороне рассмотрения становится ограниченным.
- Неограниченная обработка данных. Данное свойство подразумевает непрерывный режим обработки данных, который применяется к вышеописанному безграничному объему данных в качестве источника информации для анализа в моделях. Именно такая формулировка также поможет нам избежать ошибок при первичном сравнении «потоковых» и «пакетных» подходов к обработке данных. Ведь стоит отметить, что уже давно были разработаны повторные запуски пакетных триггеров обработки для обработки данных. И наоборот, хорошо спроектированные потоковые подходы способны на использование при обработке «пакетных» нагрузок более ограниченных данных.
- Результаты с приближенной информацией. Данная характеристика результатов чаще всего связана именно с потоковыми системами обработки информации. Факт того, что пакетные системы традиционно разрабатывались для получения именно верных результатов, а не приблизительных, а потоковый подход изначально был инициирован под манифестом приблизительных данных – исторический артефакт и не более того. На данный момент практика показывает, что те же пакетные системы могут спокойно демонстрировать приблизительные результаты при определенном применении метода. Таким образом, такой тип данных в данной характеристике результатов гораздо корректнее будет описать именно так, как они и названы (приблизительные без относительности к конкретному термину) чем так, как они исторически появлялись – через ассоциации с потоковыми данными.
Начиная с этого момента, в данном исследовании при упоминании термина «потоковая передача и обработка данных» будет подразумеваться именно механизм, предназначенный для обработки и осуществления манипуляций с неограниченным набором данных, и ничего более персонализированного. Аналогично, в случае упоминания такого термина как «неограниченные данные» будет иметься именно свойство данных поступать без разреза «конечности» в представлении.
Одной из основных целей данного параграфа является показать на сколько много способна хорошо спроектированная потоковая система, которая на данный момент низведена до некоторой степени «неоцененности» на рынке ввиду присвоенным ассоциациям с такими терминами как приближенность результатов и задержка, в особенности в рамках искусственного сравнения с пакетными системами обработками данных, которые в конечном итоге предоставляют корректный результат.
Хорошо спроектированные потоковые системы фактически обеспечивают четкое надмножество пакетной функциональности решений. Можно точно утверждать, что пакетные системы в таком виде, как они существуют сейчас, не нужны в применении ни одной организации: они массивны и тяжелы в обслуживании того самого «точного» результата. Следствием эволюции таких систем, начиная с Lambda Architecture, является широкое созревание потоковых систем в сочетании с надежными инфраструктурами для неограниченной обработки данных. Для воплощения этого в жестких реалиях необходимо только две вещи:
- Правильность. Данный пункт позволит новому подходу конкурировать с пресловутым пакетным подходом к обработке данных. По сути, корректность результата сводится к постоянному хранению промежуточных данных. Потоковым системам нужен некий определенный метод для контроля точки устойчивого состояния в течение долгого времени, и она должна быть достаточно хорошо определена. Строгая согласованность необходима для точной однократной обработки, которая необходима для последующей корректности, что является требованием для любой системы, которая собирается претендовать на удовлетворение или превышение возможностей существующих решений пакетных систем.
- Временные инструменты, которые переносят потоковые системы дальше пакетных. Хорошие инструменты для рассуждения о времени имеют важное значение для работы с неограниченными неупорядоченными данными с переменным временем события. Все большее число современных наборов данных демонстрируют эти характеристики, а в существующих системах пакетной обработки отсутствуют необходимые инструменты для преодоления трудностей, которые данные характеристики налагают. Сосредоточимся на данном вопросе, начав с общего представления о концепции временного перекоса неограниченных данных с разным временем события.
Итак, чтобы говорить о неограниченной обработке данных необходимо четко определиться с пониманием временных областей. В данном исследовании мы будем предполагать наличие двух периодов времени, а именно:
- Время события, которое является реальным временем происхождения того или иного события.
- Время обработки, которое является реальным временем, когда произошедшее событие отображено и наблюдается в системе.
В идеальном мире время события и время обработки всегда будут равны, при этом события обрабатываются сразу по мере их возникновения. Реальность, однако, не такая уж приятная, и перекос между временем события и временем обработки не только не равен нулю, но часто является сильно изменяемой функцией характеристик исходных входных источников, механизма выполнения и аппаратных средств. Таким образом, вещи, которые могут повлиять на уровень перекоса, включают:
- Общие ограничения ресурсов, такие как перегрузка сети, сетевые разделы или общий процессор в неспецифической среде.
- Программные причины, такие как распределенная системная логика, конкуренция и т. д.
- Особенности самих данных, в том числе распределение ключей, отклонение в пропускной способности или дисперсия в беспорядке (например, самолет, полный людей, выводящих свои телефоны из режима полета после их использования в автономном режиме на весь рейс).
В результате, если построить ход времени события и времени обработки в любой реальной системе, как правило, получится что-то похожее на диаграмму на Рис 1.
Рис 1 Зависимость времени обработки от времени события в
система обработки данных
Кривая «Идеальный мир без временных сдвигов» представляет собой идеал, где время обработки и время события в точности равны; кривая «реальный мир с временным сдвигом»- реальность. В этом примере система немного отстает в начале времени обработки, поворачивается ближе к идеалу в середине, затем немного отстает к концу. Горизонтальное расстояние между идеальной и реальной кривыми - это перекос между временем обработки и временем события. Этот перекос по своей сути - латентность, создаваемая конвейером обработки.
Поскольку сопоставление между временем события и временем обработки не является статическим, это означает, что невозможно проанализировать данные исключительно в контексте того, когда они наблюдаются, если конечно в системе подразумевается забота о времени события (то есть, когда события действительно произошли). К сожалению, таким способом работают большинство существующих систем, разработанных для неограниченных данных.
Нас же интересует правильность, а значит мы заинтересованы в анализе данных в контексте их времени событий и не можем определить эти временные границы, используя время обработки, как это делают большинство существующих систем. При отсутствии постоянной корреляции между временем обработки и временем события некоторые данные события будут попадать в неправильные окна времени обработки (из-за присущего отставания в распределенных системах, онлайнового / автономного режима многих типов источников ввода, и т. д.).
К сожалению, картинка не слишком радужная, когда работа осуществляется с окном по времени события. В контексте неограниченных данных беспорядок и переменный перекос вызывают проблему полноты для окон времени события, так как вы не можете четко определить, когда вы наблюдали все данные за заданное время события x? Подавляющее большинство систем обработки данных, используемый сегодня полагается на некоторое представление о полноте, что ставит их в невыгодное положение при применении неограниченных наборов данных.
Глава 2. Описание работы с данными
2.1 Предпосылки актуальности проведения исследования
С целью просмотра рынка кейсов и решений для большой аналитики данных были отобраны основные случаи применения такой аналитики в компаниях в качестве предпосылок проведения дальнейших исследований в работе (Таблица 1):
Таблица 1 Анализ предпосылок исследования
|
Тема кейса применения анализа данных в режиме реального времени |
Результат применения анализа данных в режиме реального времени |
|
Аналитика клиентов. Анализ глубоких поведенческих факторов клиентов, влияющих на интенсивность привлечения клиентов, имеет основное значение для решения таких задач, как повышение коэффициента конверсии клиентов, персонализации кампаний для увеличения доходов, прогнозирование и предотвращение оттока клиентов, а также снижение затрат на приобретение клиентов. Рассматривались и анализировались унифицированным способом несколько каналов взаимодействия с пользователем - мобильные, социальные сети, магазины, сайты электронной коммерции и т. д. |
Всего за 2-4 недели компании в сфере розничной торговли, финансовых услуг, игр и телекоммуникаций получили информацию, которая помогла им:
|
|
Оперативная аналитика. Руководителям предприятий обрабатывающей и перерабатывающей промышленности, а также сервисным службам или продуктам слишком хорошо известно, что они вынуждены оптимизировать использование активов, бюджеты, производительность и качество обслуживания. Крайне важно добиться конкурентного преимущества и повысить эффективность бизнеса. Ключ к успеху есть способность проникновения в самую суть, скрытую в неочевидных источниках данных. Такие тайные тенденции, модели и выбросы могут улучшать решения, улучшать операции и производительность организации, что позволяет в свою очередь сэкономить миллионы долларов. |
Всего за 2-4 недели компании в сфере розничной торговли, финансовых услуг, игр и телекоммуникаций получили информацию, которая помогла им:
|
|
Продукты и услуги, управляемые данными. Инновация новых продуктов и услуг - это источник жизненной силы любого бизнеса. Если организация не сможет разрабатывать новые дифференцирующие предложения, тесно связанные с потребностями и желаниями клиентов, как еще можно создать новые источники дохода, получить конкурентные преимущества и повысить лояльность клиентов. Опытные компании используют большие данные для создания новых продуктов и услуг, ориентированных на данные. Они думают о том, как компания может использовать данные CRM, социальные сети, данные транзакций, данные геолокации, данные устройства, сенсора и продукта. Также такие данные можно даже дополнить информацией от третьих сторон. Всё это используется для анализа спроса на рынке. |
Решения анализа данных реального времени обеспечивают яркие итоговые результаты. Например, медиа-компания использует решения аналитики данных для предоставления брендам и рекламодателям аналитических отчетов о том, как клиенты ведут себя с помощью мобильных приложений, что позволяет им оптимизировать рекламу и повысить количество ответов. |