Файл: Сравнительны анализ технологий хранения и обработки больших данных.docx
ВУЗ: Не указан
Категория: Не указан
Дисциплина: Не указана
Добавлен: 25.10.2023
Просмотров: 148
Скачиваний: 2
ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.
Где применяется аналитика больших данныхBig data находят применение в бизнесе, госсекторе и промышленности. Вот области, где большие данные используют чаще всего: ● Транспорт. С помощью больших данных о маршрутах и скорости машин навигаторы предлагают самый короткий путь с учётом пробок. ● Мобильная связь и интернет. Сотовые операторы используют большие данные, чтобы спрогнозировать нагрузки сети в каждой зоне и понять, где не хватает обычных сотовых вышек, а где — 5G. ● Медицина. С помощью больших данных можно предсказать, как будет развиваться эпидемия и в какой момент понадобится увеличить выпуск вакцин. ● Маркетинг. К примеру, Amazon использует систему рекомендаций товаров, которая обучена с помощью больших данных и приносит сервису до 35% от всей выручки. ● HR. На базе миллионов профилей успешных кандидатов можно создать алгоритм, который будет автоматически отбирать самых подходящих соискателей и отправлять им приглашения на собеседования. ● Производство. Большие данные помогают организовать работу сотрудников так, чтобы снизить риски аварий и несчастных случаев в цехах. ● Финтех. На основе данных обо всех случаях мошенничества банки могут создать наиболее безопасные сервисы для онлайн-платежей. ● Образование. Большие массивы данных помогают составлять персональные рекомендации вузов для абитуриентов и профессий для выпускников. ● Интернет вещей. Большие данные используют, чтобы умные устройства, сенсорные датчики, камеры наблюдения, системы управления беспилотными автомобилями работали ещё лучше и облегчали жизнь людей. ● Наука. Результаты исследований, опросы и показания приборов помогают выявлять неочевидные закономерности и совершать новые открытия в разных областях науки. ● Государственное управление. Госорганам и международным организациям большие данные в виде статистики помогают лучше распределять ресурсы и реагировать на проблемы, которые действительно актуальны для людей. ● Искусственный интеллект и роботы. С помощью датасетов с реальными диалогами компании обучают голосовых и чат-ботов, которые заменяют сотрудников техподдержки или кол-центра. Кто работает с Big DataСпециалистов, чья работа связана с Big Data, можно поделить на три большие группы: ● Инфраструктурные профессии: сотрудники облачных провайдеров, которые обеспечивают технический сбор и хранение данных, дата-инженеры и разработчики ЦОДов — центров обработки данных.
● Аналитические профессии: системные, веб- и аналитики данных, маркетологи. Их задача — обработать большие данные, чтобы сделать сервис более удобным для пользователей. Благодаря Big Data рекомендательные сервисы YouTube так хорошо подстраиваются под каждого пользователя и советуют ему подходящие видео. ● Специалисты по ИИ и машинному обучению используют Big Data, чтобы обучать нейросети и создавать роботизированные сервисы на их основе.ВведениеОбъемы информации постоянно увеличиваются, но в последнее время на IT-рынке стала обширно дискуссироваться концепция Big Data (большие данные), возникновение которой было связано с пониманием необходимости в неких качественных изменениях в подходах к хранению и использованию информации, объем которой становится с каждым днем все больше.Основная часть Сегодня традиционный вариант простого увеличения мощностей и ресурсов уже не работает, многие компании отмечают постоянный рост издержек на хранение, несмотря на постоянное уменьшение удельной стоимости хранения данных. Специалисты отмечают, что взрывной рост размера информации не является результатом роста числа деловых операций и, вполне возможно, объясняется неуправляемыми процессами репликации данных. Даже вендоры устройств хранения все чаще говорят о том, что круг задач управления информацией на данный момент быстро сдвигается от вопросов физического хранения данных к их использованию, что хранение данных - это средство для того, чтоб ими можно было пользоваться в подходящий момент. При всем этом тема Big Data связана напрямую с иной, уже давно обсуждаемой глобальной IT-тенденцией – с переходом к широкому внедрению облачных технологий [1].Большие данные сосредоточены вокруг хранилищ данных, объем которых намного превышает несколько терабайт.Компания Forrester определяет термин Big Data как аппаратное и программное обеспечение, которое организует, объединяет, анализирует и управляет данными, характеризующимися «4 V»: объем (Volume), разнообразие (Variety), изменчивость (Variability) и скорость (Velocity) -Способность приложения обрабатывать огромные массивы данных, которые поступают из различных источников в разных форматах, выступает основным критерием для того, чтобы отнести его к технологии Big Data. Обычно приложения Big Data включает в себя данные из различных источников (из внутренних и внешних источников) и разной степени структурированности (слабоструктурированные, структурированные и неструктурированные). Решение многих задач требуют совместной обработки данных разных
форматов - табличных данных в СУБД, иерархических данных, текстовых документов, видео, изображения, аудиофайлов и т.д.Есть отрасли, где сбор и накопление данных осуществляется чрезвычайно интенсивно.Если рассматривать производственную сферу, к примеру, электростанции, то здесь каждую минуту либо даже каждую секунду генерируется непрерывный поток данных. Кроме того, за последние годы, внедряются технологии «smart grid», которые позволяют измерять каждую минуту либо каждую секунду потребление электроэнергии. Extremely Big Data – так классифицируют накопленные данные в приложениях, в которых данные должны храниться годами. Растет и количество приложений Big Data среди государственных и коммерческих сегментов, где размер данных в хранилищах, может составлять больше 100 тб либо пб.Современные технологии дают возможность «отслеживать» людей и их поведение разными методами. К примеру, когда люди используют интернет, делают покупки в Интернетмагазинах, перемещаются с включенными телефонами – они оставляют след своих действий, что приводит к накоплению новой информации. Разные методы связи, обычные телефонные звонки, загрузка информации через веб-сайты социальных сетей, таких как Вконтакте, либо обмен видео на таких веб-сайтах, как YouTube, каждый день генерируют большое количество новых данных.Размер данных в сотни терабайт либо петабайт не дает возможности просто хранить и управлять ими при помощи обычных реляционных баз данных. Большая часть данных BigData являются неструктурированными, следовательно, значимость второго вопроса не вызывает сомнений. Другими словами, третий вопрос можно сформулировать следующим образом: как на базе Big Data составлять обычные отчеты, строить и использовать углубленные прогностические модели?Программное обеспечение, оборудование, также сервисные услуги вместе образуют комплексные платформы для хранения и анализа данных.Big Data обычно организуются и хранятся в распределенных файловых системах (DFS). Информацию хранят на нескольких жестких дисках, на обычных компьютерах. Так называемая «карта» (map) позволяет отслеживать, где (на каком ПК и/либо диске) хранится определенная часть информации. Для того, чтобы обеспечить отказоустойчивость инадежность, каждую часть информации обычно сохраняют несколько раз, к примеру – три раза. При помощи открытых программных продуктов для управления DFS (к примеру, Hadoop) и обычного оборудования, сравнимо просто можно реализовать в большом масштабе надежные хранилища данных [3].
Большинство собранной информации в DFS включает в себя неструктурированные данные, такие как изображения, фотографии, текст либо видео.Обработка этих больших массивов данных может состоять из обычных операций (к примеру, обычные подсчеты, и т.д.), a может состоять из сложных, и в данном случае обработка данных будет требовать более сложные алгоритмы, которые должны быть специально разработаны для действенной работы на DFS [4].Когда осуществляется анализ сотни терабайт либо петабайт данных, не представляется возможным извлечение данных в какое-либо другое место для анализа, поскольку занимает очень много времени и просит очень много трафика. Вместо этого, при анализе Big Data применяется алгоритм Map-Reduce, представляющий из себя модель для распределенных вычислений. В данном случае не данные передаются на обработку программе, а программа - данным. Таким образом, запрос представляет собой отдельную программу. Например, для того, чтобы вычислить итоговую сумму, алгоритм будет параллельно производить вычисления промежуточных сумм в каждом из узлов DFS, и потом суммировать эти промежуточные значения [5].Хочется еще раз отметить, что к Big Data относится обработка конкретно большого размера информации, который проблемно обрабатывать традиционными методами. В результате проведения сравнительного анализа, можно сделать вывод o том, что Big Data представляет из себя технологию извлечения информации из огромного массива данных в максимально короткие сроки с целью нахождения полезной информации и принятия эффективных управленческих решений, a традиционный подход – ПО с простым и интуитивно понятным интерфейсом, позволяющее проводить несложный анализ структурированных данных. Важно отметить, что когда мы имеем дело с Big Data, существующее «озеро» данных позволяет хранить данные из разных источников и разных форматов. Это обходится значительно дешевле традиционных хранилищ, в которые помещаются только структурированные данные.ЗаключениеПроведенный анализ дал возможность сделать следующие выводы:1. Big Data представляет из себя технологию извлечения информации из огромного массива данных в максимально короткие сроки с целью нахождения полезной информации и принятия эффективных управленческих решений, a традиционный подход – ПО с простым и интуитивно понятным интерфейсом, позволяющее проводить несложный анализ структурированных данных.
2. Big Data объединяет в себе данные из различных источников и разной степени структурированности. Способность приложения обрабатывать огромные массивы данных, которые поступают из различных источников в разных форматах, выступает основным критерием отнесения его к технологии Big Data.
● Аналитические профессии: системные, веб- и аналитики данных, маркетологи. Их задача — обработать большие данные, чтобы сделать сервис более удобным для пользователей. Благодаря Big Data рекомендательные сервисы YouTube так хорошо подстраиваются под каждого пользователя и советуют ему подходящие видео. ● Специалисты по ИИ и машинному обучению используют Big Data, чтобы обучать нейросети и создавать роботизированные сервисы на их основе.ВведениеОбъемы информации постоянно увеличиваются, но в последнее время на IT-рынке стала обширно дискуссироваться концепция Big Data (большие данные), возникновение которой было связано с пониманием необходимости в неких качественных изменениях в подходах к хранению и использованию информации, объем которой становится с каждым днем все больше.Основная часть Сегодня традиционный вариант простого увеличения мощностей и ресурсов уже не работает, многие компании отмечают постоянный рост издержек на хранение, несмотря на постоянное уменьшение удельной стоимости хранения данных. Специалисты отмечают, что взрывной рост размера информации не является результатом роста числа деловых операций и, вполне возможно, объясняется неуправляемыми процессами репликации данных. Даже вендоры устройств хранения все чаще говорят о том, что круг задач управления информацией на данный момент быстро сдвигается от вопросов физического хранения данных к их использованию, что хранение данных - это средство для того, чтоб ими можно было пользоваться в подходящий момент. При всем этом тема Big Data связана напрямую с иной, уже давно обсуждаемой глобальной IT-тенденцией – с переходом к широкому внедрению облачных технологий [1].Большие данные сосредоточены вокруг хранилищ данных, объем которых намного превышает несколько терабайт.Компания Forrester определяет термин Big Data как аппаратное и программное обеспечение, которое организует, объединяет, анализирует и управляет данными, характеризующимися «4 V»: объем (Volume), разнообразие (Variety), изменчивость (Variability) и скорость (Velocity) -Способность приложения обрабатывать огромные массивы данных, которые поступают из различных источников в разных форматах, выступает основным критерием для того, чтобы отнести его к технологии Big Data. Обычно приложения Big Data включает в себя данные из различных источников (из внутренних и внешних источников) и разной степени структурированности (слабоструктурированные, структурированные и неструктурированные). Решение многих задач требуют совместной обработки данных разных
форматов - табличных данных в СУБД, иерархических данных, текстовых документов, видео, изображения, аудиофайлов и т.д.Есть отрасли, где сбор и накопление данных осуществляется чрезвычайно интенсивно.Если рассматривать производственную сферу, к примеру, электростанции, то здесь каждую минуту либо даже каждую секунду генерируется непрерывный поток данных. Кроме того, за последние годы, внедряются технологии «smart grid», которые позволяют измерять каждую минуту либо каждую секунду потребление электроэнергии. Extremely Big Data – так классифицируют накопленные данные в приложениях, в которых данные должны храниться годами. Растет и количество приложений Big Data среди государственных и коммерческих сегментов, где размер данных в хранилищах, может составлять больше 100 тб либо пб.Современные технологии дают возможность «отслеживать» людей и их поведение разными методами. К примеру, когда люди используют интернет, делают покупки в Интернетмагазинах, перемещаются с включенными телефонами – они оставляют след своих действий, что приводит к накоплению новой информации. Разные методы связи, обычные телефонные звонки, загрузка информации через веб-сайты социальных сетей, таких как Вконтакте, либо обмен видео на таких веб-сайтах, как YouTube, каждый день генерируют большое количество новых данных.Размер данных в сотни терабайт либо петабайт не дает возможности просто хранить и управлять ими при помощи обычных реляционных баз данных. Большая часть данных BigData являются неструктурированными, следовательно, значимость второго вопроса не вызывает сомнений. Другими словами, третий вопрос можно сформулировать следующим образом: как на базе Big Data составлять обычные отчеты, строить и использовать углубленные прогностические модели?Программное обеспечение, оборудование, также сервисные услуги вместе образуют комплексные платформы для хранения и анализа данных.Big Data обычно организуются и хранятся в распределенных файловых системах (DFS). Информацию хранят на нескольких жестких дисках, на обычных компьютерах. Так называемая «карта» (map) позволяет отслеживать, где (на каком ПК и/либо диске) хранится определенная часть информации. Для того, чтобы обеспечить отказоустойчивость инадежность, каждую часть информации обычно сохраняют несколько раз, к примеру – три раза. При помощи открытых программных продуктов для управления DFS (к примеру, Hadoop) и обычного оборудования, сравнимо просто можно реализовать в большом масштабе надежные хранилища данных [3].
Большинство собранной информации в DFS включает в себя неструктурированные данные, такие как изображения, фотографии, текст либо видео.Обработка этих больших массивов данных может состоять из обычных операций (к примеру, обычные подсчеты, и т.д.), a может состоять из сложных, и в данном случае обработка данных будет требовать более сложные алгоритмы, которые должны быть специально разработаны для действенной работы на DFS [4].Когда осуществляется анализ сотни терабайт либо петабайт данных, не представляется возможным извлечение данных в какое-либо другое место для анализа, поскольку занимает очень много времени и просит очень много трафика. Вместо этого, при анализе Big Data применяется алгоритм Map-Reduce, представляющий из себя модель для распределенных вычислений. В данном случае не данные передаются на обработку программе, а программа - данным. Таким образом, запрос представляет собой отдельную программу. Например, для того, чтобы вычислить итоговую сумму, алгоритм будет параллельно производить вычисления промежуточных сумм в каждом из узлов DFS, и потом суммировать эти промежуточные значения [5].Хочется еще раз отметить, что к Big Data относится обработка конкретно большого размера информации, который проблемно обрабатывать традиционными методами. В результате проведения сравнительного анализа, можно сделать вывод o том, что Big Data представляет из себя технологию извлечения информации из огромного массива данных в максимально короткие сроки с целью нахождения полезной информации и принятия эффективных управленческих решений, a традиционный подход – ПО с простым и интуитивно понятным интерфейсом, позволяющее проводить несложный анализ структурированных данных. Важно отметить, что когда мы имеем дело с Big Data, существующее «озеро» данных позволяет хранить данные из разных источников и разных форматов. Это обходится значительно дешевле традиционных хранилищ, в которые помещаются только структурированные данные.ЗаключениеПроведенный анализ дал возможность сделать следующие выводы:1. Big Data представляет из себя технологию извлечения информации из огромного массива данных в максимально короткие сроки с целью нахождения полезной информации и принятия эффективных управленческих решений, a традиционный подход – ПО с простым и интуитивно понятным интерфейсом, позволяющее проводить несложный анализ структурированных данных.
2. Big Data объединяет в себе данные из различных источников и разной степени структурированности. Способность приложения обрабатывать огромные массивы данных, которые поступают из различных источников в разных форматах, выступает основным критерием отнесения его к технологии Big Data.