Файл: Источники данных и хранение информации на предприятии.docx
Добавлен: 25.10.2023
Просмотров: 289
Скачиваний: 2
ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.
НЕГОСУДАРСТВЕННОЕ ОБРАЗОВАТЕЛЬНОЕ ЧАСТНОЕ УЧРЕЖДЕНИЕ ВЫСШЕГО ОБРАЗОВАНИЯ«МОСКОВСКИЙ ФИНАНСОВО-ПРОМЫШЛЕННЫЙ УНИВЕРСИТЕТ «СИНЕРГИЯ»РЕФЕРАТНа тему «Источники данных и хранение информации на предприятии»По дисциплине: «Информационно-аналитические системы» Обучающийся ФИОМосква 2023 г.Оглавление:
Раздел I. Современные подходы к хранению и обработке электронных данных. 3
Раздел II. Современные средства хранения и обработки электронных данных на предприятиях. 6
Заключение 11
Список использованных источников и литературы 12
Ежедневный растущий объём электронных данных ставит сложные задачи перед традиционными способами по организации хранения, обработки и анализа данных. Целесообразность раскрытия данной темы подтверждается наличием высокого спроса на услуги хранения данных и аналитической обработки данных. В работе использованы различные источники информации, включая научно-методический журнал «Проблемы современной науки и образования»1 и электронный ресурс «Информационные системы в экономике: практикум»2.Цель работы: сформировать представление об основных источниках данных на предприятии и принципах хранения данных на предприятии.Задачи:
Ежедневно растущий объем электронных данных ставит перед нами задачу по организации в хранении, обработке и анализе данных.Большой объем данных, а также информации хранится в специализированных реляционных базах данных, которые называют хранилищами данных (ХД либо Data Warehouse).Хранилища данных в отличие от оперативных баз данных OLTP (On-Line Transaction Processing), работающих с приложениями, имеют некоторые функциональные ограничения, что позволяет уменьшить время выполнения запросов. Отличия ХД от обычной базы данных:Обычные базы данных (БД) предназначены для помощи в выполнении повседневной работе, а ХД для принятия решений;Обычные БД подвержены постоянному изменению данных, ХД в свою очередь выполняют обновление базы согласно предписанному времени без изменения предыдущих данных;Обычные БД чаще всего являются источником ХД, а ХД могут также пополняться из других внешних источников;Зачастую ХД имеет ненормализованную структуру, что позволяет заметно увеличить скорость выполнения запросов.Ральф Кимбалл, один из авторов концепции хранилищ данных, сформулировал основные требования к хранилищам данных:
Принципы проектирование в Hadoop:Так как сбои в аппаратной системе неизбежны. HDFS реализует надежные алгоритмы репликации данных, а метаданные файловой системы используют журнал, позволяющий восстановить требуемое состояние.Система HDFS построена таким образом, что позволяет обработку больших объемов данных с наиболее максимальной производительностью благодаря поточной обработке данных. Система оптимизирована для работы с большим объемом данных.Вычисления происходят намного эффективнее благодаря программному интерфейсу, который предоставляет HDFS. В Hadoop все вычисления разбиваются на несколько подмножеств, каждое из которых обрабатывается на отдельном узле кластера. Представляется это в виде последовательности map задач и reduce задач. Каждый узел в map задачах получает на вход множество пар.Вычисления в Hadoop представляются в виде последовательности map и reduce задач. В начале вычислений входное множество данных разбивается на несколько подмножеств. Каждое подмножество обрабатывается на отдельном узле кластера. Map задача на каждом узле получает на вход множество пар ключ-значений и возвращает другое множество. По ключу все пары сортируются, группируются и передаются на вход reduce, которая в свою очередь формирует итоговый результат.Эффективность использования Hadoop можно заметить в одном из интересных примеров тестирования скорости сортировки данных. Рекордные показатели в 2008 году предоставила компания Google, 1TB данных в Hadoop кластере компании Google удалось отсортировать за 68 с. В 2009 году в отчете компании Yahoo утверждалось, что им удалось это сделать за рекордные 62 с.
Раздел I. Современные подходы к хранению и обработке электронных данных. 3
Раздел II. Современные средства хранения и обработки электронных данных на предприятиях. 6
Заключение 11
Список использованных источников и литературы 12
-
Рассказать о современных подходах к хранению и обработке электронных данных. -
Рассказать о современных средствах хранения и обработки электронных данных на предприятиях.
Раздел I. Современные подходы к хранению и обработке электронных данных.
На сегодняшний день нелегко измерить общий объем электронных данных, хранящихся во всем мире, однако по оценкам IDC размер «цифрового мира» в 2006 г. составлял около 0.18 зеттабайта, а через 5 лет к 2011 году должен был достигнуть около 1.8 зеттабайта, тем самым продемонстрировав десятикратный рост. Согласно данным IDC объем данных к 2020 году должен был достигнуть отметки в 44 зеттабайта.Источниками таких объемов данных являются такие как:-
Главная фондовая биржа США, генерирует 1 терабайт данных в день. -
Хранилище данных социальной сети Facebook ежедневно увеличивает объем данных на 500 терабайт. -
Internet Archive Stores хранящая данные интернет-сайтов по состоянию на октябрь 2012 уже хранит 10 петабайт данных и ежемесячно прирастает 20 терабайтами в месяц. -
Большой адронный коллайдер, расположенный около Женевы, генерирует около 15 петабайт в год.
Ежедневно растущий объем электронных данных ставит перед нами задачу по организации в хранении, обработке и анализе данных.Большой объем данных, а также информации хранится в специализированных реляционных базах данных, которые называют хранилищами данных (ХД либо Data Warehouse).Хранилища данных в отличие от оперативных баз данных OLTP (On-Line Transaction Processing), работающих с приложениями, имеют некоторые функциональные ограничения, что позволяет уменьшить время выполнения запросов. Отличия ХД от обычной базы данных:Обычные базы данных (БД) предназначены для помощи в выполнении повседневной работе, а ХД для принятия решений;Обычные БД подвержены постоянному изменению данных, ХД в свою очередь выполняют обновление базы согласно предписанному времени без изменения предыдущих данных;Обычные БД чаще всего являются источником ХД, а ХД могут также пополняться из других внешних источников;Зачастую ХД имеет ненормализованную структуру, что позволяет заметно увеличить скорость выполнения запросов.Ральф Кимбалл, один из авторов концепции хранилищ данных, сформулировал основные требования к хранилищам данных:
-
Поддержка высокой скорости получения данных из ХД; -
Поддержка внутренней непротиворечивости данных; -
Возможность получения и сравнения так называемых срезов данных (slice and dice); -
Наличие удобных утилит просмотра данных в ХД; -
Полнота и достоверность хранимых данных; -
Поддержка качественного процесса пополнения данных.
Принципы проектирование в Hadoop:Так как сбои в аппаратной системе неизбежны. HDFS реализует надежные алгоритмы репликации данных, а метаданные файловой системы используют журнал, позволяющий восстановить требуемое состояние.Система HDFS построена таким образом, что позволяет обработку больших объемов данных с наиболее максимальной производительностью благодаря поточной обработке данных. Система оптимизирована для работы с большим объемом данных.Вычисления происходят намного эффективнее благодаря программному интерфейсу, который предоставляет HDFS. В Hadoop все вычисления разбиваются на несколько подмножеств, каждое из которых обрабатывается на отдельном узле кластера. Представляется это в виде последовательности map задач и reduce задач. Каждый узел в map задачах получает на вход множество пар.Вычисления в Hadoop представляются в виде последовательности map и reduce задач. В начале вычислений входное множество данных разбивается на несколько подмножеств. Каждое подмножество обрабатывается на отдельном узле кластера. Map задача на каждом узле получает на вход множество пар ключ-значений и возвращает другое множество. По ключу все пары сортируются, группируются и передаются на вход reduce, которая в свою очередь формирует итоговый результат.Эффективность использования Hadoop можно заметить в одном из интересных примеров тестирования скорости сортировки данных. Рекордные показатели в 2008 году предоставила компания Google, 1TB данных в Hadoop кластере компании Google удалось отсортировать за 68 с. В 2009 году в отчете компании Yahoo утверждалось, что им удалось это сделать за рекордные 62 с.
Раздел II. Современные средства хранения и обработки электронных данных на предприятиях.
В процессе деятельности предприятия накапливается большое количество информации. Эта информация может быть количественной, т. е. иметь конкретное численное выражение, и качественной, определяющей мнения консультантов, суждения специалистов, экспертные оценки. В свою очередь, количественная информация подразделяется на учетную и неучетную. Источниками учетной информации на предприятии выступают:-
Бухгалтерский учет и отчетность; -
Статистический учет и отчетность; -
Оперативный учет и отчетность; -
Выборочные учетные данные.
-
Результаты проверок налоговой службы; -
Материалы производственных совещаний; -
Протоколы собраний трудовых коллективов; -
Материалы средств массовой информации; -
Докладные и объяснительные записки сотрудников; -
Переписка с вышестоящими организациями; -
Результаты взаимоотношений с финансовыми и кредитными -
организациями; -
Материалы, получаемые в процессе взаимодействия с -
исполнителями.
, например:
-
Владелец или создатель файла; -
Информация о доступе к файлу; -
Пароль для доступа; -
Различные признаки, например: «только для чтения», «системный файл», «архивный файл» и т. п.; -
Время создания или последнего изменения файла; -
Размер файла и т. д.
-
Контролируемый доступ к файлам; -
Возможность осуществлять различные операции с файлами: создавать, удалять, копировать, изменять; -
Возможность обмена данными между файлами; -
Возможность восстанавливать свои файлы в случае их повреждения. Файловые системы предназначены для обслуживания многих тысяч файлов и обеспечивают хранение слабо структурированной информации.
-
OLTP-системы характеризуются: -
Поддержкой большого числа пользователей; -
Короткими транзакциями; -
Относительно короткими запросами; -
Малым временем отклика на запрос.