Хранилище данных для аналитической работы

Хранилище данных для аналитической работы

Хранилища данных и аналитика

Проблема:

Данные поступали из различных информационных систем и требовали централизованного сбора, обработки и контроля качества. Отсутствие единого хранилища усложняло подготовку проверенных данных и их использование для информационно-аналитической работы.

Также требовалось обеспечить единый подход к ведению нормативно-справочной информации, описанию и каталогизации данных, контролю их качества и прослеживаемости происхождения.

Задачи проекта:

Создать единое хранилище для централизованного сбора, обработки, хранения и анализа данных из различных информационных систем. Необходимо было автоматизировать полный цикл работы с данными и нормативно-справочной информацией (НСИ): от регламентной загрузки и обработки до формирования аналитических витрин и предоставления пользователям инструментов для информационно-аналитической работы.

О проекте:

Специалисты ОАО «Центр банковских технологий» разработали хранилище данных аналитического контура и реализовали механизмы его интеграции с информационными системами заказчика. Создан комплексный контур управления данными, охватывающий весь цикл работы с ними: интеграцию с источниками, загрузку и обработку, контроль качества, ведение нормативно-справочной информации, каталогизацию, формирование аналитических витрин и предоставление инструментов бизнес-аналитики (BI). В рамках проекта реализованы:
-регламентная загрузка данных и соответствующей нормативно-справочной информации из различных источников;
-обработка и формирование массивов проверенных данных;
-централизованное хранение данных и НСИ;
-предоставление пользователям доступа к подготовленным массивам данных;
-формирование аналитических витрин;
-аналитические приложения на базе Apache Superset для информационно-аналитической работы с данными;
-специализированный каталог данных с описанием объектов и сведениями об их происхождении;
-механизмы контроля качества данных;
-бизнес-глоссарий и поиск по каталогу, в том числе по метаданным;
-загрузка и автоматическая актуализация пользовательских справочников;
-поддержка версионности нормативно-справочной информации и данных;
-интеграция хранилища с информационными системами заказчика.

Стек технологий:

Greenplum, PostgreSQL, Apache NiFi, Apache Superset, DataHub, GraphQL, Apache Kafka, eMondrian, Python, .NET, React JS, Docker, Ansible, Git, Active Directory Federation Services.

Результат проекта:

Создано единое хранилище данных, обеспечивающее централизованный процесс работы с информацией — от ее получения из различных информационных систем и обработки до предоставления подготовленных данных пользователям для дальнейшего анализа. Реализация проекта позволила:
-централизовать процессы загрузки, обработки и хранения данных из различных источников;
-обеспечить пользователей проверенными и подготовленными массивами данных;
-организовать централизованное ведение нормативно-справочной информации;
-обеспечить контроль качества и прослеживаемость происхождения данных;
-предоставить инструменты для самостоятельной информационно-аналитической работы;
-организовать формирование аналитических витрин;
-обеспечить актуализацию и версионность данных и справочной информации.
Созданное решение сформировало технологическую основу для дальнейшего развития корпоративной аналитики, подключения новых источников данных, расширения состава аналитических витрин и развития инструментов работы с данными.