Сховішча даных для аналітычнай працы

Сховішча даных для аналітычнай працы

Сховішчы даных і аналітыка

Праблема:

Даныя паступалі з розных інфармацыйных сістэм і патрабавалі цэнтралізаванага збору, апрацоўкі і кантролю якасці. Адсутнасць адзінага сховішча ўскладняла падрыхтоўку правераных даных і іх выкарыстанне для інфармацыйна-аналітычнай працы.

Таксама патрабавалася забяспечыць адзіны падыход да вядзення нарматыўна-даведачнай інфармацыі, апісання і каталагізацыі даных, кантролю іх якасці і прасочвальнасці паходжання.

Задачы праекта:

Стварыць адзінае сховішча для цэнтралізаванага збору, апрацоўкі, захоўвання і аналізу даных з розных інфармацыйных сістэм. Неабходна было аўтаматызаваць поўны цыкл працы з данымі і нарматыўна-даведачнай інфармацыяй (НДІ): ад рэгламентнай загрузкі і апрацоўкі да фарміравання аналітычных вітрын і прадастаўлення карыстальнікам інструментаў для інфармацыйна-аналітычнай працы.

Пра праект:

Спецыялісты ААТ «Цэнтр банкаўскіх тэхналогій» распрацавалі сховішча даных аналітычнага контуру і рэалізавалі механізмы яго інтэграцыі з інфармацыйнымі сістэмамі заказчыка. Створаны комплексны контур кіравання данымі, які ахоплівае ўвесь цыкл працы з імі: інтэграцыю з крыніцамі, загрузку і апрацоўку, кантроль якасці, вядзенне нарматыўна-даведачнай інфармацыі, каталогізацыю, фарміраванне аналітычных вітрын і прадастаўленне інструментаў бізнес-аналітыкі (BI). У рамках праекта рэалізаваны:
- рэгламентная загрузка даных і адпаведнай нарматыўна-даведачнай інфармацыі з розных крыніц;
- апрацоўка і фарміраванне масіваў правераных даных;
- цэнтралізаванае захоўванне даных і НДІ;
- прадастаўленне карыстальнікам доступу да падрыхтаваных масіваў даных;
- фарміраванне аналітычных вітрын;
- аналітычныя праграмы на базе Apache Superset для інфармацыйна-аналітычнай працы з данымі;
- спецыялізаваны каталог даных з апісаннем аб’ектаў і звесткамі аб іх паходжанні;
- механізмы кантролю якасці даных;
- бізнес-гласарый і пошук па каталогу, у тым ліку па метаданых;
- загрузка і аўтаматычная актуалізацыя карыстальніцкіх даведнікаў;
- падтрымка версійнасці нарматыўна-даведачнай інфармацыі і даных;
- інтэграцыя сховішча з інфармацыйнымі сістэмамі заказчыка.

Стэк тэхналогій:

Greenplum, PostgreSQL, Apache NiFi, Apache Superset, DataHub, GraphQL, Apache Kafka, eMondrian, Python, .NET, React JS, Docker, Ansible, Git, Active Directory Federation Services.

Каманда праекта:

Кіраўнік праекта, сістэмны архітэктар, распрацоўшчыкі, ML- і AI-інжынеры, DevOps-інжынеры, спецыялісты па працы з данымі, сістэмныя і бізнес-аналітыкі, тэсціроўшчыкі.

Вынік праекта:

Створана адзінае сховішча даных, якое забяспечвае цэнтралізаваны працэс працы з інфармацыяй — ад яе атрымання з розных інфармацыйных сістэм і апрацоўкі да прадастаўлення падрыхтаваных даных карыстальнікам для далейшага аналізу. Рэалізацыя праекта дазволіла:
- цэнтралізаваць працэсы загрузкі, апрацоўкі і захоўвання даных з розных крыніц;
- забяспечыць карыстальнікаў праверанымі і падрыхтаванымі масівамі даных;
- арганізаваць цэнтралізаванае вядзенне нарматыўна-даведачнай інфармацыі;
- забяспечыць кантроль якасці і прасочвальнасць паходжання даных;
- прадаставіць інструменты для самастойнай інфармацыйна-аналітычнай працы;
- арганізаваць фарміраванне аналітычных вітрын;
- забяспечыць актуалізацыю і версійнасць даных і даведачнай інфармацыі.
Створанае рашэнне сфарміравала тэхналагічную аснову для далейшага развіцця карпаратыўнай аналітыкі, падключэння новых крыніц даных, пашырэння складу аналітычных вітрын і развіцця інструментаў працы з данымі.