數據管理服務DMS是一款支撐數據全生命周期的一站式數據管理平臺。DMS提供全域數據資產管理、數據治理、數據庫設計開發、數據集成(上云遷移、容災、多活、ETL)、數據開發及數據消費服務等能力,致力于幫助企業高效、安全的挖掘數據價值,助力企業數字化轉型。

數據管理系統項目需要做的事情主要分為以下幾步:
步,建立數據依賴引擎,實現依賴圖譜。依賴圖譜用于構建數據倉庫表之間的分層級依賴關系,然后存入 MYSQL表并能支持可視化展現。
第二步,計算數據準備情況。各個表、各個分區的數據準備就緒時間按天,小時級進行匯總。根據Hive倉庫的Meta信息可以獲取Hive表各個分區的創建時間,根據創建時間確定數據的實效性,用來分析展現每天、每小時的狀態和瓶頸。如果需要對 MYSQL進行驗證則通過SOL語句査詢的方式獲取對應時間在MYSQL中是否存在。
第三步,建立數據計算引。根據定義的小時級指標、天級別指標規則,結合數據表各個分區的準備就緒時間,調用 Spark SQL計算核心指標。
第四步,建立數據比較引。根據表和表之間核心指標的關系、表和表之間的規則進行比較驗證。例如,A==B,A+B==C,B/A<0.95 等邏輯判斷。
3.數據管理系統功能數據管理系統的功能主要分為數據流管理、任務管理、數據管理三大功能。
3.1數據流管理,也可以叫血緣分析。
單從字面上來看,它屬于一種數據關系的分析,用來解釋數據之間相互影響的一種描述。數據流管理,對于當前大數據背景下的數據治理具有十分重要的意義,它能讓你快速了解數據組成結構,并制定有效的管理方式。
例如,有一天,我們發現大數據分析平臺某個業務指標的數據沒有產出,就要去查看到底哪里出了向題,是數據集市里的表、主題層的表還是基礎層的表出了問題。而在更多的時候,數據集市的表會依賴多張表,那么這個排査問題的過程就會變得很麻煩,而且很浪費時間。有一個簡單的思路就是,通過業務場景,在數據管理系統中設計解析每一個計算過程的鏈路關系,自動繪制出圖表,動態獲取執行情況,并做出預警。對于日常的監控,可以將每一個元數據的引用情況做出明暗度顯示,繪制出數據連接圖。
數據血緣關系會首先通過指標對應的庫表關系,找出它所屬的表,再根據計算關系找到計算過程中與它有關聯的表,最終把整個鏈路上的相關表展現出來。這樣就清晰地展現出了它從數據源頭開始,一層一層的鏈路關系,并且可以用顏色區分正常、延遲、未處理等各種狀況,清楚地知道任務異常情況,并在任務延退情況下觸發報警機制,以短信方式提醒負責人排査問題,確保數據正常產出。
血緣分析可以清晰地幫助我們了解所維護的數據的使用與被使用情況,猶如資產一般,便于維護定位與統一管理。一個管理者如果掌握了數據資產的使用與被使用情況,就可以更加清晰地了解管理與維護的重點,并做出合理的風險預警,基于業務重點做一些資源的調整與再分配。
3.1.1血緣管理
3.2任務管理
任務管理會對每天的任務執行情況進行管理,展現每張表的任務完成時間任務延時情況以及延時的原因等,一且任務出現問題,可以快速聯系到數據表的負責人。同時,能夠方便查看每張表的依賴關系、完成時長的歷史情況以及表的字段信息,讓數據分析平臺變得清晰。
3.2.1完成時長趨勢
在數倉中每張表的完成時長每天都是不一樣的,因此在數據關系系統中,有必要把表的每天完成時長記錄下來,然后展示在系統中,方便查詢近況時間內的完成趨勢。
還可以針對數據流程進行優化,減少任務延遲時間情況,需要分負責人和表名稱兩個維度去對數據延遲情況進行統計,可以查看每個負責人的延遲次數,延遲時間等情況。
3.3數據管理
數據管理功能會展示數倉表的信息,包括所屬數據庫,存儲類型,負責人,產出狀態,數據庫地址,標簽,備注等,并可以進行編輯和操作。點擊表名,業務組可以跳轉到血緣關系頁面,對應表所在的血緣圖進行查看。數據管理功能的作用還能根據表名,標簽,產品狀態,業務組快速查找相關表。
功能
變更穩定功能僅穩定變更和安全協同模式支持,數據安全和研發高效功能僅安全協同模式支持。
數據資產
幫助企業“找得到”數據,“用得好”數據
全域數據資產支持27種數據源,包括OLTP/OLAP/NoSQL/對象存儲/數據湖;支持跨IDC、跨云廠商的數據源;提供免費、穩定、高效的數據庫網關打通網絡接入。快速查找數據支持物理元數據及業務術語;基于圖譜能力,可快速搜索、發現可用數據。數據質量治理覆蓋數據生產、集成、加工到消費的端到端血緣能力;支持定義數據質量規則,進行數據質量檢測與校驗。數據安全治理敏感數據自動分級分類;異常訪問風險識別。
數據安全
助力企業輕松應對各種合規、等保審查
企業管理實時聯動基于OpenAPI實踐,可有效保障企業員工流轉時,域賬號及權限的全自動化管理;避免賬號清理不及時潛在數據泄露風險。細粒度權限管控支持實例、數據庫、表、字段、數據行級不同粒度;面向個人賬號(支持域賬號對接),審計到人,避免賬號混用的審計困擾;支持人員不接觸數據庫賬號密碼,權限到期自動失效回收;人員的入職/離職/轉崗支持OpenAPI自動化聯動權限管理。敏感數據保護多法律法規覆蓋,數據分類分級全面覆蓋中華人民共和國網絡安全法、GDPR、SOX、PCIDSS、HIPAA等法律法規;精細分類與脫敏,內置40+分類識別規則,支持用戶自定義;支持哈希、遮掩、替換、變換、加密等常用脫敏算法。合規審計支持企業上市合規審計、常規內審等,基于DMS統一納管可支持人員權限、數據庫變更與訪問的詳細流水審計。
數據庫設計與開發
保障安全的同時,提升企業研發效率
穩定可控通過無鎖變更、變更前備份及變更異常自動回滾等策略,保障開發過程中數據庫穩定可控;基于CBO的智能診斷,研發可自助完成SQL質量審核與改進。安全可信內置阿里巴巴研發規范,規避無主鍵等不合理設計帶來潛在風險,目前支持200+設計及審核規范,可按需調整。高效敏捷基于設計規范,研發人員全自助即可完成合規的數據庫開發;效能上非生產環境可做到免審批,僅生產環境需要審核;保障安全的同時,實現跨部門之間的高效協同。
數據傳輸與加工
助力解決企業數據孤島痛點
豐富的數據源支持覆蓋主流的關系型數據庫、NoSQL數據庫、數據倉庫、消息隊列的遷移、訂閱與同步;支持多種引擎,客戶通過統一的方式對這些引擎進行開發,無需考慮引擎的差異性。多場景與服務支持支持定期全量/增量的周期性集成(最細調度周期可低至5分鐘間隔)、秒級實時集成;流批一體:支持流式數據加工、批量數據加工,數據實時性/處理效率高;覆蓋數據加工/數據開發、數據血緣、數據質量、數據服務、數據可視化等眾多功能。開發與運維簡單低代碼開發:只要懂SQL就能通過畫布快速實現流/批數據處理任務,自帶Flink/Spark計算能力實現數據處理效率;支持分布式集成架構,突破單機瓶頸,提供限流手段,按需限流保護數據源;一個平臺管理所有開發任務,提供智能監控告警和任務的自動處理機制,實現極低運維門檻。

優勢
全域數據資產
支持企業全域數據資產管理,提供貫穿數據生命周期的質量治理與安全治理,幫助企業不僅“找得到”數據,還能“用得好”數據
實時數據集成
支持26種常見數據源的實時及離線數據集成,且數據集成過程中,支持靈活自定義的數據處理邏輯,助力解決企業數據孤島的痛點
簡單易用
提供覆蓋數據全生命周期的數據流轉及處理能力。通過圖形化/向導式的開發模式、智能預警及自主診斷修復等能力,降低企業數據價值挖掘門檻
高效協同
提供覆蓋數據全生命周期的DataOps,內置阿里巴巴大規模時間的數據流轉管控體系。保障數據安全的同時,提升企業研發效率