- Tham gia
- 19/9/2024
- Bài viết
- 119
Trong suốt nhiều thập kỷ, các kỹ sư dữ liệu thường quen thuộc với hai phương pháp thiết kế kho dữ liệu truyền thống: Mô hình 3NF (Third Normal Form) của Bill Inmon và Mô hình Đa chiều Star Schema của Ralph Kimball. Tuy nhiên, khi bước vào kỷ nguyên dữ liệu lớn (Big Data) với sự xuất hiện của các hệ thống lưu trữ phân tán và nhu cầu thay đổi nghiệp vụ liên tục, cả hai phương pháp này đều bộc lộ những hạn chế lớn về khả năng mở rộng và tốc độ nạp dữ liệu song song.
Sự xuất hiện của phương pháp Data Vault 2.0 đã mang đến một cuộc cách mạng trong tư duy thiết kế dữ liệu, trở thành tiêu chuẩn vàng cho các tập đoàn khổng lồ muốn xây dựng hạ tầng dữ liệu linh hoạt, có khả năng mở rộng không giới hạn.
#DataVault20 #DataModeling
Sự xuất hiện của phương pháp Data Vault 2.0 đã mang đến một cuộc cách mạng trong tư duy thiết kế dữ liệu, trở thành tiêu chuẩn vàng cho các tập đoàn khổng lồ muốn xây dựng hạ tầng dữ liệu linh hoạt, có khả năng mở rộng không giới hạn.
1. Cấu Trúc Bối Cảnh Của Data Vault 2.0
Data Vault 2.0 phân tách hoàn toàn các thực thể kinh doanh, các mối quan hệ và các thuộc tính mô tả thành ba nhóm bảng vật lý riêng biệt:Bảng Hub (Thực thể cốt lõi)
Bảng Hub đại diện cho các thực thể kinh doanh cốt lõi của doanh nghiệp (như Khách hàng, Sản phẩm, Hóa đơn, Tài khoản). Bảng Hub chứa duy nhất danh sách các khóa kinh doanh (Business Keys), khóa băm (Hash Keys) và các thông tin quản trị vết (thời điểm nạp dữ liệu, nguồn dữ liệu). Bảng Hub tuyệt đối không chứa các thuộc tính mô tả dễ thay đổi.Bảng Link (Mối quan hệ)
Bảng Link thể hiện mối quan hệ hoặc các giao dịch phát sinh giữa các bảng Hub với nhau (ví dụ: Khách hàng mua Sản phẩm, Tài khoản thực hiện Giao dịch). Việc tách rời các mối quan hệ ra thành các bảng Link riêng biệt giúp hệ thống dễ dàng bổ sung các mối quan hệ mới phát sinh trong tương lai mà hoàn toàn không phải cấu hình lại cấu trúc các bảng cũ.Bảng Satellite (Thuộc tính chi tiết)
Bảng Satellite chứa toàn bộ các thuộc tính mô tả chi tiết của Hub hoặc Link (như Tên khách hàng, Địa chỉ, Giá sản phẩm) kèm theo lịch sử thay đổi theo thời gian. Mọi sự thay đổi thông tin đều được ghi nhận bằng việc chèn thêm dòng mới (Append-only) thay vì ghi đè (UPDATE), bảo đảm tính toàn vẹn và khả năng truy vết lịch sử 100 phần trăm.
2. Ưu Điểm Vượt Trội Của Data Vault 2.0 Trong Hệ Thống Big Data
- Nạp dữ liệu song song tốc độ cực cao: Vì các bảng Hub, Link và Satellite hoạt động độc lập và sử dụng cơ chế khóa băm (Hash Keys) làm khóa chính, đường ống ETL/ELT có thể thực hiện nạp dữ liệu đồng thời vào hàng nghìn bảng mà không bị nghẽn khóa bảng (Locking).
- Thích nghi tuyệt vời với sự thay đổi nghiệp vụ: Khi doanh nghiệp mở rộng quy mô hoặc mua lại một công ty khác, kỹ sư dữ liệu chỉ cần tạo thêm các bảng Hub, Link, Satellite mới và ghép nối vào hệ thống hiện có mà không làm đứt gãy hay phải sửa đổi các đường ống dữ liệu cũ.
- Khả năng tự động hóa tối đa: Cấu trúc nhất quán của Data Vault 2.0 cho phép các kỹ sư dễ dàng viết các công cụ tự động hóa sinh mã SQL (Automated Code Generation) để khởi tạo hàng ngàn đường ống dữ liệu tự động.
#DataVault20 #DataModeling