Courses
Phần lớn các cuộc thảo luận về chất lượng dữ liệu tập trung vào việc sửa dữ liệu nguồn kém. Nhưng các nhóm dữ liệu khác nhau có thể xây dựng năm bảng điều khiển hoàn toàn khác nhau từ cùng một hệ thống nguồn, với các con số doanh thu khác nhau cho cùng một quý. Vấn đề không nhất thiết nằm ở dữ liệu nguồn. Mỗi bên sử dụng có thể tự làm sạch, nối, lọc và định nghĩa dữ liệu đó một cách độc lập, mà không có chuẩn chung cho khái niệm “sạch”.
Kiến trúc medallion giải quyết vấn đề này bằng cách đưa ra các ranh giới rõ ràng để các nhóm dữ liệu cải thiện chất lượng dữ liệu mà không làm mất dữ liệu thô ban đầu. Hãy cùng xem nó là gì, hoạt động ra sao và vì sao đây lại là một khái niệm quan trọng trong kỹ thuật dữ liệu và MLOps.
Khóa học Hiểu về Kiến trúc Dữ liệu Hiện đại của chúng tôi đề cập đến cách lakehouse và các pipeline theo lớp phù hợp trong bức tranh tổng thể của hệ sinh thái dữ liệu. Và lộ trình nghề nghiệp Kỹ sư Dữ liệu của chúng tôi xây dựng các kỹ năng pipeline tổng quát giúp các lớp này có thể bảo trì khi chạy thực tế.
Kiến trúc Medallion là gì?
Kiến trúc medallion là một mẫu thiết kế dữ liệu để tổ chức hợp lý dữ liệu trong data lakehouse. Nó xác định bộ 3 lớp sao cho chất lượng và cấu trúc dữ liệu được cải thiện khi dữ liệu đi qua từng lớp:
- Bronze: Dữ liệu thô, vừa nạp vào. Đây là bản sao lưu, phòng khi thay đổi kiểm định hoặc logic nghiệp vụ.
- Silver: Dữ liệu đã làm sạch và kiểm định. Nguồn chân lý duy nhất, độc lập với trường hợp sử dụng dữ liệu.
- Gold: Dữ liệu sẵn sàng cho nghiệp vụ. Có thể dùng trực tiếp, ví dụ làm nguồn cho bảng điều khiển hoặc dữ liệu huấn luyện cho mô hình máy học.

Kiến trúc Medallion so với pipeline ETL truyền thống
Trong kho dữ liệu với các pipeline trích xuất-biến đổi-nạp (ETL) truyền thống, bạn phải xác định lược đồ dữ liệu ngay từ đầu. Nếu định dạng hoặc lược đồ dữ liệu thay đổi, hệ thống sẽ lỗi trừ khi bạn điều chỉnh thủ công.
Trong một kiến trúc ELT-dựa trên medallion (extract-load-transform), bạn lưu dữ liệu ở dạng thô trước, thay vì biến đổi tại chỗ và lưu trữ dữ liệu cuối cùng. Sự khác biệt này khiến kiến trúc medallion vừa bền vững vừa linh hoạt: bạn có thể lưu trữ dữ liệu thô như nguyên bản và quyết định cách dùng sau.
Để so sánh đầy đủ hai khái niệm, tôi khuyến nghị đọc hướng dẫn ETL vs ELT của chúng tôi.
Một lợi thế khác của kiến trúc medallion là tính không phụ thuộc nền tảng. Bronze, Silver và Gold là các giai đoạn logic, không phải công nghệ gắn với nhà cung cấp cụ thể. Bạn có thể triển khai mẫu này với các hệ thống lưu trữ, công cụ xử lý và định dạng bảng khác nhau, tùy thuộc nền tảng dữ liệu và yêu cầu khối lượng công việc.
|
Tính năng |
Medallion (ELT) |
ETL truyền thống |
|
Dữ liệu thô |
Được giữ lại |
Mất |
|
Lược đồ |
Quyết sau, áp dụng ở Silver |
Định trước ở đích |
|
Xử lý lại |
Xử lý lại từ dữ liệu thô đã lưu |
Có thể cần trích xuất lại từ nguồn |
|
Thời điểm biến đổi |
Sau khi nạp |
Trước khi nạp |
|
Tinh chỉnh dữ liệu |
Tiến dần qua các lớp |
Chủ yếu trước khi dữ liệu tới đích |
Các lớp Bronze, Silver và Gold trong kiến trúc Medallion hoạt động thế nào?
Ba lớp medallion đi theo logic, lớp sau xây dựng trên lớp trước.
Lớp Bronze: dữ liệu thô như điểm khôi phục
Đây là nơi dữ liệu thô cập bến nguyên trạng, dù đó là cơ sở dữ liệu quan hệ, ứng dụng SaaS như Salesforce, các topic Kafka mang sự kiện thời gian thực, REST API, xuất CSV, hay luồng thiết bị IoT. Việc nạp thường do các công cụ như Fivetran để bắt thay đổi dữ liệu hoặc Databricks Auto Loader để xử lý tệp trong object storage đảm nhiệm.
Dữ liệu Bronze thường chứa khá nhiều lỗi, thiếu nhất quán và trùng lặp, nên không bao giờ nên dùng trực tiếp cho mục đích kinh doanh. Dù vậy, lớp này rất giá trị như một điểm khôi phục để bạn có thể tái tạo dữ liệu Silver hoặc Gold.
Tầm quan trọng của lớp này nằm ở dấu vết của nó: nó ghi nhận và log mọi sự kiện nạp hoặc giao dịch. Thường bao gồm siêu dữ liệu có giá trị như dấu thời gian nạp, nguồn gốc dữ liệu và nhiều kiểu định danh khác nhau. Mục tiêu là lưu dữ liệu thô và đầy đủ nhất có thể, để bạn có thể phát lại các pipeline hạ nguồn với cùng dữ liệu nguồn nhằm gỡ lỗi.
Lớp Silver: lớp ràng buộc
Lớp Silver biến đổi dữ liệu thô thành dữ liệu sạch, có cấu trúc. Một vài ví dụ về các biến đổi làm sạch quan trọng diễn ra giữa Bronze và Silver:
- Loại bỏ các cột không cần thiết
- Khử trùng lặp bản ghi
- Sửa các điểm thiếu nhất quán
- Xử lý giá trị thiếu
- Chuẩn hóa dữ liệu
- Nối và hợp nhất các tập dữ liệu khác nhau
Lớp này cũng thực hiện áp đặt lược đồ, đảm bảo dữ liệu đáp ứng cấu trúc đã định sẵn và hỗ trợ tiến hóa lược đồ.
Bạn cũng xử lý kiểm tra chất lượng dữ liệu ở đây. Ví dụ, thêm quy tắc để gắn cờ hoặc loại bỏ các giao dịch nghiệp vụ thất bại hoặc ngoại lệ. Đây là bước đầu để cải thiện chất lượng khi dữ liệu đi qua các giai đoạn.
Vì giai đoạn này có chỉnh sửa dữ liệu, điều quan trọng là dùng các công cụ dò vết nguồn gốc dữ liệu như dbt để theo dõi cách dữ liệu được biến đổi từ Bronze sang Silver. Các kiểm tra chất lượng thường được triển khai bằng dbt tests, Great Expectations, hoặc Soda, trong khi quản trị được áp đặt qua data catalog như Databricks Unity Catalog hoặc Collibra.
Nếu bạn muốn học cách biến dữ liệu lộn xộn thành các tập Silver đúng chuẩn, tôi khuyến nghị bắt đầu với khóa Làm sạch Dữ liệu bằng Python của chúng tôi.
Lớp Gold: đầu ra sẵn sàng cho nghiệp vụ
Lớp cuối của kiến trúc lưu trữ dữ liệu ở chất lượng cao nhất có thể. Dữ liệu tinh luyện cao này được dùng cho báo cáo kinh doanh trong Power BI, Tableau, hoặc Looker, được tiêu thụ bởi các ứng dụng phân tích hạ nguồn, hoặc được phục vụ cho mô hình máy học qua feature store như Feast hoặc Databricks Feature Store.
Vì dữ liệu đã được làm sạch, giai đoạn này tập trung biến nó thành tài sản có giá trị cho kinh doanh. Tùy thuộc vào trường hợp sử dụng cụ thể (hãy nghĩ tới báo cáo tài chính, dashboard marketing, hệ thống cảnh báo, huấn luyện mô hình ML, …), các biến đổi sau Silver đảm bảo Gold chứa chính xác thông tin cần cho nhiệm vụ.
Tại đây, bạn tạo KPI, áp dụng công thức nghiệp vụ tùy chỉnh, hoặc tổng hợp theo tuần, tháng, quý cho báo cáo định kỳ. Trong khi các thao tác Bronze và Silver thường phổ biến, thao tác ở lớp Gold linh hoạt và tùy biến hơn theo cách bạn muốn dùng dữ liệu này.
Bạn dựng lại Silver và Gold từ dữ liệu Bronze như thế nào?
Việc giữ dữ liệu thô ở Bronze chỉ phát huy tác dụng nếu bạn thực sự sử dụng được nó, và điều đó xảy ra khi có thay đổi ở thượng nguồn hoặc hạ nguồn. Chi phí cho một thay đổi phụ thuộc vào vị trí của nó trong chuỗi.
- Thay đổi lược đồ nguồn đồng nghĩa phát lại Bronze qua cả Silver và Gold.
- Thay đổi định nghĩa nghiệp vụ (ví dụ, quy tắc doanh thu mới hoặc cửa sổ tổng hợp khác) chỉ cần dựng lại Gold từ Silver đã được kiểm định.

Trong cả hai trường hợp, bạn đều không quay lại hệ thống nguồn. Đó là điều khiến việc hiệu chỉnh lịch sử khả thi, vì nguồn có thể không còn giữ dữ liệu ở dạng bạn đã nạp ban đầu.
Điều đó cũng có nghĩa bạn có thể thay đổi định nghĩa chỉ số mà không phải chạy lại quá trình nạp, là lý do thực tế khiến các đội có nhiều bên tiêu thụ Gold giữ các lớp tách biệt.
Kiến trúc Medallion nằm ở đâu trong Data Lakehouse?
Một data lakehouse cho bạn lưu trữ đối tượng giá rẻ như data lake với bảo đảm giao dịch như kho dữ liệu. Nó không nói gì về cách sắp xếp các bảng bên trong. Đó là khoảng trống mà medallion lấp đầy: lakehouse là nền tảng lưu trữ, còn Bronze, Silver và Gold là cách bạn chia thành catalog, schema và bảng với các mức bảo đảm chất lượng khác nhau.
Trong thực tế, sự phân chia đó thường là vật lý. Trên Databricks, bạn có thể có ba schema trong một catalog của Unity Catalog, còn trong Microsoft Fabric, một lakehouse với các bảng Bronze và Silver cấp dữ liệu cho một kho Gold. Cùng một mẫu, khác đường ống.
Các định dạng bảng mở là yếu tố giúp các lớp chịu tải đọc và ghi đồng thời. Delta Lake, Apache Iceberg và Apache Hudi mỗi loại cung cấp một số kết hợp của:
- Giao dịch ACID
- Tiến hóa lược đồ
- Trạng thái bảng có phiên bản
- Kiểm soát đồng thời
- Tiến hóa phân vùng
- Du hành thời gian
Phiên bản hóa quan trọng nhất cho hành vi phát lại mà chúng ta vừa đề cập. Các tệp Parquet thô giữ dữ liệu nguồn ổn, nhưng không cung cấp lịch sử giao dịch để quay lui, nên một lần chạy Silver lỗi sẽ ghi đè lần chạy tốt, và bạn không có gì để so sánh. Delta Lake theo dõi thay đổi trong log giao dịch, trong khi Apache Iceberg biểu diễn trạng thái bảng dưới dạng snapshot.
Không điều nào trong số này là bắt buộc. Medallion là một mẫu logic, và nhiều đội vận hành nó trên các schema Postgres hoặc tiền tố S3 thuần với dbt bên trên. Bạn chỉ là mất khả năng quay lui rẻ.
Kiến trúc Medallion so với data mesh
Hai khái niệm này thường được so sánh, thường vì mọi người cho rằng chúng cạnh tranh. Chúng trả lời những câu hỏi khác nhau: data mesh quyết định ai sở hữu dữ liệu, còn kiến trúc medallion quyết định cách chủ sở hữu đó tinh luyện dữ liệu.
Data mesh trao trách nhiệm dữ liệu cho các nhóm miền như bán hàng, tài chính, chuỗi cung ứng, những nhóm xuất bản dữ liệu như sản phẩm và sở hữu chất lượng, khả năng khám phá, nguồn gốc và quản trị của nó. Hai yếu tố gắn kết điều đó: hạ tầng tự phục vụ cung cấp cùng bộ công cụ cho mọi miền, và quản trị liên bang đặt ra tiêu chuẩn toàn tổ chức mà không tước quyền sở hữu khỏi các miền.
Kiến trúc medallion là thứ một nhóm miền vận hành trong phần của riêng họ. Một đội chuỗi cung ứng sở hữu dữ liệu vận chuyển sẽ giữ sự kiện vận chuyển thô ở Bronze, bản ghi đã kiểm định ở Silver, và xuất bản các tập dữ liệu vận chuyển sẵn sàng phân tích ở Gold cho các miền khác sử dụng. Mesh định nghĩa hợp đồng tại ranh giới Gold; mọi thứ ở thượng nguồn thuộc về đội đó.
Một lưu ý trước khi bạn kết hợp chúng: các lớp Bronze theo miền đồng nghĩa mỗi miền tự gánh chi phí nạp và lưu trữ, và các chiều dùng chung như khách hàng hoặc sản phẩm có xu hướng bị dựng lại ở ba nơi. Những người ủng hộ mesh sẽ nói đó là cái giá của quyền sở hữu. Nhưng đó vẫn là chi phí thực, và đáng để tính toán trước khi bạn cam kết.
Lợi ích và hạn chế của Kiến trúc Medallion là gì?
Medallion mang lại khả năng tái sử dụng và khôi phục, và đánh đổi bằng chi phí lưu trữ, độ trễ và số lượng pipeline. Việc cân nhắc này có đáng hay không gần như phụ thuộc hoàn toàn vào số lượng bên tiêu thụ bạn có.
|
Lợi ích |
Hạn chế |
|
Dữ liệu thô luôn sẵn để xử lý lại và khôi phục |
Cùng dữ liệu tồn tại ở hai hoặc ba dạng, nên dung lượng lưu trữ tăng |
|
Kỳ vọng chất lượng được nêu rõ tại mỗi ranh giới |
Nhiều bảng và job hơn để lập lịch, giám sát và gỡ lỗi |
|
Nhiều tập Gold tái sử dụng một tập Silver đã làm sạch |
Mỗi bước nhảy thêm độ trễ giữa nguồn và đích |
|
Biến đổi có thể lần vết từ đầu vào thô đến đầu ra nghiệp vụ |
Khó biện minh nếu chỉ có một pipeline đơn giản |
Độ trễ là yếu tố dễ bị đánh giá thấp nhất. Mỗi lớp thường là một job theo lịch riêng, nên một pipeline batch ba lớp chạy theo giờ có thể khiến Gold chậm hai giờ so với hệ thống nguồn. Điều đó chấp nhận được cho báo cáo doanh thu hàng tuần và không ổn cho cảnh báo vận hành, vì vậy các đội thường để hệ thống cảnh báo đọc trực tiếp từ Silver thay vì chờ Gold.
Chi phí lưu trữ là điều mọi người nêu ra đầu tiên, và thường là vấn đề nhỏ hơn. Bronze nằm trên lưu trữ đối tượng giá rẻ, và sự trùng lặp là có thật nhưng trong phạm vi kiểm soát. Số lượng pipeline mới là thứ gây đau: ba lớp trên hai mươi bảng nguồn là sáu mươi hạng mục có thể hỏng lúc 3 giờ sáng.
So với đó, chất lượng dữ liệu kém cũng có cái giá riêng. IBM báo cáo năm 2026 rằng 43% COO coi chất lượng dữ liệu là ưu tiên dữ liệu quan trọng nhất, dựa trên nghiên cứu năm 2025 của Viện Giá trị Doanh nghiệp. Hơn một phần tư tổ chức trong nghiên cứu đó báo cáo thiệt hại hàng năm do dữ liệu kém vượt quá 5 triệu đô la.
Vì vậy, câu hỏi không phải liệu triển khai kiến trúc medallion có tốn hơn một pipeline đơn lẻ hay không, vì câu trả lời là có. Câu hỏi là liệu bạn có đang trả giá cho phương án còn lại bằng các cuộc họp đối soát và những dashboard mà chẳng ai tin tưởng hay không.
Khi nào bạn nên dùng Kiến trúc Medallion?
Medallion phát huy hiệu quả khi cùng dữ liệu đã làm sạch phục vụ nhiều bên tiêu thụ. Đó là chỉ báo tốt nhất, vượt lên trên khối lượng dữ liệu, quy mô đội ngũ hay số lượng nguồn bạn lấy dữ liệu.
Hãy dùng kiến trúc medallion khi:
- Nhiều đội hoặc khối công việc đọc cùng dữ liệu. Làm sạch và chuẩn hóa một lần ở Silver, rồi xây bao nhiêu tập Gold tùy cần cho BI, báo cáo hoặc huấn luyện mô hình.
- Các câu hỏi nghiệp vụ khác nhau cần các hình thái khác nhau của cùng dữ liệu. Tài chính cần doanh thu ghi nhận theo tháng, còn bán hàng cần booking theo ngày theo từng đại diện. Cả hai đều xuất phát từ một bảng Silver mà không nhân đôi logic nạp.
- Các nguồn bất đồng với nhau. Silver là nơi bạn đối soát ID tài khoản Salesforce với ID khách hàng của hệ thống thanh toán trước khi bất kỳ ai hạ nguồn phải đoán cái nào có thẩm quyền hơn.
- Bạn cần chịu trách nhiệm cho một con số. Tách biệt dữ liệu thô, đã kiểm định và đã quản lý nghĩa là bạn có thể lần ngược một con số gây tranh cãi qua từng biến đổi thay vì tính lại từ đầu.
- Logic biến đổi thay đổi thường xuyên. Như đã đề cập, dữ liệu Bronze được giữ lại là thứ cho phép bạn dựng lại mà không cần quay về nguồn.
Bỏ qua khi:
- Bạn có đội dữ liệu nhỏ và độ phức tạp pipeline hạn chế.
- Dữ liệu đến từ một nguồn duy nhất với ít nhu cầu làm sạch hay biến đổi.
- Chỉ một ứng dụng hoặc đội hạ nguồn sử dụng dữ liệu.
- Yêu cầu báo cáo đơn giản và không đáng để duy trì nhiều lớp xử lý.
Khi hai lớp là đủ
Sơ đồ ba lớp là mặc định, không phải bắt buộc. Với một trường hợp kinh doanh đơn lẻ, Bronze cộng một lớp kết hợp thường là lựa chọn đúng: giữ dữ liệu thô để phát lại, rồi làm sạch và áp dụng logic nghiệp vụ trong một bước.
Chọn hình thái phù hợp với bên tiêu thụ của bạn. Điều bạn không nên gộp là Bronze, bởi đó là lớp bạn không thể tái tạo.
Vì vậy, nếu bạn đang ở giữa và thực sự chưa rõ, xây hai lớp và thêm lớp thứ ba khi có bên tiêu thụ thứ hai xuất hiện là hướng hợp lý. Thêm Gold sau này rẻ hơn nhiều so với bổ sung Bronze khi bạn đã ghi đè dữ liệu thô suốt sáu tháng qua.
Các sai lầm thường gặp khi triển khai Medallion
Hầu hết vấn đề của medallion không nằm ở kiến trúc. Đó là những thỏa hiệp nhỏ dưới áp lực thời hạn, âm thầm loại bỏ lý do bạn xây các lớp ngay từ đầu.
Biến đổi dữ liệu trong Bronze
Toàn bộ lập luận về phát lại dựa trên việc Bronze giữ thứ gì đó sát với những gì nguồn gửi đến. Áp dụng logic nghiệp vụ trước khi đổ dữ liệu xuống, bạn đã mất trạng thái gốc, đồng nghĩa không thể xử lý lại và không có vết kiểm toán.
Điều này thường xảy ra vì lý do hợp lý. Ai đó bỏ một cột chẳng ai dùng để tiết kiệm không gian, hoặc ép kiểu một trường timestamp lộn xộn lúc nạp vì nó làm hỏng job tiếp theo. Sáu tháng sau, cột “không dùng” hóa ra lại quan trọng, và giá trị gốc đã mất. Hãy giữ Bronze sát nguồn nhất có thể trong thực tế, và đặt các bản vá ở Silver.
Làm mờ ranh giới Silver và Gold
Silver làm sạch và chuẩn hóa. Gold trả lời câu hỏi nghiệp vụ. Khi logic chỉ số len sang Silver, mọi tập Gold đều thừa hưởng một định nghĩa mà nó không yêu cầu, và bạn quay lại vấn đề mà medallion vốn dĩ muốn giải quyết.
Bài kiểm tra rất đơn giản: nếu người dùng nghiệp vụ tranh luận về con số, nó thuộc về Gold. Khử trùng lặp là mối quan tâm của Silver. Cái gì được tính là khách hàng đang hoạt động thì không.
Coi ba lớp là bắt buộc
Kiến trúc medallion là mẫu thiết kế logic, không phải yêu cầu mọi pipeline đều có đúng ba lớp vật lý. Bronze, Silver và Gold đại diện cho các giai đoạn logic của việc tinh luyện dữ liệu, và mỗi lớp có thể được triển khai khác nhau tùy khối lượng công việc.
Ví dụ, một lớp có thể dùng bảng vật hóa, view, hoặc các trừu tượng phù hợp khác thay vì yêu cầu một bản sao vật lý riêng của dữ liệu. Mấu chốt là tạo ranh giới có ý nghĩa khi dữ liệu di chuyển từ trạng thái thô đến thứ mà doanh nghiệp có thể tin tưởng và sử dụng, chứ không phải sao chép y chang sơ đồ ba lớp kinh điển.
Để Gold thành bãi chứa
Đây là điều tôi thấy nhiều nhất, và lại ít được bàn tới. Tạo tập Gold rất rẻ, và chẳng ai xóa chúng, nên sau một năm, bạn có thể có bốn mươi bảng, mười một trong số đó là biến thể của doanh thu theo tháng, và không ai nhớ CFO thực sự xem bảng nào.
Silver có tính kỷ luật tự nhiên vì nhiệm vụ được xác định. Gold thì không, nên cần một chủ sở hữu cho mỗi tập dữ liệu và sẵn sàng xóa. Nếu không, bạn sẽ có nhiều phiên bản cạnh tranh của cùng một chỉ số, đúng là vấn đề mà các lớp vốn muốn ngăn chặn.
Kết luận
Điều medallion thực sự mang lại cho bạn là một nơi để chỉ vào khi ai đó hỏi một con số đến từ đâu, và một bản sao dữ liệu gốc để quay lại khi câu trả lời hóa ra sai. Điều đó xứng đáng với dung lượng lưu trữ và số job tăng thêm khi có nhiều đội cùng đọc dữ liệu. Khi chỉ có một đội, hai lớp có thể là giải pháp tốt hơn và tiết kiệm công bảo trì.
Nếu bạn muốn bối cảnh rộng hơn về vị trí của mẫu này, khóa học Hiểu về Kiến trúc Dữ liệu Hiện đại của chúng tôi đề cập đến các nền tảng và công nghệ phía sau các stack dữ liệu hiện đại. Lộ trình Kỹ sư Dữ liệu của chúng tôi đi sâu hơn vào xây dựng và duy trì các pipeline chạy thực tế.
Câu hỏi thường gặp về Kiến trúc Medallion
Bạn có thể dùng kiến trúc medallion mà không có data lakehouse không?
Có. Kiến trúc Medallion là một mẫu thiết kế dữ liệu logic và không gắn cố hữu với nền tảng hay công nghệ lakehouse cụ thể. Tuy nhiên, lakehouse thường phù hợp vì hỗ trợ lưu trữ cả dữ liệu thô và dữ liệu tinh luyện, đồng thời cung cấp các khả năng cần cho phân tích và xử lý dữ liệu.
Dữ liệu Silver có thể dùng trực tiếp cho phân tích không?
Có. Gold không phải là cổng bắt buộc cho mọi truy vấn. Kỹ sư dữ liệu, nhà khoa học dữ liệu và những người dùng kỹ thuật khác có thể làm việc trực tiếp với dữ liệu Silver đã kiểm định khi cần bản ghi chi tiết. Gold thường hữu ích hơn khi người dùng cần các chỉ số đã quản lý, tổng hợp, hoặc tập dữ liệu theo đặc thù nghiệp vụ.
Điều gì xảy ra khi lược đồ nguồn thay đổi?
Lý tưởng là lớp thô ghi nhận dữ liệu vào mà không để thay đổi lược đồ ngoài ý muốn âm thầm làm hỏng các tập dữ liệu hạ nguồn. Silver sau đó có thể kiểm định và hòa giải lược đồ mới trước khi dữ liệu thay đổi đến được các đầu ra hướng nghiệp vụ. Tuy nhiên, hành vi chính xác phụ thuộc vào công cụ nạp và định dạng bảng của bạn.
Ai nên sở hữu mỗi lớp medallion?
Không nhất thiết phải thay đổi quyền sở hữu ở mỗi lớp. Một miền hoặc đội dữ liệu có thể sở hữu toàn bộ pipeline, hoặc trách nhiệm có thể được chia giữa các đội nạp, nền tảng, miền và phân tích. Điều quan trọng là có quyền sở hữu rõ ràng cho chất lượng dữ liệu và logic biến đổi ở mỗi giai đoạn.
Tôi có cần lưu trữ riêng cho Bronze, Silver và Gold không?
Không hẳn. Các lớp đại diện cho ranh giới logic, không phải các hệ thống lưu trữ riêng. Chúng có thể cùng tồn tại trong một object store, lakehouse hoặc nền tảng, trong khi được tách biệt qua catalog, schema, bảng hoặc các cấu trúc tổ chức khác.
Srujana là một cây bút công nghệ tự do với bằng Cử nhân Khoa học Máy tính. Việc viết về nhiều chủ đề như khoa học dữ liệu, điện toán đám mây, phát triển, lập trình, bảo mật và nhiều lĩnh vực khác đến với cô một cách tự nhiên. Cô yêu thích văn học kinh điển và khám phá những điểm đến mới.
Tom là một nhà khoa học dữ liệu và giảng viên kỹ thuật. Anh viết và quản lý các bài hướng dẫn và bài blog về khoa học dữ liệu của DataCamp. Trước đây, Tom làm việc trong lĩnh vực khoa học dữ liệu tại Deutsche Telekom.

