After doing these courses, I feel confident creating professional visualizations and dashboards
Mô tả khóa học
Dữ liệu thiếu là một phần của mọi phân tích dữ liệu thực tế. Chúng có thể xuất hiện ở những nơi không ngờ tới, khiến việc phân tích khó hiểu hơn. Trong khóa học này, bạn sẽ học cách sử dụng các công cụ của tidyverse và gói naniar trong R để trực quan hóa giá trị thiếu. Bạn sẽ dọn dẹp giá trị thiếu để có thể dùng trong phân tích và khám phá giá trị thiếu để phát hiện sai lệch trong dữ liệu. Cuối cùng, bạn sẽ làm rõ các mô thức thiếu ẩn khác. Bạn cũng sẽ học cách “điền vào chỗ trống” cho các giá trị thiếu bằng các mô hình nội suy (imputation), cũng như cách trực quan hóa, đánh giá và đưa ra quyết định dựa trên các tập dữ liệu đã được nội suy này.
Yêu cầu tiên quyết
Chương trình học
Đề cương khóa học
1
Vì sao cần quan tâm đến dữ liệu thiếu?
Chương 1 giới thiệu về dữ liệu thiếu: giá trị thiếu là gì, cách chúng hoạt động trong R, cách phát hiện và đếm chúng. Tiếp theo, chúng ta giới thiệu các tóm tắt về dữ liệu thiếu và cách tóm tắt mức độ thiếu theo từng bản ghi, từng biến, cũng như cách khám phá theo các nhóm trong dữ liệu. Cuối cùng, chúng ta thảo luận về trực quan hóa dữ liệu thiếu: cách tạo biểu đồ tổng quan cho toàn bộ tập dữ liệu và theo biến, bản ghi, cùng các tóm tắt khác, và cách khám phá chúng theo từng nhóm.
- Giới thiệu về dữ liệu khuyết50 XP
- Sử dụng và tìm giá trị thiếu100 XP
- Có bao nhiêu giá trị bị thiếu?100 XP
- Làm việc với giá trị thiếu50 XP
- Vì sao cần quan tâm đến giá trị thiếu?50 XP
- Tóm tắt dữ liệu bị thiếu100 XP
- Lập bảng tình trạng thiếu dữ liệu100 XP
- Các tổng quan khác về dữ liệu thiếu100 XP
- Chúng ta trực quan hóa giá trị thiếu như thế nào?50 XP
- Hình ảnh hóa đầu tiên về dữ liệu thiếu100 XP
- Trực quan hóa các trường hợp và biến bị thiếu100 XP
- Trực quan hóa các mẫu thiếu dữ liệu100 XP
2
Xử lý và dọn dẹp giá trị thiếu
Trong chương hai, bạn sẽ học cách phát hiện các giá trị thiếu ẩn như “missing” hoặc “N/A” và thay chúng bằng `NA`. Bạn sẽ học cách xử lý hiệu quả các giá trị thiếu ngầm định — những giá trị được ngụ ý là thiếu nhưng không được liệt kê rõ ràng. Chúng tôi cũng đề cập cách khám phá sự phụ thuộc của dữ liệu thiếu, thảo luận về Missing Completely at Random (MCAR), Missing At Random (MAR), Missing Not At Random (MNAR), và ý nghĩa của chúng đối với phân tích dữ liệu của bạn.
3
Kiểm định mối quan hệ của dữ liệu thiếu
Trong chương này, bạn sẽ tìm hiểu các quy trình làm việc với dữ liệu thiếu. Chúng tôi giới thiệu các cấu trúc dữ liệu đặc biệt: ma trận bóng (shadow matrix) và dữ liệu nabular, và minh họa cách dùng chúng trong quy trình khám phá dữ liệu thiếu để bạn có thể liên kết các tóm tắt về mức độ thiếu trở lại với giá trị trong dữ liệu. Bạn sẽ học cách dùng ggplot để khám phá và trực quan hóa cách giá trị thay đổi khi các biến khác bị thiếu. Cuối cùng, bạn sẽ học cách trực quan hóa mức độ thiếu trên hai biến, và cách cũng như lý do để trực quan hóa dữ liệu thiếu trong biểu đồ phân tán.
4
Nối các điểm (Nội suy/Imputation)
Trong chương này, bạn sẽ học về việc điền các giá trị còn thiếu trong dữ liệu, gọi là nội suy (imputation). Bạn sẽ học cách nội suy và theo dõi giá trị thiếu, cùng các đặc điểm tốt và hạn chế của nội suy để có thể khám phá, trực quan hóa và đánh giá dữ liệu đã nội suy so với giá trị gốc. Bạn sẽ học cách sử dụng, đánh giá và so sánh các mô hình nội suy khác nhau, và khám phá cách các mô hình nội suy khác nhau ảnh hưởng đến các kết luận bạn rút ra từ mô hình.
R
Xử lý dữ liệu thiếu trong R
Hoàn
thành khóa học

