Chuyển đến nội dung chính

Khóa học

Xử lý dữ liệu thiếu trong R

Cơ bản4 giờ

Dễ hình dung, khám phá và điền dữ liệu thiếu với naniar, cách tiếp cận thân thiện tidyverse cho dữ liệu thiếu.

R4 giờ14 video52 bài tập4,350 XP17,313Giấy chứng nhận thành tích

Tạo tài khoản miễn phí

Tiếp tục với Google
hoặc
Bằng việc tiếp tục, ban chấp nhận Điều khoản sử dụng, của chúng tôi Chính sách bảo mật và rằng dữ liệu của bạn được lưu trữ tại Hoa Kỳ.

Được người học tại hàng nghìn công ty yêu thích

Đào tạo đội ngũ?

Dùng thử cho Doanh nghiệp

Mô tả khóa học

Dữ liệu thiếu là một phần của mọi phân tích dữ liệu thực tế. Chúng có thể xuất hiện ở những nơi không ngờ tới, khiến việc phân tích khó hiểu hơn. Trong khóa học này, bạn sẽ học cách sử dụng các công cụ của tidyverse và gói naniar trong R để trực quan hóa giá trị thiếu. Bạn sẽ dọn dẹp giá trị thiếu để có thể dùng trong phân tích và khám phá giá trị thiếu để phát hiện sai lệch trong dữ liệu. Cuối cùng, bạn sẽ làm rõ các mô thức thiếu ẩn khác. Bạn cũng sẽ học cách “điền vào chỗ trống” cho các giá trị thiếu bằng các mô hình nội suy (imputation), cũng như cách trực quan hóa, đánh giá và đưa ra quyết định dựa trên các tập dữ liệu đã được nội suy này.

Yêu cầu tiên quyết

Chương trình học

Đề cương khóa học

1

Vì sao cần quan tâm đến dữ liệu thiếu?

Chương 1 giới thiệu về dữ liệu thiếu: giá trị thiếu là gì, cách chúng hoạt động trong R, cách phát hiện và đếm chúng. Tiếp theo, chúng ta giới thiệu các tóm tắt về dữ liệu thiếu và cách tóm tắt mức độ thiếu theo từng bản ghi, từng biến, cũng như cách khám phá theo các nhóm trong dữ liệu. Cuối cùng, chúng ta thảo luận về trực quan hóa dữ liệu thiếu: cách tạo biểu đồ tổng quan cho toàn bộ tập dữ liệu và theo biến, bản ghi, cùng các tóm tắt khác, và cách khám phá chúng theo từng nhóm.
Bắt đầu chương
2

Xử lý và dọn dẹp giá trị thiếu

Trong chương hai, bạn sẽ học cách phát hiện các giá trị thiếu ẩn như “missing” hoặc “N/A” và thay chúng bằng `NA`. Bạn sẽ học cách xử lý hiệu quả các giá trị thiếu ngầm định — những giá trị được ngụ ý là thiếu nhưng không được liệt kê rõ ràng. Chúng tôi cũng đề cập cách khám phá sự phụ thuộc của dữ liệu thiếu, thảo luận về Missing Completely at Random (MCAR), Missing At Random (MAR), Missing Not At Random (MNAR), và ý nghĩa của chúng đối với phân tích dữ liệu của bạn.
Bắt đầu chương
3

Kiểm định mối quan hệ của dữ liệu thiếu

Trong chương này, bạn sẽ tìm hiểu các quy trình làm việc với dữ liệu thiếu. Chúng tôi giới thiệu các cấu trúc dữ liệu đặc biệt: ma trận bóng (shadow matrix) và dữ liệu nabular, và minh họa cách dùng chúng trong quy trình khám phá dữ liệu thiếu để bạn có thể liên kết các tóm tắt về mức độ thiếu trở lại với giá trị trong dữ liệu. Bạn sẽ học cách dùng ggplot để khám phá và trực quan hóa cách giá trị thay đổi khi các biến khác bị thiếu. Cuối cùng, bạn sẽ học cách trực quan hóa mức độ thiếu trên hai biến, và cách cũng như lý do để trực quan hóa dữ liệu thiếu trong biểu đồ phân tán.
Bắt đầu chương
4

Nối các điểm (Nội suy/Imputation)

Trong chương này, bạn sẽ học về việc điền các giá trị còn thiếu trong dữ liệu, gọi là nội suy (imputation). Bạn sẽ học cách nội suy và theo dõi giá trị thiếu, cùng các đặc điểm tốt và hạn chế của nội suy để có thể khám phá, trực quan hóa và đánh giá dữ liệu đã nội suy so với giá trị gốc. Bạn sẽ học cách sử dụng, đánh giá và so sánh các mô hình nội suy khác nhau, và khám phá cách các mô hình nội suy khác nhau ảnh hưởng đến các kết luận bạn rút ra từ mô hình.
Bắt đầu chương
R

Xử lý dữ liệu thiếu trong R

Hoàn
thành khóa học

Nhận Chứng nhận Hoàn thành

Đăng ký ngay

Phát triển kỹ năng dữ liệu với DataCamp for Mobile

Tiến bộ mọi lúc mọi nơi với các khóa học di động và thử thách lập trình 5 phút hàng ngày.