Chuyển đến nội dung chính

Khóa học

Nhập môn Xử lý Ngôn ngữ Tự nhiên với R

Trung cấp4 giờ

R4 giờ15 video47 bài tập3,750 XP8,579Giấy chứng nhận thành tích

Tạo tài khoản miễn phí

Tiếp tục với Google
hoặc
Bằng việc tiếp tục, ban chấp nhận Điều khoản sử dụng, của chúng tôi Chính sách bảo mật và rằng dữ liệu của bạn được lưu trữ tại Hoa Kỳ.

Được người học tại hàng nghìn công ty yêu thích

Đào tạo đội ngũ?

Dùng thử cho Doanh nghiệp

Mô tả khóa học

Giống như mọi khóa học nền tảng, Nhập môn Xử lý Ngôn ngữ Tự nhiên với R được thiết kế để trang bị cho bạn các công cụ cần thiết để bắt đầu hành trình phân tích văn bản. Natural language processing (NLP) là một lĩnh vực luôn phát triển trong khoa học dữ liệu, với nhiều bước tiến thú vị trong thập kỷ qua. Khóa học này sẽ bao quát những kiến thức cơ bản và giúp bạn sẵn sàng mở rộng năng lực phân tích. Chúng ta sẽ tìm hiểu regular expressions, topic modeling, named entity recognition và các nội dung khác, đi kèm các ví dụ chi tiết mà bạn có thể dùng để khởi động những phân tích sau này.

Yêu cầu tiên quyết

Chương trình học

Đề cương khóa học

1

Những nền tảng cốt lõi

Chương 1 của Nhập môn Xử lý Ngôn ngữ Tự nhiên chuẩn bị cho bạn chạy phân tích văn bản đầu tiên. Bạn sẽ khám phá regular expressions và tokenization, hai thành phần phổ biến nhất trong hầu hết các tác vụ phân tích. Với regular expressions, bạn có thể tìm kiếm bất kỳ mẫu nào bạn nghĩ đến; còn với tokenization, bạn có thể chuẩn bị và làm sạch văn bản cho các phân tích nâng cao hơn. Chương này là bước đệm cần thiết để xử lý các kỹ thuật mà chúng ta sẽ học ở những chương tiếp theo của khóa học.
Bắt đầu chương
2

Biểu diễn văn bản

Trong chương này, bạn sẽ học các cách phân tích văn bản phổ biến và được nghiên cứu nhiều nhất. Bạn sẽ xem cách tạo một text corpus, mở rộng biểu diễn bag-of-words thành ma trận TFIDF, và dùng thước đo cosine-similarity để xác định mức độ tương đồng giữa hai đoạn văn bản. Bạn sẽ củng cố nền tảng để thực hành NLP trước khi đi sâu vào các ứng dụng của NLP ở chương 3 và 4.
Bắt đầu chương
3

Ứng dụng: Phân loại và Topic Modeling

Chương 3 tập trung vào hai cách tiếp cận phân tích văn bản phổ biến: mô hình phân loại và topic modeling. Nếu bạn làm việc với các dự án phân tích văn bản, bạn gần như chắc chắn sẽ dùng một hoặc cả hai phương pháp này. Chương này hướng dẫn bạn cách thực hiện cả hai kỹ thuật và cung cấp góc nhìn thực tiễn về cách tiếp cận chúng.
Bắt đầu chương
4

Kỹ thuật nâng cao

Ở chương 4, chúng ta tìm hiểu hai trụ cột của xử lý ngôn ngữ tự nhiên: sentiment analysis và word embeddings. Đây là hai kỹ thuật phân tích mà bất kỳ ai học nền tảng phân tích văn bản cũng nên biết. Bên cạnh đó, bạn sẽ lướt qua BERT, gán nhãn từ loại (part-of-speech tagging), và named entity recognition. Gần 15 kỹ thuật phân tích khác nhau đã được đề cập trong khóa học, vì vậy chương 4 sẽ kết thúc bằng phần tổng kết lại tất cả các kỹ thuật hữu ích mà bạn sẽ học trong khóa này.
Bắt đầu chương
R

Nhập môn Xử lý Ngôn ngữ Tự nhiên với R

Hoàn
thành khóa học

Nhận Chứng nhận Hoàn thành

Đăng ký ngay

Phát triển kỹ năng dữ liệu với DataCamp for Mobile

Tiến bộ mọi lúc mọi nơi với các khóa học di động và thử thách lập trình 5 phút hàng ngày.