본문으로 바로가기

코스

Python으로 배우는 NLP 피처 엔지니어링

중급4시간

텍스트에서 유용한 정보를 추출하고, 머신러닝에 적합한 형식으로 가공하는 기법을 학습합니다.

Python4시간15개 동영상52개 연습 문제4,200 XP29,428수료 확인서

무료 계정 만들기

Google에서 계속 진행
또는
계속 진행하시면 다음 약관에 동의하는 것으로 간주됩니다: 이용약관, 우리의 개인정보 처리방침 그리고 귀하의 데이터가 미국에 저장된다는 점입니다.

수천 개 기업의 학습자가 선택한 서비스

코스 설명

이 강의에서는 텍스트에서 유용한 정보를 추출하고 ML 모델에 적용하기 적합한 형식으로 처리하는 기법을 학습해요. 구체적으로 POS 태깅, 개체명 인식(NER), 가독성 점수, n-gram과 tf-idf 모델을 배우고, 이를 scikit-learn과 spaCy로 구현하는 방법을 익힙니다. 또한 두 문서가 서로 얼마나 유사한지도 계산해 볼 거예요. 실습을 통해 영화 리뷰의 감성을 예측하고, 영화와 TED Talk 추천 시스템을 만들어 봅니다. 강의를 마치고 나면 어떤 텍스트에서도 핵심 피처를 설계해 내고, 데이터 사이언스의 까다로운 문제들을 해결할 수 있게 될 거예요!

사전 요구 사항

커리큘럼

코스 개요

1

기본 피처와 가독성 점수

단어 수, 문자 수, 평균 단어 길이, 특수 문자 수(예: 트위터 해시태그와 멘션) 같은 기본 피처를 계산하는 방법을 배워요. 또한 가독성 점수를 계산하고, 한 텍스트를 이해하는 데 필요한 교육 수준을 추정하는 방법도 익힙니다.
챕터 시작하기
2

텍스트 전처리, POS 태깅, NER

이 장에서는 토크나이즈와 표제어 추출(레mmatization)을 학습해요. 이어서 spaCy 라이브러리를 사용해 텍스트 클리닝, 품사(POS) 태깅, 개체명 인식(NER)을 수행하는 방법을 배웁니다. 개념을 익힌 뒤에는 게티즈버그 연설을 기계가 읽기 쉽게 변환하고, 가짜 뉴스에서 명사 사용을 분석하며, TechCrunch 기사에 언급된 인물을 식별해 볼 거예요.
챕터 시작하기

Python으로 배우는 NLP 피처 엔지니어링

코스
완료

성취 확인서 획득하기

지금 등록하기

DataCamp for Mobile로 데이터 스킬을 키워보세요

모바일 강의와 매일 5분 코딩 챌린지로 이동 중에도 학습을 진행하세요.

Python으로 배우는 NLP 피처 엔지니어링 | DataCamp