Build your ultimate AI agent
코스 설명
데이터 과학자로서 방대한 텍스트에서 핵심 정보를 추출하거나, 문자열이 포함된 지저분한 데이터를 정리하거나, 유용한 단어를 찾기 위해 패턴을 감지하고 일치시키는 상황을 자주 마주하게 됩니다. 이는 모두 텍스트 마이닝의 일부이며 Machine Learning 알고리즘을 적용하기 전에 반드시 거치는 중요한 단계예요. 이 강의에서는 문자열 조작과 정규 표현식의 핵심 개념을 이해하도록 안내합니다. 문자열을 분할하고 다시 결합하며, 보간하고, 정규 표현식을 사용해 문자열을 감지·추출·교체·매칭하는 방법을 배우게 됩니다. 이러한 기술을 익히는 과정에서, 감성 판단에 활용할 수 있는 영화 리뷰나 스트리밍된 트윗 데이터셋, 그리고 웹에서 수집한 원시 텍스트로 실습해 보세요.
사전 요구 사항
커리큘럼
코스 개요
1
문자열 조작의 기본 개념
정규 표현식의 세계로 첫발을 내딛어 보세요! 슬라이싱과 연결, 대소문자 변환, 공백 제거부터 문자열 찾기와 바꾸기까지. 영화 리뷰 데이터셋을 사용해 문자열 조작의 기본 작업을 탄탄하게 익히게 됩니다.
2
문자열 포매팅
여정을 이어가며, 웹에서 수집한 정보를 담은 데이터셋을 사용해 Python에서 문자열을 포매팅하거나 보간하는 대표적인 방법들을 배웁니다. 위치 기반 포매팅, 문자열 상수 안에 표현식을 삽입하는 방식, 그리고 Template 클래스를 사용할 때의 장단점을 살펴봅니다.
3
패턴 매칭을 위한 정규 표현식
이제 정규 표현식의 핵심 개념을 알아볼 차례입니다! 이 중요한 장에서는 정규 표현식 문법의 기본을 이해합니다. 감성 분석을 위해 수집된 실제 트윗 데이터셋을 사용하여 일반 문자와 특수 문자, 그리고 greedy/비-greedy(게으른) 수량자를 활용한 패턴 매칭을 적용해 봅니다.
4
정규 표현식 심화
여정의 마지막 단계에서는, 괄호로 문자열을 그룹화하거나 이전에 일치한 동일한 텍스트를 다시 매칭하는 등 더 복잡한 패턴 매칭 기법을 배웁니다. 또한 주변을 살펴보는(lookaround) 표현식을 어떻게 사용할 수 있는지도 소개합니다.
Python에서의 정규 표현식
코스
완료

