Build your ultimate AI agent
코스 설명
특성 수가 너무 많은 데이터세트를 다루고 계신가요? 그 모든 특성이 필요하신가요? 어떤 것들이 가장 중요한가요? 이 강의에서는 데이터와 데이터로 구축하는 모델을 단순화하면서도 원본 데이터의 정보와 우수한 예측 성능을 유지하는 데 도움이 되는 차원 축소 기법을 배우게 됩니다.
우리는 정보 과잉의 시대, 정보화 시대에 살고 있습니다. 데이터에서 핵심 정보를 추출하는 기술은 시장성 있는 역량입니다. 축소된 데이터로 모델은 더 빠르게 학습합니다. 프로덕션 환경에서는 더 작은 모델이 더 빠른 응답 시간을 의미합니다. 무엇보다도, 더 작은 데이터와 모델은 종종 이해하기 더 쉽습니다. 차원 축소는 데이터 과학에서 당신의 오컴의 면도날입니다.
특성 선택과 특성 추출의 차이! R을 사용하여 정보가 적거나 중복된 특성을 식별하고 제거하는 방법을 배우며, 가장 많은 정보를 담은 특성은 유지하게 됩니다. 그것이 특성 선택입니다. 또한 최대한의 정보를 담은 응축된 구성 요소로 특성의 조합을 추출하는 방법도 배우게 됩니다. 그것이 특성 추출입니다!
하지만 무엇보다도, R의 새로운 tidymodel 패키지를 사용하여 실제 데이터를 활용해 특성을 줄이면서도 성능 저하를 크게 겪지 않는 모델을 구축하게 됩니다.
왜 차원 축소를 배워야 할까요?
우리는 정보 과잉의 시대, 정보화 시대에 살고 있습니다. 데이터에서 핵심 정보를 추출하는 기술은 시장성 있는 역량입니다. 축소된 데이터로 모델은 더 빠르게 학습합니다. 프로덕션 환경에서는 더 작은 모델이 더 빠른 응답 시간을 의미합니다. 무엇보다도, 더 작은 데이터와 모델은 종종 이해하기 더 쉽습니다. 차원 축소는 데이터 과학에서 당신의 오컴의 면도날입니다.
이 강의에서 무엇을 배우게 되나요?
특성 선택과 특성 추출의 차이! R을 사용하여 정보가 적거나 중복된 특성을 식별하고 제거하는 방법을 배우며, 가장 많은 정보를 담은 특성은 유지하게 됩니다. 그것이 특성 선택입니다. 또한 최대한의 정보를 담은 응축된 구성 요소로 특성의 조합을 추출하는 방법도 배우게 됩니다. 그것이 특성 추출입니다!
하지만 무엇보다도, R의 새로운 tidymodel 패키지를 사용하여 실제 데이터를 활용해 특성을 줄이면서도 성능 저하를 크게 겪지 않는 모델을 구축하게 됩니다.
사전 요구 사항
커리큘럼
코스 개요
1
차원 축소의 기초
대용량 데이터셋을 더 단순하게 만들어 볼 준비를 하세요! 정보의 개념, 피처 중요도 평가 방법을 배우고, 정보량이 낮은 피처를 식별하는 연습을 합니다. 이 장을 마치면 차원 축소의 두 가지 접근 방식인 피처 선택과 피처 추출의 차이를 이해하게 됩니다.
2
피처 중요도를 위한 피처 선택
결측치 비율, 분산, 상관관계를 활용해 정보가 많은 피처와 정보가 적은 피처를 식별하는 방법을 배웁니다. 그런 다음 이러한 정보 지표를 사용해 피처를 선택하는 tidymodels 레시피를 만드는 방법을 살펴봅니다.
3
모델 성능을 위한 피처 선택
3장에서는 비지도 학습과 지도 학습 기반 피처 선택의 차이를 소개합니다. tidymodels 워크플로를 사용해 모델을 구축하는 절차를 복습한 뒤, lasso 회귀와 랜덤 포레스트 모델로 지도 학습 기반 피처 선택을 수행합니다.
4
피처 추출과 모델 성능
마지막 장에서는 주성분이 서로 다른 피처에서 가장 중요한 정보를 어떻게 추출하고 결합하는지 이해하여 피처 추출에 대한 직관을 탄탄히 다집니다. 이어서 세 가지 피처 추출 기법 — 주성분 분석(PCA), t-SNE, UMAP — 을 학습하고 적용해 봅니다. 또한 tidymodels의 모델 구축 과정에서 이러한 피처 추출 방법을 전처리 단계로 활용하는 방법을 알아봅니다.
R
R에서의 차원 축소
코스
완료

