Ir al contenido principal

Curso

Machine learning con PySpark

Avanzado4 h

Haz predicciones a partir de datos con Apache Spark mediante árboles de decisión, regresión logística, regresión lineal, ensambles y pipelines.

Python4 h16 vídeos56 ejercicios4,550 XP29,837Certificado de logro

Crea tu cuenta gratis

Continuar con Google
o
Al continuar, aceptas nuestros los Términos de uso, nuestro la Política de privacidad y que tus datos se almacenan en EE. UU.

Les encanta a estudiantes de miles de empresas

¿Formando a un equipo?

Prueba para empresas

Descripción del curso

Aprende a utilizar Apache Spark para el machine learning

Spark es una potente herramienta de propósito general para trabajar con Big Data. Spark gestiona de forma transparente la distribución de tareas de cálculo en un clúster. Esto significa que las operaciones son rápidas, pero también te permite centrarte en el análisis en lugar de preocuparte por los detalles técnicos. En este curso aprenderás a introducir datos en Spark y, a continuación, profundizarás en los tres algoritmos fundamentales de Spark Machine learning: Regresión lineal, regresión logística/clasificadores y creación de pipelines.

Construir y probar árboles de decisión

Construir tus propios árboles de decisión es una forma estupenda de empezar a explorar los modelos de machine learning. Utilizarás un algoritmo llamado "Partición Recursiva" para dividir los datos en dos clases y encontrar un predictor dentro de tus datos que dé como resultado la división más informativa de las dos clases, y repetirás esta acción con más nodos. Luego puedes utilizar tu árbol de decisión para hacer predicciones con nuevos datos.

Domina la Regresión Logística y Lineal en PySpark

La regresión logística y lineal son técnicas esenciales de machine learning compatibles con PySpark. Aprenderás a construir y evaluar modelos de regresión logística, antes de pasar a crear modelos de regresión lineal para ayudarte a refinar tus predictores a sólo las opciones más relevantes.

Al final del curso, te sentirás seguro al aplicar tus nuevos conocimientos sobre machine learning, gracias a las tareas prácticas y a los conjuntos de datos de práctica que encontrarás a lo largo del curso.

Requisitos previos

Programa de formación

Contenido del curso

1

Introducción

Spark es un marco para trabajar con Big Data. En este capítulo cubrirás algunos antecedentes sobre Spark y el machine learning. A continuación, descubrirás cómo conectarte a Spark utilizando Python y cargar datos CSV.
Empezar capítulo

Machine learning con PySpark

Curso
completado

Obtén el certificado de logro

Inscríbete ahora

Desarrolla tus habilidades con la aplicación móvil de DataCamp

Progresa sobre la marcha con nuestros cursos móviles y desafíos diarios de 5 minutos.