Saltar al contenido principal

Curso

Fundamentos de big data con PySpark

Avanzado4 h

Aprende los conceptos básicos sobre trabajar con big data con PySpark.

Python4 h16 vídeos55 ejercicios4,600 XP66,399Certificado de logro

Crea tu cuenta gratuita

Continuar con Google
o
Al continuar, aceptas nuestra Términos de uso, nuestros Política de privacidad y que tus datos se almacenen en EE. UU.

La eligen estudiantes de miles de empresas

¿Formas a un equipo?

Prueba para empresas

Descripción del curso

El big data ha causado mucho alboroto en los últimos años, y por fin es dominante en muchas empresas. Sin embargo, ¿qué es este big data? Este curso muestra los fundamentos del big data mediante PySpark. Spark es un marco de "Lightning-Fast Cluster Computing" para big data. Proporciona un motor de plataforma general de procesamiento de datos y te permite ejecutar programas hasta 100 veces más rápidamente en memoria, o 10 veces más rápido en disco, que Hadoop. Utilizarás PySpark, un paquete de Python para programación en Spark y sus potentes bibliotecas de nivel superior, como SparkSQL, MLlib (para machine learning), etc. Explorarás las obras de William Shakespeare, analizarás datos de 2018 de la FIFA y realizarás agrupamiento en conjuntos de datos genómicos. Al final de este curso, conocerás a la perfección PySpark y su aplicación al análisis general de big data.

Requisitos previos

Programa de formación

Esquema del curso

1

Introducción al análisis de big data con Spark

Este capítulo presenta el apasionante mundo del big data, así como los diversos conceptos y los diferentes marcos para procesar big data. Comprenderás por qué Apache Spark se considera el mejor marco para big data.
Empezar capítulo

Fundamentos de big data con PySpark

Curso
completado

Obtener certificado de logros

Inscríbete ahora

Desarrolla tus habilidades en datos con DataCamp para móviles

Avanza estés donde estés con nuestros cursos para móvil y retos de programación diarios de 5 minutos.