Mais de 700 cursos, metade do preço
Descrição do curso
Esse curso é ideal para engenheiros de dados, cientistas de dados e profissionais de machine learning que querem trabalhar com grandes conjuntos de dados de forma eficiente. Se você está mudando de ferramentas como Pandas ou mergulhando nas tecnologias de big data pela primeira vez, este curso oferece uma introdução sólida ao PySpark e ao processamento distribuído de dados.
Por que Spark? Por que agora?
Descubra a velocidade e a escalabilidade do Apache Spark, a poderosa estrutura projetada para lidar com big data. Com aulas interativas e exercícios práticos, você vai ver como o processamento em memória do Spark dá uma vantagem sobre estruturas tradicionais como o Hadoop. Você vai começar configurando sessões do Spark e mergulhando em componentes essenciais, como Conjuntos de Dados Distribuídos Resilientes (RDDs) e DataFrame. Aprenda a filtrar, agrupar e juntar conjuntos de dados com facilidade enquanto trabalha com exemplos reais.Melhore suas habilidades em Python e SQL para Big Data
Aprenda a usar o PySpark SQL para consultar e gerenciar dados usando a sintaxe SQL que você já conhece. Lide com esquemas, tipos de dados complexos e funções definidas pelo usuário (UDFs), enquanto desenvolve habilidades em cache e otimização de desempenho para sistemas distribuídos.Crie suas bases de Big Data
Ao final deste curso, você vai ter confiança pra lidar, consultar e processar big data usando o PySpark. Com essas habilidades básicas, você estará pronto para explorar tópicos avançados, como machine learning e análise de big data.Pré-requisitos
Programa de estudos
Conteúdo do curso
1
Introdução ao Apache Spark e ao PySpark
Uma introdução geral ao PySpark e à computação distribuída. Esta seção apresenta o PySpark, os DataFrames do PySpark e os RDDs.
- Introdução ao PySpark50 XP
- Criando uma SparkSession100 XP
- Carregando dados do censo100 XP
- Introdução aos DataFrames do PySpark50 XP
- Escalabilidade e desempenho50 XP
- Lendo um CSV e fazendo agregações100 XP
- Filtrando por empresa100 XP
- Mais sobre Spark DataFrames50 XP
- Inferir e filtrar100 XP
- Especificação de schema100 XP
2
PySpark em Python
Continuação sobre DataFrames e tipos de dados complexos. Esta seção aprofunda o que os DataFrames oferecem no PySpark e apresenta alguns conceitos do Spark SQL.
3
Introdução ao PySpark SQL
Aprofunde-se em como aproveitar o Spark SQL e o PySpark para processamento de dados em escala, combinando a simplicidade do SQL com o poder de computação distribuída do PySpark para lidar com grandes conjuntos de dados com eficiência.
S
Introdução ao PySpark
Curso
concluído
Obtenha o certificado de conclusão
Inscreva-se agoraNão acredite só na nossa palavra
4.7*de 2,627 avaliações
81%
17%
2%
0%
0%
Hanne Vien
Jiajing
Natthaorn
Depois de fazer esses cursos, sinto-me confiante para criar visualizações e painéis profissionais
Shoebur RahmanEspecialista em compras, Giz Bangladesh

Para alguém que não tem uma sólida formação em programação, o DataCamp foi realmente amigável para iniciantes. Você assiste a alguns vídeos e depois pratica imediatamente - consegui aprender rapidamente
Ebuka NwafornsoEstudante de pós-graduação, University College Dubllin

O DataCamp é uma maneira econômica de você aprimorar suas habilidades e permanecer relevante com dados e IA. Ele é estruturado, prático e permite que você aplique o que aprendeu imediatamente
Raul RomeroGerente de Produto III, Ebay
Junte-se a mais de 19 milhões de alunos e comece Introdução ao PySpark hoje!
Crie sua conta gratuita
Continuar com o Googleou
Ao continuar, você aceita nossos Termos de uso, nosso Política de privacidade e que seus dados sejam armazenados nos EUA.