Build your ultimate AI agent
Descrição do curso
Aprenda a usar o Apache Spark para aprendizado de máquina
O Spark é uma ferramenta avançada e de uso geral para trabalhar com Big Data. O Spark lida de forma transparente com a distribuição de tarefas de computação em um cluster. Isso significa que as operações são rápidas, mas também permite que você se concentre na análise em vez de se preocupar com detalhes técnicos. Neste curso, você aprenderá como colocar os dados no Spark e, em seguida, se aprofundará nos três algoritmos fundamentais do Spark Machine Learning: Regressão linear, regressão logística/classificadores e criação de pipelines.Criar e testar árvores de decisão
Criar suas próprias árvores de decisão é uma ótima maneira de começar a explorar os modelos de aprendizado de máquina. Você usará um algoritmo chamado "Recursive Partitioning" para dividir os dados em duas classes e encontrar um preditor dentro dos dados que resulte na divisão mais informativa das duas classes, e repetirá essa ação com outros nós. Em seguida, você pode usar a árvore de decisão para fazer previsões com novos dados.Domine a regressão logística e linear no PySpark
A regressão logística e linear são técnicas essenciais de aprendizado de máquina que são suportadas pelo PySpark. Você aprenderá a criar e avaliar modelos de regressão logística, antes de passar para a criação de modelos de regressão linear para ajudá-lo a refinar seus preditores para apenas as opções mais relevantes.Ao final do curso, você se sentirá confiante para aplicar seus novos conhecimentos de aprendizado de máquina, graças às tarefas práticas e aos conjuntos de dados práticos encontrados ao longo do curso.
Pré-requisitos
Programa de estudos
Conteúdo do curso
1
Introdução
O Spark é uma estrutura para você trabalhar com Big Data. Neste capítulo, você abordará algumas informações básicas sobre o Spark e o machine learning. Em seguida, você descobrirá como se conectar ao Spark usando Python e carregar dados CSV.
2
Classificação
Agora que você está familiarizado com a obtenção de dados no Spark, passará a criar dois tipos de modelo de classificação: Árvores de decisão e regressão logística. Você também conhecerá algumas abordagens para a preparação de dados.
3
Regressão
Em seguida, você aprenderá a criar modelos de regressão linear. Você também descobrirá como aumentar seus dados com a engenharia de novos preditores, bem como uma abordagem robusta para selecionar apenas os preditores mais relevantes.
4
Conjuntos e pipelines
Por fim, você aprenderá a tornar seus modelos mais eficientes. Você descobrirá como usar pipelines para tornar seu código mais claro e fácil de manter. Em seguida, você usará a validação cruzada para testar melhor seus modelos e selecionar bons parâmetros de modelo. Por fim, você se dedicará a dois tipos de modelo de conjunto.
Machine learning com PySpark
Curso
concluído

