Machine learning é uma das habilidades mais valiosas em ciência de dados. Com machine learning, profissionais de dados conseguem fazer previsões sobre conjuntos de dados importantes, automatizar fluxos de trabalho e extrair insights. Mas como é o fluxo de trabalho de machine learning? Este infográfico apresenta uma visão simplificada desse fluxo.
Baixe este infográfico clicando na imagem
Configuração do projeto
Entenda os objetivos de negócio
Converse com as partes interessadas e entenda a fundo o objetivo de negócio por trás do modelo proposto. Esse entendimento profundo vai ajudar você a definir o escopo da solução técnica necessária, as fontes de dados a serem coletadas, como avaliar a performance do modelo e muito mais.
Escolha a solução para o seu problema
Depois de entender bem o problema, foque em qual categoria de modelos traz maior impacto. Veja este Machine Learning Cheat Sheet para saber mais.
Preparação de dados
Coleta de dados
Reúna todos os dados de que você precisa para seus modelos, seja da sua organização, de fontes públicas ou pagas.
Limpeza de dados
Transforme dados brutos e bagunçados em dados limpos e organizados, prontos para análise. Confira esta checklist de limpeza de dados para um guia introdutório.
Engenharia de atributos (features)
Manipule os conjuntos de dados para criar variáveis (features) que aumentem a acurácia das previsões do seu modelo. Crie as mesmas features tanto no conjunto de treino quanto no de teste.
Divida os dados
Divida aleatoriamente os registros do conjunto de dados em conjunto de treino e conjunto de teste. Para uma avaliação mais confiável da performance do modelo, gere múltiplos conjuntos de treino e teste usando validação cruzada.
Modelagem
Ajuste de hiperparâmetros
Para cada modelo, use técnicas de ajuste de hiperparâmetros para melhorar a performance.
Treine seus modelos
Ajuste cada modelo ao conjunto de treino.
Faça previsões
Faça previsões no conjunto de teste.
Avalie a performance do modelo
Para cada modelo, calcule métricas de performance no conjunto de teste, como acurácia, recall e precisão.
Implantação
Implemente o modelo
Incorpore o modelo escolhido em dashboards, aplicações ou onde você precisar.
Monitore a performance do modelo
Teste regularmente a performance do seu modelo conforme os dados mudam, para evitar o model drift.
Melhore seu modelo
Itere continuamente e aprimore seu modelo após a implantação. Substitua o modelo por uma versão atualizada para melhorar a performance.



