Uma boa gestão de projetos aumenta a eficiência e a produtividade, além de reduzir o risco de fracasso. Infelizmente, projetos de ciência de dados podem ser especialmente complexos, pois envolvem diversas áreas e precisam equilibrar objetivos de negócio e técnicos.
Frameworks de gestão de projetos ajudam você a planejar, alocar recursos e executar tarefas para atingir metas no prazo e dentro do orçamento.
Este infográfico reúne os principais pontos de dois frameworks líderes em gestão de projetos de ciência de dados — o Team Data Science Process, da Microsoft, e o Domino Data Science Life Cycle, da Domino Data Lab — em um checklist prático para você usar nos seus projetos.
Tenha este infográfico na ponta dos dedos
Baixe este infográfico e mantenha-o à mão para seu próximo projeto de ciência de dados
Como usar este guia prático
Este guia resume as melhores práticas de gestão de projetos de ciência de dados coletadas do Team Data Science Process, da Microsoft, e do Domino Data Science Life Cycle, da Domino Data Lab, combinando princípios do CRISP-DM com os frameworks ágeis Agile e Scrum. Use este checklist ao planejar seu próximo projeto de ciência de dados!
Princípios para uma gestão eficaz de projetos de ciência de dados
Como regra geral, projetos bem-sucedidos de ciência de dados costumam ter as seguintes características:
- Mensuráveis: o sucesso do projeto e seu impacto no negócio são quantificáveis?
- Confiáveis: qual a proporção de projetos que atingiram suas metas?
- Escaláveis: é possível aumentar o volume de projetos sem comprometer significativamente a confiabilidade?
Além disso, as equipes de dados devem seguir estes princípios ao gerenciar projetos de ciência de dados:
- Iterar: raramente um projeto vai em linha reta do início ao fim. Durante a execução, você aprende coisas que exigem revisões. Em alinhamento com Agile e Scrum, volte a etapas anteriores sempre que necessário.
- Reutilizar e reciclar: começar cada projeto do zero é demorado e ineficiente. Reutilizar componentes de projetos anteriores — seja código, features de modelos ou templates de documentos — evita reinventar a roda.
- Garantir reprodutibilidade: explicar e justificar seu trabalho muitas vezes é mais difícil do que fazê-lo. Sua metodologia e resultados podem ser auditados por um regulador ou cliente — e você mesmo pode precisar revisitar o trabalho depois. Adotar técnicas de pesquisa reprodutível economiza tempo e reduz riscos de erros não detectados.
Checklist de projetos de ciência de dados
Microsoft e Domino Data Lab propõem fases semelhantes para um projeto de ciência de dados. Abaixo, resumimos essas fases em um framework unificado:
definição de contexto e ideação
| O que fazer? |
Como fazer? |
|
Identificar o problema de negócio a ser resolvido |
Isto deve deixar claro, de forma inequívoca, por que o projeto está sendo realizado. |
|
Identificar as partes interessadas |
Funções podem incluir gerente de projetos, cientista de dados, gerente de contas, administrador de dados. |
|
Revisar trabalhos anteriores |
Analise projetos existentes que trataram de temas semelhantes.
|
|
Definir indicadores-chave de performance (KPIs ou métricas) para medir o sucesso |
As métricas devem seguir os critérios SMART.
Exemplo não SMART: "Aumentar a conversão do site" Exemplo SMART: "Otimizar o design e a experiência do usuário do site para aumentar a taxa de conversão em 10% até o fim do 2º trimestre" |
|
Definir o escopo |
|
|
Escrever um plano de projeto |
|
|
Estimar o impacto do projeto |
|
|
Estimar o esforço do projeto |
|
|
Estimar os riscos do projeto |
|
|
Decidir se o projeto deve seguir adiante |
Com base no impacto esperado em relação ao esforço e aos riscos, decida se deve
|
|
Definir a responsabilidade de cada parte interessada |
Use o modelo RACI. Para cada tarefa, defina quem é
|
|
Definir uma estratégia de comunicação |
|
|
Identificar fontes de dados |
|
|
Antecipar necessidades regulatórias |
|
|
Definir o stack de tecnologia |
|
|
Escrever o project charter |
|
coleta e exploração de dados
| O que fazer? |
Como fazer? |
|
Dar acesso a todos os datasets para os cientistas de dados |
|
|
Ingerir os dados |
|
|
Explorar os dados |
|
|
Escrever um relatório de qualidade dos dados |
Para cada dataset
|
|
Decidir se o projeto deve seguir adiante |
Com base no relatório de qualidade dos dados, decida se deve
|
|
Criar um pipeline de dados |
Os dados normalmente precisam ser atualizados regularmente conforme o projeto avança. O pipeline de dados
|
|
Documentar o pipeline de dados |
|
modelagem e testes
Esta seção cobre projetos baseados em machine learning e experimentação, como testes A/B. Descarte as etapas que não fizerem sentido para o seu caso.
Modelagem
| O que fazer? |
Como fazer? |
|
Gerar uma hipótese |
|
|
Dividir os dados em conjuntos de treino e teste |
Faça isso antes de começar a engenharia de features para evitar vazamento de dados. |
|
Fazer engenharia de features |
Crie features para o modelo usando técnicas como:
|
|
Ajustar o modelo ou executar um experimento |
|
|
Avaliar os resultados |
Use métricas como acurácia, precisão e recall para quantificar a performance do modelo. Se o desempenho ainda não for suficiente:
|
|
Reportar os resultados |
|
Testes
| O que fazer? |
Como fazer? |
|
Criar uma suíte de testes |
Defina testes automáticos para verificar a performance do modelo ou experimento e identificar bugs introduzidos durante iterações. Inclua, por exemplo:
|
|
Validar o impacto no negócio |
Com as métricas de performance do modelo, fica mais fácil quantificar o impacto esperado no negócio. Discuta esse impacto com os stakeholders de negócio. |
|
Validar a abordagem técnica |
Verifique se o modelo final é tecnicamente adequado.
|
|
Validar a capacidade de implantação |
|
|
Preservar resultados nulos |
Tudo o que não for para produção deve ser registrado em um repositório de conhecimento para que projetos futuros não percam tempo tentando as mesmas abordagens. |
implantação e testes com usuários
Implantação
| O que fazer? |
Como fazer? |
|
Desenvolver um pipeline de dados |
|
|
Desenvolver um pipeline de modelos |
|
|
Operacionalizar o modelo |
Disponibilize uma API do seu modelo para ser consumida por dashboards, sites ou outros softwares. |
|
Definir um plano de monitoramento |
|
|
Fazer rollout via teste A/B |
|
|
Analisar e reportar os resultados do A/B |
|
|
Fazer rollout para a maioria ou totalidade dos usuários |
Se o teste foi bem-sucedido, faça o rollout do recurso ou modelo para a maioria ou para todos os usuários.
|
Testes com usuários
| O que fazer? |
Como fazer? |
|
Escrever um relatório de encerramento |
Resuma o status do projeto e os aprendizados.
|
|
Coletar feedback dos clientes |
|
monitoramento
| O que fazer? |
Como fazer? |
|
Desenvolver o pipeline de monitoramento |
Configure um pipeline para acompanhar automaticamente as métricas de performance e segurança definidas no plano de monitoramento. |
|
Criar dashboards |
Crie dashboards para acompanhar a evolução dessas métricas ao longo do tempo. |
|
Configurar alertas |
Configure alertas para notificar você por e-mail, Slack etc., quando as métricas saírem da faixa aceitável. |
