Foque em bases de dados sólidas e nas ferramentas certas
Garantir dados de qualidade já é, por si só, um grande desafio. Recomendamos que empresas que querem aproveitar machine learning, inteligência artificial e ciência de dados conheçam a hierarquia de necessidades da IA, de Monica Rogati, que coloca o machine learning próximo do topo como uma das últimas peças do quebra-cabeça.

Fonte: Hackernoon
Essa hierarquia mostra que, antes de fazer machine learning, você precisa de bases de dados robustas e de ferramentas para extração, carga e transformação de dados (ETL), além de soluções para limpar e agregar dados vindos de fontes diversas.
Isso exige práticas sólidas de engenharia de dados—é preciso usar bancos de dados, entender como processar dados corretamente, agendar seus fluxos de trabalho e aproveitar computação em nuvem.
Portanto, antes de contratar seu primeiro engenheiro de machine learning, monte primeiro suas funções de engenharia de dados, ciência de dados e análise de dados.
Cuidado com vieses nos seus dados e algoritmos
O machine learning só é tão bom quanto os dados que você fornece. Se seus dados estiverem enviesados, seu modelo também estará. Por exemplo, a Amazon criou uma ferramenta de recrutamento com ML para prever o sucesso de candidatos com base em currículos, treinada com dez anos de dados que favoreciam homens devido à histórica predominância masculina no setor de tecnologia—o que fez a ferramenta também apresentar viés contra mulheres.
É por isso que a ética de dados ganhou tanta relevância nos últimos anos. À medida que mais dados são gerados, o impacto de como eles são usados cresce de forma dramática. Isso exige princípios claros e monitoramento constante. Como Cassie Kozyrkov, Chief Decision Scientist do Google, costuma comparar, um professor só é tão bom quanto os livros que usa para ensinar os alunos. Se os livros forem enviesados, as lições também serão.
Acompanhe seu modelo e evolua-o continuamente
Lembre-se: o trabalho com machine learning não termina quando seu modelo entra em produção, fazendo previsões ou classificações. Modelos em operação ainda precisam ser monitorados e mantidos.
Se você tem um modelo que prevê fraude em cartão de crédito com base em dados de transações, obtém informações valiosas toda vez que o modelo faz uma previsão e você age sobre ela. Além disso, a atividade que você tenta monitorar e prever—neste caso, fraude em cartão de crédito—pode ser dinâmica e mudar com o tempo. Esse processo, no qual os dados gerados estão em constante mudança, é chamado de data drift (deriva de dados)—e mostra como é essencial atualizar o modelo regularmente.

Fonte: DataBricks


