Ciência de dados é uma das áreas que mais evoluem hoje. Novos artigos científicos, pacotes, tutoriais e tecnologias surgem todos os dias, o que às vezes dificulta acompanhar tudo. Para qualquer profissional de dados, estar por dentro das últimas novidades é essencial para continuar aprendendo e crescendo. Neste artigo, você encontra uma coletânea com as notícias, tutoriais, pesquisas e insights mais recentes que podem ter passado batido no último mês.
Tutoriais recém-lançados
Duas formas de criar transformadores personalizados com scikit-learn
Este post no Towards Data Science traz um tutorial simples de como criar um transformer personalizado usando scikit-learn. O scikit-learn é um dos pacotes mais usados em ciência de dados e, provavelmente, a biblioteca de machine learning mais popular. Ele oferece diversos recursos de pré-processamento, como One-Hot Encoding, MinMax Scaling e outros. Às vezes, no entanto, é preciso usar funções de pré-processamento personalizadas em vez das prontas, como o OneHotEncoder. Este tutorial mostra como criar transformadores personalizados no scikit-learn para agilizar o pré-processamento de dados para machine learning.
MLOps no BigQuery ML usando Vertex AI
No último ano, as big techs avançaram bastante em MLOps. Levar modelos de machine learning para produção é um dos maiores desafios dos times de dados hoje. Este vídeo traz um tutorial rápido de como usar em conjunto os serviços Vertex AI e BigQuery ML do Google Cloud para criar um pipeline de Vertex AI pronto para produção.
Novos tutoriais de Power BI da DataCamp
Com o lançamento da nova trilha Data Analyst in Power BI em parceria com a Microsoft, a DataCamp publicou alguns tutoriais de Power BI no último mês. O Power BI é uma das ferramentas de business intelligence mais usadas e, se a sua empresa utiliza Microsoft Office, é bem provável que você já tenha acesso. Também é uma ótima porta de entrada para quem quer ir além do Excel e mergulhar no mundo dos dados. Esses tutoriais cobrem todo o processo de trabalho com Power BI, desde como fazer a transição do Excel para o Power BI, passando por um guia mais detalhado de Power BI para iniciantes, modelagem de dados no Power BI e um tutorial sobre fórmulas DAX do Power BI para iniciantes. Você também pode baixar este prático cheat sheet para apoiar sua jornada de aprendizado.
Pesquisas inovadoras em machine learning
DALLE-2 da OpenAI
No último mês, a OpenAI impressionou o mundo com seu algoritmo de geração de imagens DALLE-2. A OpenAI treinou esse novo modelo de machine learning para criar imagens e artes fotorrealistas a partir de textos simples em linguagem natural. O DALLE-2, sucessor do DALLE-1, alcança um alto nível de realismo usando um processo chamado “difusão”, que cria um padrão de pontos aleatórios e o altera gradualmente até formar uma imagem reconhecida a partir do texto. Você pode ler mais aqui e assistir à Isabella Leslie Miller, Data Journalist da DataCamp, explicar tudo no nosso vídeo de notícias Weekly Roundup.
Pathways Language Model (PaLM)
O PaLM demonstra o primeiro uso em grande escala do sistema Pathways. A arquitetura do Pathways foi apresentada pelo Google no ano passado para treinar, de forma eficiente, uma nova geração de modelos capazes de executar diversas tarefas em diferentes domínios. Com o PaLM, o Google criou um enorme modelo Transformer com 540 bilhões de parâmetros, que atingiu desempenho de ponta em várias tarefas de linguagem e raciocínio. Essas tarefas vão de geração de código e explicação de piadas a identificação de causa e efeito, entre outras. Confira o artigo para se aprofundar no Pathways e nos tipos de casos de uso que o PaLM desbloqueia.
Novos pacotes e modelos
Lançamento do PyTorch 1.11
Com o lançamento do Pytorch versão 1.11, chegam diversas melhorias. A versão mais recente do PyTorch agora oferece versões beta do TorchData, sucessor da API DataLoader, e do functorch, que disponibiliza transformações de funções compostáveis para módulos do PyTorch. Além da introdução desses recursos, o PyTorch 1.11 traz vários ganhos de performance, como inicialização 40% mais rápida para implantações em mobile e edge, entre outros. Para saber mais sobre PyTorch, confira este curso para iniciantes da DataCamp.
EpyNN 1.2.7
EpyNN significa “Educational python for Neural Networks”. É voltado para professores, alunos, cientistas e qualquer pessoa com conhecimentos básicos de Python que queira entender e construir redes neurais do zero. Ele oferece diversos templates de arquitetura e exemplos práticos que reduzem o tempo necessário para aprender a desenvolver redes neurais do início ao fim.
Treinamento do Large Language Model da BigScience (tr11-176B-ml-logs)
BigScience é uma comunidade popular no Hugging Face e tem a missão de criar modelos de linguagem em larga escala de forma aberta, com milhares de pesquisadores no mundo todo. O treinamento do modelo principal da BigScience começou em 11 de março de 2022 e deve durar de três a quatro meses em 384 GPUs A100 80GB do supercomputador público Jean Zay. Este modelo open source terá 176B parâmetros e uma arquitetura apenas com decodificador, no estilo GPT. Você pode acompanhar as atualizações de treinamento no Twitter — e deverá conseguir usar o modelo por volta de junho.
Casos de uso em ciência de dados e machine learning
La Liga faz parceria com a Databricks para análise de futebol
A equipe de analytics da La Liga firmou parceria com a Databricks para implantar um data lakehouse na infraestrutura analítica da liga. Isso permitirá que a La Liga Tech — o novo braço consolidado de analytics da liga — estruture e gerencie seus dados com muito mais eficiência e aplique machine learning em casos interessantes, como previsão de lesões, recomendações de conteúdo para os torcedores e mais.
Usando deep learning para anotar o universo das proteínas
Cientistas há muito utilizam ferramentas computacionais para inferir e anotar a função de proteínas diretamente a partir de suas sequências. A equipe de IA do Google usou com sucesso deep learning para prever a função de proteínas de forma confiável; eles chamam o modelo de ProtENN, que permitiu adicionar cerca de 6,8 milhões de entradas ao banco de dados do Pfam. A equipe de IA do Google disponibilizou o modelo ProtENN e um artigo interativo no estilo distill com experimentos. Resolver esse tipo de problema possibilita descobertas de novos fármacos e terapias de forma mais rápida e confiável com apoio de machine learning.
Insights e opiniões
Empoderando o analista de dados moderno
No último episódio do podcast DataFramed, Peter Fishman, CEO da Mozart Data, analisa o estado do stack moderno de dados e como as ferramentas mais recentes em ciência de dados foram pensadas para empoderar o analista de dados moderno. Além disso, ele compartilha sua experiência liderando times de dados, o que faz um excelente analista de dados, a importância do conhecimento do domínio e de ouvir os usuários, e muito mais. Ouça e assine o DataFramed em qualquer plataforma de podcasts.
MLOps está uma bagunça — e isso é esperado
Neste artigo, Mihail Eric, fundador da Confetti AI, compartilha sua visão sobre o estado atual das ferramentas de MLOps. Como o título já indica, Mihail destrincha com precisão o cenário fragmentado das ferramentas de Machine Learning. Como as operações de machine learning ainda estão no início, os padrões, ferramentas e boas práticas ainda estão em formação e não há um stack canônico claro em que os profissionais possam se apoiar. Além disso, resolver a escassez de talentos e incorporar o pensamento de machine learning na cultura das organizações vai moldar a adoção de MLOps nos próximos anos.
Saiba mais
Esperamos que você tenha curtido este apanhado de notícias, insights, tutoriais e pesquisas. Para saber mais sobre as últimas de ciência de dados, confira estes recursos:




