
#1 Organizações aceleram programas de transformação cultural
Cultura de dados é o conjunto de comportamentos e crenças de pessoas que valorizam, praticam e incentivam o uso de dados para melhorar a tomada de decisão. Ela estabelece a base e a mentalidade necessárias para que as empresas capturem valor de conjuntos de dados que não param de crescer.
Infelizmente, a falta de cultura de dados é um grande obstáculo no roadmap de qualquer organização que quer se tornar orientada por dados.

Em 2022, esperamos que os chief data officers (CDO) foquem nos pilares da cultura de dados, como governança de dados adequada, programas de letramento em dados e o fortalecimento de uma mentalidade orientada por dados. Esses elementos são catalisadores para processos de decisão baseados em dados em toda a empresa.
#2 Organizações vão ampliar a governança de dados
A demanda crescente por análises de autoatendimento aumentou a necessidade de dados compatíveis, acionáveis e de alta qualidade. Porém, medir e manter a qualidade dos dados se torna mais difícil à medida que o tamanho e a complexidade dos conjuntos de dados crescem. Por isso, as empresas estão adaptando suas estratégias de governança de dados.
Uma dessas estratégias é adotar observabilidade de dados em pipelines. Em resumo, a observabilidade de dados busca identificar, diagnosticar e resolver problemas de dados quase em tempo real.
Em 2022 e além, mais empresas vão escalar seus programas de governança e adotar ferramentas modernas para monitorar e detectar problemas de qualidade de dados.
#3: NLP inaugura uma nova geração de ferramentas low-code para dados
O NLP cresceu enormemente nos últimos anos, impulsionado pela corrida por modelos de linguagem cada vez maiores (LLM), como T5, GPT-3 e Megatron-Turing NLG.
Modelos de linguagem ficam maiores a cada ano (Fonte)LLMs estão expandindo os limites do que o NLP pode fazer. Os modelos mais recentes surpreenderam a comunidade com a capacidade de gerar vários tipos de texto (como código e cifras de violão) sem treinamento explícito para isso.
Esses modelos de NLP têm potencial para impulsionar a era das ferramentas low-code e no-code. Hoje, o Power App da Microsoft permite que pessoas não técnicas criem apps com linguagem natural. Esse tipo de ferramenta seguirá derrubando barreiras à programação e favorecerá o surgimento de citizen developers e citizen data scientists dentro das organizações.
#4 L&D vira parte do DNA da cultura da empresa
Movidas pela preocupação do C-level com a falta de habilidades essenciais em suas organizações, as empresas continuarão investindo pesado em programas de learning and development (L&D) em 2022. Os benefícios são claros: o Fórum Econômico Mundial projeta que 38% do PIB podem ser adicionados com capacitação até 2030.
Enquanto a força de trabalho segue lidando com a pandemia, esperamos que as empresas direcionem seus orçamentos de L&D para ecossistemas virtuais de aprendizagem que promovam aprendizado efetivo e comunidades de prática. Organizações que buscam elevar o letramento em dados dos colaboradores em escala podem aproveitar programas de L&D existentes como academias internas de habilidades em ciência de dados.
Tendência de dados #5: MLOps continuará amadurecendo nas organizações
MLOps é um conjunto de práticas que combinam aprendizado de máquina, engenharia de dados e DevOps. Envolve processos padronizados que automatizam o fluxo de trabalho de machine learning.
As empresas só conseguem extrair valor de machine learning em escala com sistemas de IA em produção. Isso explica por que a demanda por MLOps deve crescer muito. Estima-se, inclusive, que o mercado atinja US$ 126,1 bilhões até 2025.
No próximo ano, ferramentas de MLOps como KubeFlow e MLFlow continuarão amadurecendo. É questão de tempo até se tornarem item básico em todos os times de ciência de dados.
Tendência de dados #6: IA responsável se torna mais operacional
Infelizmente, muitos sistemas de IA atuais estão cheios de vieses ocultos. Por isso, reguladores na UE planejam responsabilizar essas IAs, e muitos devem seguir o exemplo. As empresas precisam garantir que seus sistemas de IA sejam justos e responsáveis. Quem não fizer isso corre o risco de danificar a reputação e contribuir para ampliar desigualdades.
É por isso que cada vez mais empresas estão operacionalizando princípios de IA responsável, para que a IA permaneça justa, interpretável, preserve a privacidade e seja segura. Um exemplo de framework é o Responsible AI Toolkit da PwC, que aborda várias dimensões de IA responsável.
Tendência de dados #7: Ascensão do data mesh
Hoje, a maioria das arquiteturas de dados segue o modelo de data lakes. Isso pode mudar em breve, à medida que uma nova abordagem busca corrigir fragilidades dos data lakes.
Uma alternativa, cunhada por Zhamak Dehghani, é o data mesh. No data mesh, existem “produtos de dados” distribuídos, cada um gerido por um time multifuncional de engenheiros de dados e product owners. Adotar uma arquitetura de data mesh permite entregar dados mais rápido e ganhar agilidade nos domínios de negócio.
Em breve, conforme as dores dos data lakes ficarem mais evidentes, as empresas começarão a experimentar o data mesh, como já fizeram a Zalando e a Intuit.
Tendência de dados #8: Nova geração de ferramentas vai aumentar a produtividade dos times de dados
Diversas ferramentas de produtividade em ciência de dados surgiram em 2021 e continuarão ganhando espaço nos próximos anos. Elas reduzem o trabalho manual e permitem que cientistas de dados foquem em tarefas de maior valor.
Entre essas ferramentas, estão soluções de AutoML (como H2O AutoML e Auto PyTorch), que automatizam a seleção de modelos de machine learning e até a otimização de hiperparâmetros.
Também vem crescendo o uso de ferramentas de geração de dados sintéticos. A capacidade de criar conjuntos de dados balanceados e rotulados em escala é especialmente atraente para empresas famintas por dados.
Times grandes de ciência de dados podem ainda se beneficiar de ferramentas de colaboração como o Databricks e o DataCamp Workspace. Essas soluções permitem que cientistas de dados colaborem de forma assíncrona na exploração de dados e na modelagem de ML.

Tendência de dados #9: Escassez de talentos e trabalho flexível vão ampliar e melhorar a busca por profissionais de dados
Com a Grande Renúncia em curso, a falta de talentos fica ainda mais severa. Esse cenário leva as organizações a repensar como atrair e reter talentos em dados.
Em especial, esperamos que as empresas priorizem competências em vez de CEP nas políticas de contratação, como mostra o aumento de 280% nas vagas remotas no LinkedIn desde março de 2020. Além disso, à medida que empresas FAANG adotam o trabalho remoto, esperamos que outras empresas de tecnologia sigam o exemplo e ofereçam opções de trabalho flexível aos colaboradores.
Para saber mais sobre nossas tendências e previsões de dados para 2022, baixe o white paper gratuito ou inscreva-se no nosso próximo webinar, em que vamos aprofundar o que vem por aí em ciência de dados no novo ano!

