Pular para o conteúdo principal

Um guia completo do Databricks Lakehouse AI para cientistas de dados

Este tutorial explora a abordagem da Databricks para IA e Machine Learning no Databricks Lakehouse e apresenta seus recursos mais recentes.
Atualizado 17 de set. de 2026  · 12 min lido

Explorar com IA

ChatGPTClaudePerplexity

A Databricks tem sido uma das pioneiras na criação de tecnologias e plataformas que viabilizam soluções de IA em escala, impulsionando inclusive projetos open source como Apache Spark e MLflow.

Durante o Databricks Data + AI Summit 2023, o Lakehouse AI foi anunciado como a primeira plataforma de IA do mundo integrada à camada de dados — além de muitos outros recursos novos. Com o lançamento do ChatGPT e os saltos gigantes em tecnologias de IA generativa pelo mundo, o Lakehouse AI é a resposta da Databricks para construir aplicações de IA generativa com uma abordagem centrada em dados.

Neste tutorial, vamos apresentar a plataforma Databricks Lakehouse AI, refletir sobre sua importância, entender os novos recursos lançados e como podemos utilizá-los no nosso ciclo de desenvolvimento de machine learning.

O que é o Databricks Lakehouse AI?

Como assim, Lakehouse? A gente sabe que pode ser um termo novo para você.

Vamos destrinchar a evolução do Databricks Lakehouse AI passo a passo. Para entender o Lakehouse AI — primeiro precisamos entender bem a arquitetura Lakehouse.

O que é um Lakehouse?

Um “Lakehouse” é uma arquitetura moderna de gerenciamento de dados que combina a flexibilidade e o baixo custo de um data lake com os recursos de gestão de dados de um data warehouse.

Temos um tutorial completo sobre as diferenças entre data lake e data warehouse, mas, em resumo, significa o seguinte:

  • Data lake: Um repositório de armazenamento capaz de manter uma grande quantidade de dados brutos em seu formato nativo até que sejam necessários. É como um grande container onde jogamos todos os dados, sejam estruturados (como tabelas em um banco) ou não estruturados (como textos ou imagens), sem se preocupar em organizá-los de cara.

The data lake architecture

A arquitetura de data lake (Fonte)

  • Data warehouse: Um sistema usado para relatórios e análise de dados, onde os dados são estruturados, processados e armazenados de forma a facilitar a recuperação e a análise. É como uma biblioteca em que os livros estão organizados e catalogados para acesso fácil.

The data warehouse architecture

A arquitetura de data warehouse (Fonte)

Data lakes costumam ter dificuldades de gestão e governança por armazenarem enormes volumes de dados brutos e não estruturados, o que pode levar a “pântanos de dados”, onde é difícil encontrar, acessar ou confiar nos dados. A falta de estrutura também pode prejudicar o desempenho de consultas analíticas complexas, e data lakes tradicionais geralmente não dão suporte adequado a operações transacionais, faltando recursos de transações ACID, cruciais para garantir a integridade dos dados.

Já os data warehouses são otimizados para dados estruturados e análises, mas podem ficar caros demais à medida que o volume de dados cresce. A exigência de estruturar os dados em um schema predefinido traz rigidez, limitando a capacidade de ingerir e analisar rapidamente novos tipos de dados.

Essas limitações impulsionaram a evolução da arquitetura Lakehouse, que busca unir o melhor dos dois mundos:

  • Permite armazenar grandes quantidades de dados brutos a baixo custo (como um data lake).
  • Oferece a capacidade de realizar análises complexas de forma eficiente e gerenciar os dados com forte governança e confiabilidade (como um data warehouse).

Veja como é a arquitetura lakehouse:

The data lakehouse architecture

A arquitetura de data lakehouse (Fonte)

Agora que entendemos a evolução do Databricks Lakehouse, chegamos à pergunta final.

O que é o Lakehouse AI?

Lakehouse AI é a integração de recursos de inteligência artificial e machine learning diretamente na arquitetura Lakehouse. Isso significa que podemos desenvolver, treinar e implantar modelos de IA usando os enormes volumes de dados armazenados no data lake sem precisar mover ou copiar os dados para outro ambiente de processamento.

A importância dessa plataforma está em:

  • Acesso direto aos dados: Modelos de IA podem ser treinados em conjuntos de dados mais abrangentes, gerando resultados potencialmente mais precisos e relevantes.
  • Arquitetura simplificada: Ao reduzir a necessidade de sistemas separados para armazenamento de dados e processamento de IA, diminui-se a complexidade e os custos de gestão da infraestrutura de dados.
  • Insights em tempo real: Permite processar dados em tempo real para aplicações de IA, ajudando as empresas a tomar decisões mais rápidas e baseadas em dados.

Esses recursos explicam por que a Databricks anunciou esta como a primeira plataforma de IA do mundo integrada à camada de dados.

Componentes centrais do Lakehouse AI

A transição para o Lakehouse AI tem sido fundamental para levar os negócios a operações mais orientadas por dados e integradas à IA.

No centro dessa transformação estão vários componentes essenciais que facilitam o desenvolvimento, a implantação e o gerenciamento de modelos de IA e machine learning. Entender por que e quando esses componentes são necessários ajuda as organizações a aproveitar melhor seus dados em aplicações de IA.

Vector Search

O Vector Search no Databricks Lakehouse AI representa um avanço significativo (também lançado no Data + AI Summit 2023) no tratamento e na pesquisa em grandes volumes de dados para encontrar informações semanticamente semelhantes, indo além da correspondência tradicional por palavras-chave.

O Vector Search funciona convertendo dados e consultas em vetores em um espaço multidimensional chamado embeddings, derivados de um modelo de IA generativa. Esse método faz com que palavras ou conceitos semanticamente semelhantes fiquem mais próximos nesse espaço n-dimensional, permitindo resultados de busca mais relevantes e contextuais.

Vector search (Screenshot by author)

Busca vetorial (captura de tela do autor)

O processo de uso do Vector Search (vídeo de demonstração da Databricks) é o seguinte:

  • Criar um endpoint e um índice de busca vetorial.
  • Ingerir blocos de dados como entradas e mapeá-los para um espaço N-dimensional representado por um vetor de embedding.
  • Armazenar esses vetores em um banco de dados vetorial para algoritmos de busca por vizinhos mais próximos, rápidos e escaláveis, encontrarem vetores similares.

Empresas como a Lippert já usam o Vector Search para ajudar agentes a encontrar rapidamente respostas a dúvidas de clientes, ingerindo conteúdo de diversas fontes.

Curated Models

Esses modelos, disponíveis no Databricks Marketplace, são otimizados para alto desempenho e foram projetados para fácil integração ao ambiente Lakehouse em várias aplicações, de análise e geração de texto a processamento de imagens.

Alguns modelos de IA generativa curados incluem:

  • MPT-7B e Falcon-7B: Modelos de seguir instruções e de sumarização, respectivamente, criados para tarefas que exigem entender e gerar texto semelhante ao humano com base em instruções fornecidas ou resumir documentos extensos em sínteses curtas e informativas.
  • Stable Diffusion: Um modelo de geração de imagens que ganhou popularidade pela capacidade de criar imagens de alta qualidade a partir de descrições textuais, permitindo uma ampla gama de aplicações criativas e analíticas dentro do Lakehouse AI. Confira nosso tutorial de Stable Diffusion para saber mais.

Models available in Databricks Marketplace (Screenshot by author)

Modelos disponíveis no Databricks Marketplace (captura de tela do autor)

Esses modelos foram projetados para funcionar perfeitamente com o conjunto mais amplo de recursos do Databricks Lakehouse AI, incluindo ferramentas de gestão de dados, analytics e MLOps. Daqui a pouco veremos como usá-los no desenvolvimento de machine learning.

AutoML

Os recursos de AutoML (Automated Machine Learning) no Databricks Lakehouse AI foram criados para simplificar e automatizar o processo de desenvolvimento de modelos de machine learning, tornando ciência de dados avançada acessível a um público mais amplo, incluindo quem tem pouca experiência em ML.

Databrick AutoML

Databricks AutoML (Fonte)

Quando fornecemos o conjunto de dados e definimos o objetivo de predição, o AutoML cuida de preparar o dataset para treinar um modelo. Em seguida, ele cria, ajusta e avalia vários modelos por meio de uma série de experimentos.

Ao final da avaliação, o AutoML apresenta os resultados e oferece um notebook em Python com o código-fonte de cada experimento. Isso nos permite revisar, reproduzir e ajustar o código conforme necessário. O AutoML também calcula estatísticas resumidas sobre o dataset e salva essas informações em um notebook para referência futura.

Com o lançamento mais recente, o AutoML agora permite ajustar modelos de IA generativa para classificação de texto e modelos de embedding com os próprios dados do cliente. Ou seja, usuários de negócio não técnicos podem criar aplicações de IA generativa em poucos cliques.

Lakehouse Monitoring​

O Databricks Lakehouse Monitoring permite monitorar as propriedades estatísticas e a qualidade das nossas tabelas de dados e acompanhar o desempenho de modelos de machine learning e suas predições. Ao examinar o fluxo de dados nos pipelines da Databricks, esse recurso ajuda a garantir o monitoramento contínuo da qualidade de dados e da efetividade dos modelos.

Veja como os dados fluem pelo Lakehouse Monitoring para viabilizar o acompanhamento contínuo:

Lakehouse Monitoring flow

Fluxo do Lakehouse Monitoring (Fonte)

Além de monitorar, esse recurso também fornece insights acionáveis sobre integridade dos dados, distribuição, drift e desempenho do modelo ao longo do tempo.

Agora vamos ver como todos esses recursos se unem em uma governança unificada no Lakehouse AI.

O papel da governança unificada no Lakehouse AI

A ideia de governança unificada é poder acessar, controlar, colaborar, monitorar e agir sobre dados, modelos de machine learning e outros ativos de IA em um só lugar. À medida que uma organização cresce e amadurece em sua jornada de transformação em IA, conseguir gerenciar tudo centralmente é crucial.

O Databricks Unity Catalog faz exatamente isso, e unificar a forma de governar ativos de IA acelera a adoção de IA sem abrir mão da conformidade regulatória.

Embora existam recursos úteis como o explorador de dados e a possibilidade de adicionar sistemas externos, o grande destaque é ter uma visão panorâmica de toda a governança desses ativos por meio de um Portal de Governança do Unity Catalog, como mostrado abaixo:

Unity catalog governance portal (Screenshot by author)

Portal de governança do Unity Catalog (captura de tela do autor)

Esse portal exibe métricas-chave como a porcentagem de tabelas governadas e monitoradas, o número de usuários ativos e a contagem de tabelas, volumes e modelos de ML. Essa visão de alto nível ajuda a avaliar rapidamente o status de governança e o engajamento com os ativos de dados.

O dashboard também mostra a atividade dos usuários ao longo do tempo, o que ajuda a entender como os ativos de dados são utilizados na organização e a identificar gargalos ou necessidades de capacitação.

Além disso, o portal lista riscos potenciais de governança identificando questões como tabelas não monitoradas ou colunas derivadas de PII (informações de identificação pessoal), oferecendo uma abordagem proativa para gerenciar dados com segurança, como visto abaixo.

Governance action items view of the unity catalog dashboard (Screenshot by author)

Itens de ação de governança no dashboard do Unity Catalog (captura de tela do autor)

Cada questão identificada vem com uma ação recomendada, guiando os usuários na resolução de possíveis problemas de governança. Esse recurso simplifica e unifica um processo que costuma ser complexo na gestão de ativos de IA e dados em toda a plataforma.

Agora que entendemos os recursos da plataforma e como eles se integram, vamos mergulhar no uso prático para desenvolvimento de machine learning de ponta a ponta.

Desenvolvimento de machine learning de ponta a ponta no Databricks Lakehouse AI

Para relembrar o ciclo de desenvolvimento de machine learning, recomendamos nosso tutorial aprofundado. Nesta seção, vamos entender como os recursos do Databricks Lakehouse AI se encaixam nesse ciclo.

End-to-end Machine Learning Development

Desenvolvimento de machine learning de ponta a ponta (Fonte)

1. Preparação de dados e engenharia de atributos

A base do machine learning no Databricks Lakehouse AI é a capacidade de treinar e construir modelos com eficiência.

Podemos usar o runtime de ML do Databricks, que já vem com pacotes como pandas e PySpark para preparação e limpeza de dados. O Databricks Feature Store é um repositório centralizado dentro da plataforma Databricks Lakehouse AI — projetado para armazenar, compartilhar e gerenciar features de machine learning.

Esse feature store garante que os atributos usados no treinamento sejam consistentes com os usados na inferência em produção. Também evita gastar computação recalculando features repetidamente para casos de uso diferentes.

The function of a feature store

A função de um feature store (Fonte)

Ao centralizar definições e armazenamento de features, elimina-se o problema comum de “training-serving skew”, quando os dados do treinamento diferem dos encontrados pelo modelo em produção.

2. Engenharia de modelos

Para o desenvolvimento, temos a flexibilidade de escolher modelos curados pré-prontos no ambiente Databricks ou treinar um modelo customizado para os dados e necessidades do negócio.

  • Usando modelos existentes: Como vimos, podemos escolher entre modelos já pré-treinados em grandes datasets no Databricks Marketplace. Há notebooks de exemplo para acompanhar, então não precisamos nos preocupar com como utilizar esses modelos.
  • Treinando novos modelos: Para soluções sob medida, podemos usar o runtime de ML, que inclui frameworks e linguagens como TensorFlow, PyTorch e Scikit-learn, entre outros. O processo de treinamento é potencializado pelos notebooks colaborativos do Databricks, que oferecem um ambiente interativo para escrever código, analisar dados e compartilhar insights.

A Databricks também oferece clusters otimizados com GPU, o que acelera treinamento (e inferência) em escala, algo crucial quando buscamos insights, previsões e recomendações em tempo real e em grande volume.

3. Avaliação e experimentação de modelos

A Databricks desenvolveu uma ferramenta open source chamada MLflow, disponível nativamente na plataforma, que simplifica o processo de acompanhar experimentos, empacotar código em execuções reprodutíveis e compartilhar resultados.

An example MLflow experiment (Screenshot by author)

Exemplo de experimento no MLflow (captura de tela do autor)

Os passos para criar uma estrutura de experimentação são:

  • Instalar o MLflow e definir a tracking URI
  • Criar um experimento
  • Iniciar uma execução do MLflow e registrar parâmetros, métricas e artefatos
  • Criar múltiplas execuções no mesmo experimento para tuning de hiperparâmetros e outras melhorias
  • Revisar os resultados das execuções do experimento
  • Selecionar o melhor modelo e promovê-lo para produção

Uma vez estabelecida a estrutura, conseguimos iterar rapidamente para chegar ao melhor modelo mais cedo.

4. Implantação de modelos e MLOps

O Model Serving, outro recurso do Databricks Lakehouse AI, simplifica a transição de modelos do estágio de desenvolvimento para produção.

Essa funcionalidade permite implantar modelos como endpoints REST, que podem ser facilmente integrados a várias aplicações e serviços para predições em tempo real ou inferência em batch.

Model Serving endpoints

Endpoints de Model Serving (Fonte)

Depois que um modelo é treinado, cientistas de dados podem implantá-lo com poucos cliques, sem necessidade de grande configuração ou conhecimento aprofundado de DevOps. Veja como fazer:

  • Registrar os modelos desenvolvidos no model registry (um recurso do MLflow)
  • Usar a Serving UI para criar um endpoint para o modelo escolhido
  • Consultar o endpoint criado

Recomendamos seguir estes exemplos detalhados de tutorial da Databricks para executar essas etapas com facilidade. Essa agilidade na implantação é essencial nos fluxos de dados modernos, em que iterar e colocar modelos em produção rapidamente pode gerar muito valor de negócio.

5. Monitoramento e avaliação

Depois que nossos modelos entram em produção, a última etapa crucial do ciclo de IA é o monitoramento e a avaliação contínua. Isso envolve acompanhar o desempenho do modelo para garantir que continue eficaz e preciso ao longo do tempo.

O Databricks Lakehouse AI facilita isso por meio do Lakehouse Monitoring e das Inference Tables, ferramentas essenciais para manter a saúde e a eficácia dos sistemas de IA. Como já vimos os recursos do Lakehouse Monitoring, aqui vamos focar nas inference tables.

Em termos simples, a Inference Table é um recurso adicional, habilitado por uma checkbox, que permite capturar os dados de entrada e as respectivas predições dos endpoints de Model Serving e registrá-los em uma delta table, que fará parte do Unity Catalog.

Esse mecanismo de registro traz vários benefícios:

  • Detecção de drift do modelo: Com o tempo, os dados que o modelo encontra em produção podem se afastar dos dados originais de treinamento. As Inference Tables ajudam a detectar esse drift permitindo monitorar continuamente as características dos dados de entrada e compará-las com o dataset de treinamento. Isso funciona em conjunto com o dashboard do Lakehouse Monitoring.
  • Depuração e análise de causa raiz: Quando as predições não saem como o esperado, as Inference Tables fornecem os dados granulares necessários para entender o que aconteceu. Ao examinar a entrada específica que levou a um resultado ruim ou inesperado, os cientistas de dados podem depurar e refinar os modelos com mais eficácia.
  • Conformidade regulatória e auditoria: Em setores com exigências rigorosas de conformidade e auditoria, como finanças ou saúde, as Inference Tables oferecem um registro transparente do processo de tomada de decisão do modelo. Isso é crucial para explicar decisões a stakeholders ou órgãos reguladores.

O processo de desenvolvimento de machine learning é cíclico, ou seja, usamos o feedback da primeira versão em produção para refinar, retreinar e construir modelos mais precisos e eficientes, voltando ao primeiro passo novamente.

Conclusão

Este tutorial apresentou a evolução do Databricks Lakehouse AI e seus recursos centrais. Também vimos como esses recursos se conectam por meio de uma governança unificada. Por fim, analisamos como percorrer o ciclo de desenvolvimento de machine learning de ponta a ponta usando a plataforma Databricks Lakehouse AI.

Para saber mais sobre o Databricks Lakehouse e sua aplicação em engenharia de dados, desenvolvimento de machine learning e construção de aplicações em grande escala, recomendamos como próximo passo nosso curso Introduction to Databricks.


Arunn Thevapalan's photo
Author
Arunn Thevapalan
LinkedIn
Twitter

Como cientista de dados sênior, eu projeto, desenvolvo e implanto soluções de aprendizado de máquina em larga escala para ajudar as empresas a tomar melhores decisões baseadas em dados. Como redator de ciência de dados, compartilho aprendizados, conselhos de carreira e tutoriais práticos e detalhados.

Tópicos
Inteligência Artificial
Ciência de dados

Comece sua jornada em IA hoje mesmo!

Curso

Conceitos de IA Generativa

2 h
117.2K
Descubra como usar IA generativa de forma responsável e seu impacto futuro na sociedade.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

Como aprender IA do zero em 2026: Um guia completo feito por especialistas

Descubra tudo o que você precisa saber sobre aprender IA em 2026, desde dicas para começar, recursos úteis e insights de especialistas do setor.
Adel Nehme's photo

Adel Nehme

15 min

blog

As 16 principais estruturas e bibliotecas de IA: Um guia para iniciantes

Explore as melhores estruturas e bibliotecas de IA e seus conceitos básicos neste guia definitivo para profissionais de dados juniores que estão iniciando suas carreiras profissionais.
Yuliya Melnik's photo

Yuliya Melnik

15 min

blog

5 maneiras exclusivas de usar a IA na análise de dados

A análise de dados com IA está em alta entre os profissionais de dados. Aprenda cinco maneiras exclusivas de aproveitar o poder da IA para a análise de dados neste guia.
Austin Chia's photo

Austin Chia

9 min

AI shaking hands with a human

blog

As 5 melhores ferramentas de IA para ciência de dados em 2026

Os avanços recentes na IA têm o potencial de mudar drasticamente a ciência de dados. Dá uma olhada nesse artigo pra conhecer as cinco melhores ferramentas de IA que todo cientista de dados precisa saber.
Javier Canales Luna's photo

Javier Canales Luna

9 min

Tutorial

Tutorial da API de assistentes da OpenAI

Uma visão geral abrangente da API Assistants com nosso artigo, que oferece uma análise aprofundada de seus recursos, usos no setor, orientação de configuração e práticas recomendadas para maximizar seu potencial em vários aplicativos de negócios.
Zoumana Keita 's photo

Zoumana Keita

14 min

Tutorial

O guia completo para machine learning na AWS com o Amazon SageMaker

Este tutorial abrangente ensina você a usar o AWS SageMaker para criar, treinar e implantar modelos de machine learning. Nós guiamos você por todo o fluxo de trabalho, desde a configuração do seu ambiente AWS e a criação de uma instância de notebook do SageMaker até a preparação de dados, modelos de treinamento e sua implementação como endpoints.
Ver MaisVer Mais