Pular para o conteúdo principal

O que é overfitting?

Entenda as causas e os efeitos do overfitting em machine learning e como evitá-lo para criar modelos que generalizam bem para novos dados.
Atualizado 17 de set. de 2026  · 5 min lido

Explorar com IA

ChatGPTClaudePerplexity

Overfitting é um desafio comum em machine learning: o modelo aprende bem demais os dados de treino — inclusive ruídos e outliers — e acaba tendo um desempenho ruim em dados que nunca viu. Combater o overfitting é essencial, porque o objetivo principal de um modelo é fazer previsões precisas em dados novos, não apenas reproduzir o conjunto de treino.

Overfitting, em detalhes

Em machine learning, a meta é criar modelos que generalizem bem para dados inéditos. Overfitting acontece quando o modelo se ajusta demais aos dados de treino, capturando até flutuações aleatórias. Imagine ensinar uma criança a reconhecer aves, mas você só mostra pombos. Quando ela vir uma águia, pode achar que também é um pombo — porque foi isso que aprendeu.

As causas de overfitting podem ser várias:

  • Modelos complexos. Usar um modelo complexo demais para uma tarefa simples pode levar a overfitting. Por exemplo, aplicar regressão polinomial de grau alto em dados com relação essencialmente linear.
  • Poucos dados. Quando há pouco dado disponível, o modelo pode “enxergar” padrões que não existem.
  • Dados ruidosos. Se os dados de treino contêm erros ou flutuações aleatórias, um modelo sobreajustado vai tratá-los como se fossem padrões reais.

O impacto do overfitting é grande. Embora um modelo sobreajustado tenha alta acurácia no treino, ele tem desempenho fraco em dados novos por não generalizar o suficiente.

Como detectar overfitting

Detectar overfitting é uma etapa crucial no processo de machine learning. Veja como identificar:

  • Conjunto de validação. Separe os dados em treino e validação. Se o modelo vai bem no treino, mas mal na validação, é um forte indício de overfitting.
  • Curvas de aprendizado. Plote o desempenho no treino e na validação ao longo do tempo. Se as curvas começam a divergir, é sinal de sobreajuste.
  • Cross-validation. Use validação cruzada, dividindo o treino em múltiplas partes e avaliando o modelo em cada divisão.

É ainda mais importante checar overfitting quando:

  • Você usa um modelo complexo.
  • Você tem poucos dados.
  • O risco é alto, como em diagnósticos médicos.

Como prevenir overfitting

Prevenir é melhor do que remediar. Algumas medidas eficazes:

  • Modelos mais simples. Comece simples e só aumente a complexidade se necessário.
  • Mais dados. Se possível, colete mais dados. Quanto mais dados o modelo vê, melhor tende a generalizar.
  • Regularização. Técnicas como L1 e L2 ajudam a prevenir overfitting ao penalizar parâmetros que provavelmente causam sobreajuste.
  • Dropout. Em redes neurais, dropout “desativa” neurônios aleatoriamente durante o treino, forçando a rede a aprender recursos mais robustos.

Confira nosso tutorial completo sobre como prevenir overfitting em machine learning.

Overfitting vs. underfitting

Enquanto o overfitting é uma adaptação excessiva aos dados de treino, o underfitting é o oposto: o modelo não consegue capturar nem os padrões básicos do conjunto de treino.

  • Overfitting: alta acurácia no treino e baixa em dados novos. É como um GPS que funciona perfeitamente na sua cidade, mas se perde em qualquer outro lugar.
  • Underfitting: baixa acurácia tanto no treino quanto nos dados novos. É como um GPS que nem consegue te guiar na sua própria cidade.

Tanto overfitting quanto underfitting levam a previsões ruins em dados inéditos, mas por motivos diferentes. Overfitting costuma vir de modelos complexos demais ou dados ruidosos; underfitting, de modelos simples demais ou falta de atributos relevantes.

Overfitting: o desafio constante para engenheiros de ML

Como engenheiros de machine learning (ML), buscamos construir modelos o mais precisos possível. Mas o overfitting é um dos maiores riscos nessa busca por alta acurácia.

Muitas empresas caem nessa armadilha. Vêm uma acurácia alta no treino e assumem que têm um modelo excelente. Quando colocam em produção, ele desmorona. É como gabaritar os simulados e ir mal na prova de verdade.

Como engenheiros de ML, precisamos resistir à tentação de perseguir a perfeição só nos dados de treino. Não dá para ter 100% de acurácia no treino e esperar que isso se traduza em dados novos. É essencial usar técnicas como validação cruzada, regularização, aumento de dados e ensembling para garantir boa capacidade de generalização.

A jornada de machine learning costuma começar com um modelo subajustado, que vai ganhando acurácia com iterações. Mas chega uma hora em que mexidas adicionais começam a causar overfitting. É preciso equilibrar o fio da navalha entre under e overfitting para encontrar o “ponto ideal” — um modelo que funciona bem em diferentes cenários.

Quer aprender mais sobre IA e machine learning? Explore estes recursos:

Perguntas frequentes

Por que o overfitting é ruim?

Overfitting reduz a capacidade do modelo de generalizar para dados novos — que é justamente seu principal objetivo.

Como evitar que meu modelo tenha overfitting?

Use modelos mais simples, colete mais dados, aplique técnicas de regularização e utilize dropout em redes neurais.

Overfitting pode ser bom em alguns cenários?

Em casos muito raros, se os dados de treino forem extremamente representativos e abrangentes, o overfitting pode não ser prejudicial. Porém, na maioria dos cenários reais, é algo indesejável.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Sou um cientista de dados certificado que gosta de criar aplicativos de aprendizado de máquina e escrever blogs sobre ciência de dados. No momento, estou me concentrando na criação e edição de conteúdo e no trabalho com modelos de linguagem de grande porte.

Tópicos
Inteligência Artificial
Aprendizado de máquina