Pular para o conteúdo principal

Tutorial ScrapeGraphAI: começando com web scraping com IA

ScrapeGraph AI é uma ferramenta open source que simplifica o web scraping ao extrair automaticamente dados estruturados de sites, permitindo que você interaja e recupere os dados por meio de prompts simples.
Atualizado 17 de set. de 2026  · 7 min lido

Explorar com IA

ChatGPTClaudePerplexity

Extrair e organizar dados de várias fontes, como sites e documentos locais (XML, HTML, JSON, Markdown), pode ser complexo e demorado. Seja para pesquisa, análise de negócios ou agregação de conteúdo, o esforço manual pode ser enorme.

ScrapeGraphAI, uma biblioteca Python para web scraping, simplifica esse processo.

Ela usa modelos de linguagem de grande porte (LLMs) e lógica de grafos direta para criar pipelines de scraping eficientes, automatizando a extração de dados e reduzindo a necessidade de muito código.

Neste artigo, vou apresentar rapidamente o ScrapeGraphAI e te guiar na configuração do seu primeiro pipeline.

Desenvolver aplicativos de IA

Aprenda a criar aplicativos de IA usando a API OpenAI.
Comece a Treinar Gratuitamente

O que é o ScrapeGraphAI?

ScrapeGraphAI é uma ferramenta poderosa de web scraping que usa LLMs e lógica de grafos direta para construir pipelines de scraping.

Ela consegue extrair informações de sites e de vários formatos de documentos locais, como XML, HTML, JSON e Markdown.

Recursos

O ScrapeGraphAI foi pensado para ser prático e eficiente. Você só precisa dizer que informação quer e o ScrapeGraphAI faz o resto. Ele automatiza a criação de pipelines de scraping a partir de prompts do usuário, reduzindo a necessidade de codificação manual.

A ferramenta suporta diversos formatos de documentos e pode se integrar a diferentes LLMs via APIs. É escalável, oferecendo scraping de página única e multipágina, o que a torna adequada tanto para tarefas pequenas quanto para extração de dados em larga escala.

Por fim, é compatível com vários provedores de LLMs como OpenAI, Groq, Azure e Gemini, além de modelos locais com Ollama.

Pipelines de scraping

O ScrapeGraphAI inclui vários tipos de pipelines de scraping:

  • SmartScraperGraph: scraper de página única que requer apenas um prompt e uma fonte de entrada.
  • SearchGraph: scraper multipágina que extrai informações dos principais resultados de busca.
  • SpeechGraph: scraper de página única que gera arquivos de áudio a partir do conteúdo do site.
  • ScriptCreatorGraph: scraper de página única que cria scripts Python para os dados extraídos.
  • SmartScraperMultiGraph: scraper multipágina que trabalha em várias páginas com um único prompt e uma lista de fontes.
  • ScriptCreatorMultiGraph: scraper multipágina que cria scripts Python para extrair informações de múltiplas páginas e fontes.

Instalação do ScrapeGraphAI

O ScrapeGraphAI simplifica a configuração e a execução de tarefas de extração de dados de sites e documentos locais. Veja como instalar rapidamente a biblioteca e criar um aplicativo básico de scraping.

Instalação rápida

Para instalar o ScrapeGraphAI, execute:

pip install scrapegraphai

Construindo um aplicativo simples com ScrapeGraphAI

Vamos criar um pipeline simples usando o SmartScraperGraph. Primeiro, vou descrever as etapas e, em seguida, apresentar o código.

Etapa 1: defina a tarefa

Especifique quais informações você quer extrair. Neste exemplo, vamos extrair todos os títulos de artigos e URLs da minha newsletter no Substack The Limitless Playbook 🧬.

Etapa 2: escolha o pipeline de scraping

Selecione o pipeline apropriado. Para uma única página, usaremos o SmartScraperGraph. Fique à vontade para explorar outros pipelines para diferentes casos de uso.

Etapa 3: execute o pipeline

Execute o pipeline usando o método .run() para extrair os dados.

Etapa 4: revise e use os dados

Valide os dados extraídos. LLMs são poderosos, mas podem não acertar de primeira. Ajuste o prompt conforme necessário para chegar ao resultado desejado.

Código

Aqui está o trecho de código completo que cobre as etapas descritas acima:

import json
import nest_asyncio
nest_asyncio.apply()
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
OPENAI_API_KEY = "YOUR_OPENAI_API_KEY"
graph_config = {
    "llm": {
        "api_key": OPENAI_API_KEY,
        "model": "gpt-3.5-turbo-0125",
        "temperature": 0,
    },
    "verbose": True,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
    prompt="List me all the articles with their respective urls",
    source="<https://ryanocm.substack.com/archive>",
    config=graph_config
)
# Run the pipeline
articles_data = smart_scraper_graph.run()
# Save the result to a JSON file
with open('articles_data.json', 'w') as json_file:
    json.dump(articles_data, json_file, indent=4)

E aqui estão os resultados finais. Nada mal, né?

{
    "articles": [
        {
            "title": "#112 | I Built an AI Tool to Help You Learn More and Take Action Faster",
            "url": "<https://ryanocm.substack.com/p/112-i-built-an-ai-tool-to-help-you>"
        },
        {
            "title": "#111 | Don't Fight When You Are Getting Flooded \\ud83c\\udf0a",
            "url": "<https://ryanocm.substack.com/p/111-dont-fight-when-you-are-getting>"
        },
        {
            "title": "#110 | How to process past fights in relationships",
            "url": "<https://ryanocm.substack.com/p/110-how-to-process-past-fights-in>"
        },
        {
            "title": "#109 | AI x Crypto(graphy)",
            "url": "<https://ryanocm.substack.com/p/109-ai-x-cryptography>"
        },
        {
            "title": "#108 | How to Love Intentionally \\u2764\\ufe0f",
            "url": "<https://ryanocm.substack.com/p/108-how-to-love-intentionally>"
        },
        {
            "title": "#107 | 16 Questions To Better Understand Who You Are \\ud83c\\udfad",
            "url": "<https://ryanocm.substack.com/p/107-16-questions-to-better-understand>"
        },
        {
            "title": "#106 | Three Types of Burnouts \\ud83e\\udd15",
            "url": "<https://ryanocm.substack.com/p/106-three-types-of-burnouts>"
        },
        {
            "title": "#105 | The Bagel Method in Relationships \\ud83e\\udd6f",
            "url": "<https://ryanocm.substack.com/p/105-the-bagel-method-in-relationships>"
        },
        {
            "title": "#104 | The 8 Play Personalities \\ud83c\\udfad",
            "url": "<https://ryanocm.substack.com/p/104-the-8-play-personalities>"
        },
        {
            "title": "#103 | The Top Ten Myths About Conflict by Relationship Experts Julie and John Gottman",
            "url": "<https://ryanocm.substack.com/p/103-the-top-ten-myths-about-conflict>"
        },
        {
            "title": "#102 | 7 Principles to Writing Well",
            "url": "<https://ryanocm.substack.com/p/102-7-principles-to-writing-well>"
        },
        {
            "title": "#101 | How to Remember More from Books",
            "url": "<https://ryanocm.substack.com/p/101-how-to-remember-more-from-books>"
        }
    ]
}

Conclusão

O ScrapeGraphAI simplifica e automatiza o scraping de sites e documentos, deixando a extração de dados mais fácil e rápida. Sua compatibilidade com vários LLMs e formatos de documentos o torna uma ferramenta versátil para todo tipo de tarefa com dados. Com o ScrapeGraphAI, você pode focar em analisar e usar seus dados, e não em coletá-los.

Recursos do ScrapeGraphAI

Para saber mais, confira estes recursos:

E, por fim, use o ScrapeGraphAI com responsabilidade e fique atento às regras de scraping dos sites que você pretende acessar. Sempre siga os termos de uso e as diretrizes legais para web scraping.

Obtenha uma das melhores certificações de IA

Demonstre que você pode usar a IA de forma eficaz e responsável.

Ryan Ong's photo
Author
Ryan Ong
LinkedIn
Twitter

Ryan é um cientista de dados líder, especializado na criação de aplicativos de IA usando LLMs. Ele é candidato a PhD em Processamento de Linguagem Natural e Gráficos de Conhecimento no Imperial College London, onde também concluiu seu mestrado em Ciência da Computação. Fora da ciência de dados, ele escreve um boletim informativo semanal da Substack, The Limitless Playbook, no qual compartilha uma ideia prática dos principais pensadores do mundo e, ocasionalmente, escreve sobre os principais conceitos de IA.

Tópicos
Inteligência Artificial

Aprenda IA com estes cursos!

Curso

Implementação de Soluções de IA nos Negócios

2 h
54.8K
Aprenda a gerar valor comercial com IA. Identifique oportunidades, crie provas de conceito, implemente soluções e desenvolva uma estratégia de IA.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado
AI shaking hands with a human

blog

As 5 melhores ferramentas de IA para ciência de dados em 2026

Os avanços recentes na IA têm o potencial de mudar drasticamente a ciência de dados. Dá uma olhada nesse artigo pra conhecer as cinco melhores ferramentas de IA que todo cientista de dados precisa saber.
Javier Canales Luna's photo

Javier Canales Luna

9 min

blog

Anunciando a série de codificação conjunta "Torne-se um desenvolvedor de IA

Comece a trabalhar com a IA generativa nesta nova série de código-along. Gratuito por tempo limitado.
DataCamp Team's photo

DataCamp Team

4 min

blog

Como aprender IA do zero em 2026: Um guia completo feito por especialistas

Descubra tudo o que você precisa saber sobre aprender IA em 2026, desde dicas para começar, recursos úteis e insights de especialistas do setor.
Adel Nehme's photo

Adel Nehme

15 min

Tutorial

Tutorial da API de assistentes da OpenAI

Uma visão geral abrangente da API Assistants com nosso artigo, que oferece uma análise aprofundada de seus recursos, usos no setor, orientação de configuração e práticas recomendadas para maximizar seu potencial em vários aplicativos de negócios.
Zoumana Keita 's photo

Zoumana Keita

14 min

cursor ai code editor

Tutorial

AI do cursor: Um guia com 10 exemplos práticos

Saiba como instalar o Cursor AI no Windows, macOS e Linux e descubra como usá-lo em 10 casos de uso diferentes.

Tutorial

Tutorial do DeepChecks: Automatizando os testes de machine learning

Saiba como realizar a validação de dados e modelos para garantir um desempenho robusto de machine learning usando nosso guia passo a passo para automatizar testes com o DeepChecks.
Abid Ali Awan's photo

Abid Ali Awan

12 min

Ver MaisVer Mais