Tutorial · 2026-07-12

Web Scraping com Python e Agentes de IA no Windows: Tutorial Completo

Aprenda a usar Claude Code e Codex no Orquestra para criar scripts de web scraping em Python, extrair dados estruturados e automatizar coletas no Windows 11.

Web scraping potencializado por agentes de IA

Web scraping é uma habilidade essencial para qualquer profissional de dados. Seja para monitorar preços, coletar dados de pesquisa ou alimentar modelos de machine learning, extrair informações da web é uma tarefa recorrente — e muitas vezes tediosa.

Com agentes de IA no Orquestra, o web scraping se torna muito mais produtivo. Claude Code gera os scripts de scraping em Python, Codex valida a estrutura dos dados extraídos, e tudo acontece em paralelo no Windows 11 sem complicação.

Cenário real: Uma empresa precisava extrair dados de 12 sites diferentes diariamente. Com agentes orquestrados, o scraping foi automatizado em 2 horas, contra 3 dias de trabalho manual com scripts tradicionais.

Configurando o ambiente de scraping

No Windows 11 com Orquestra, você pode usar tanto PowerShell quanto WSL para executar os scripts de scraping. As bibliotecas Python são instaladas pelos próprios agentes.

# Bibliotecas instaladas pelo Claude Code pip install requests beautifulsoup4 lxml pip install playwright selenium # Para sites dinâmicos pip install pandas openpyxl # Para exportação pip install scrapy # Para scraping em larga escala

No Orquestra, crie dois agentes: Claude Code para gerar os scripts de scraping e Codex para validar e estruturar os dados extraídos.

Passo 1: Scraping de sites estáticos

Para sites que servem HTML pronto (sem JavaScript), o Claude Code gera scripts com requests e BeautifulSoup. Basta fornecer a URL e dizer quais dados você quer extrair.

# Script gerado pelo Claude Code import requests from bs4 import BeautifulSoup import json url = 'https://exemplo.com/produtos' response = requests.get(url, headers={'User-Agent': 'Mozilla/5.0'}) soup = BeautifulSoup(response.text, 'lxml') produtos = [] for card in soup.select('.product-card'): produtos.append({ 'nome': card.select_one('.product-name').text.strip(), 'preco': card.select_one('.product-price').text.strip(), 'url': card.select_one('a')['href'], }) with open('produtos.json', 'w') as f: json.dump(produtos, f, ensure_ascii=False, indent=2) print(f"{len(produtos)} produtos extraídos com sucesso!")

O Codex revisa o script em tempo real, verificando se os seletores CSS estão corretos e se a estrutura de dados faz sentido. Se algo estiver errado, ele sugere a correção imediatamente.

Passo 2: Lidando com sites dinâmicos

Muitos sites modernos renderizam conteúdo com JavaScript. Para esses casos, o Claude Code gera scripts com Playwright, que executa o navegador e extrai o conteúdo renderizado.

# Scraping com Playwright gerado pelo agente from playwright.sync_api import sync_playwright with sync_playwright() as p: browser = p.chromium.launch(headless=True) page = browser.new_page() page.goto('https://exemplo-dinamico.com') # Esperar conteúdo carregar page.wait_for_selector('.data-table') # Extrair dados da tabela dados = page.evaluate('''() => { const rows = document.querySelectorAll('.data-table tr'); return Array.from(rows).map(row => ({ coluna1: row.cells[0]?.innerText, coluna2: row.cells[1]?.innerText, })); }') browser.close() print(f"Dados extraídos: {len(dados)} registros")

Enquanto o Claude Code escreve o script, o Codex pode analisar a página ao vivo e sugerir os seletores corretos, economizando tentativa e erro.

Passo 3: Processamento e exportação

De nada adianta extrair dados se eles não estiverem bem estruturados. O Codex gera pipelines de processamento que limpam, validam e exportam os dados no formato desejado.

  • Limpeza de dados: Remove duplicatas, normaliza textos e converte tipos automaticamente.
  • Validação: Verifica se os campos esperados existem e se os valores estão dentro do intervalo esperado.
  • Exportação: Gera arquivos CSV, JSON, Excel ou insere diretamente em um banco de dados.
  • Agendamento: Configura o script para rodar periodicamente com o Agendador de Tarefas do Windows.
# Pipeline de processamento gerado pelo Codex import pandas as pd # Carregar dados extraídos df = pd.read_json('produtos.json') # Limpeza df['preco'] = df['preco'].replace('[^0-9,]', '', regex=True) df['preco'] = df['preco'].str.replace(',', '.').astype(float) # Validação assert df['preco'].notna().all(), "Preços inválidos encontrados" assert df['preco'].min() > 0, "Preços negativos detectados" # Exportar df.to_excel('relatorio_produtos.xlsx', index=False) print(f"Relatório gerado: {len(df)} produtos")

Passo 4: Automatizando coletas periódicas

Com o pipeline pronto, o Orquestra permite agendar as coletas para rodar automaticamente. Um agente monitora a execução e outro processa os novos dados, criando um fluxo contínuo de extração e análise.

Essa abordagem transforma o web scraping de uma tarefa manual em um processo automatizado e confiável, onde os agentes cuidam de toda a complexidade técnica.

Perguntas frequentes

Agentes de IA conseguem fazer web scraping em qualquer site?

Sim, desde que o site seja acessível via HTTP. Os agentes geram scripts com requests, BeautifulSoup e Selenium.

O web scraping com agentes é legal?

Depende dos termos de uso do site. Sempre verifique o robots.txt e os termos de serviço.

Como lidar com sites que usam JavaScript?

Para sites dinâmicos, os agentes geram scripts com Playwright ou Selenium.

Preciso saber Python para usar agentes no web scraping?

Não. Os agentes geram todo o código de scraping e processamento automaticamente.

O Orquestra suporta scraping em larga escala?

Sim. O Orquestra permite orquestrar múltiplos agentes para scraping paralelo de várias fontes.

Automatize seu web scraping com IA?

Baixe o Orquestra para Windows 11 e crie pipelines de scraping inteligentes com Claude Code e Codex orquestrados.