Lindo raspador de sopa

Busque e analise HTML via micropip/solicitações.

Experimente no Editor

Visão geral

Embora as solicitações normalmente exijam um soquete de sistema operacional local,PyRunmapeia a funcionalidade das solicitações por meio da API de busca do navegador.

Isso permite a análise de páginas CORS abertas.

Saída de código e execução

Raspa as principais manchetes do Hacker News dinamicamente.

import requests
from bs4 import BeautifulSoup

# PyRun uses micropip internally to make requests 
# through the browser's fetch API
url = 'https://news.ycombinator.com'
print(f"Fetching {url}...\n")

response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')

print("=== Hacker News Top Stories ===")
# Find the story titles
titles = soup.find_all('span', class_='titleline', limit=5)

for i, title in enumerate(titles):
    link = title.find('a')
    text = link.text
    href = link.get('href')
    print(f"{i+1}. {text}")
    print(f"   Link: {href}\n")
Saída terminal
Fetching https://news.ycombinator.com...

=== Hacker News Top Stories ===
1. ...
   Link: ...

2. ...
   Link: ...

Implementação passo a passo

  • Raspagem da Web
  • Agregação de dados
  • Auditoria de SEO

Perguntas frequentes

Por que uma solicitação falha ocasionalmente?

Se um site tiver cabeçalhos CORS estritos que impeçam as operações de busca do navegador, ele falhará. News.ycombinator atualmente permite CORS de leitura aberta.

Tópicos Relacionados