Lindo raspador de sopa
Busque e analise HTML via micropip/solicitações.
Visão geral
Embora as solicitações normalmente exijam um soquete de sistema operacional local,PyRunmapeia a funcionalidade das solicitações por meio da API de busca do navegador.
Isso permite a análise de páginas CORS abertas.
Saída de código e execução
Raspa as principais manchetes do Hacker News dinamicamente.
scraper.py
Experimente no Editorimport requests
from bs4 import BeautifulSoup
# PyRun uses micropip internally to make requests
# through the browser's fetch API
url = 'https://news.ycombinator.com'
print(f"Fetching {url}...\n")
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
print("=== Hacker News Top Stories ===")
# Find the story titles
titles = soup.find_all('span', class_='titleline', limit=5)
for i, title in enumerate(titles):
link = title.find('a')
text = link.text
href = link.get('href')
print(f"{i+1}. {text}")
print(f" Link: {href}\n")Saída terminal
Fetching https://news.ycombinator.com...
=== Hacker News Top Stories ===
1. ...
Link: ...
2. ...
Link: ...Implementação passo a passo
- Raspagem da Web
- Agregação de dados
- Auditoria de SEO
Perguntas frequentes
Por que uma solicitação falha ocasionalmente?
Se um site tiver cabeçalhos CORS estritos que impeçam as operações de busca do navegador, ele falhará. News.ycombinator atualmente permite CORS de leitura aberta.