BeautifulSoup Grattoir
Récupérez et analysez le HTML via micropip/requests.
Aperçu
Alors que les requêtes nécessitent normalement un socket de système d'exploitation local,PyRunmappe la fonctionnalité des requêtes sur l'API de récupération du navigateur.
Cela permet l'analyse des pages CORS ouvertes.
Sortie de code et d'exécution
Gratte dynamiquement les gros titres de Hacker News.
scraper.py
Essayez dans l'éditeurimport requests
from bs4 import BeautifulSoup
# PyRun uses micropip internally to make requests
# through the browser's fetch API
url = 'https://news.ycombinator.com'
print(f"Fetching {url}...\n")
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
print("=== Hacker News Top Stories ===")
# Find the story titles
titles = soup.find_all('span', class_='titleline', limit=5)
for i, title in enumerate(titles):
link = title.find('a')
text = link.text
href = link.get('href')
print(f"{i+1}. {text}")
print(f" Link: {href}\n")Sortie terminale
Fetching https://news.ycombinator.com...
=== Hacker News Top Stories ===
1. ...
Link: ...
2. ...
Link: ...Mise en œuvre étape par étape
- Grattage Web
- Agrégation de données
- Audit SEO
Foire aux questions
Pourquoi une requête échoue-t-elle parfois ?
Si un site possède des en-têtes CORS stricts empêchant les opérations de récupération du navigateur, il échouera. News.ycombinator permet actuellement la lecture ouverte de CORS.