Wunderschöner Suppenschaber

HTML über Micropip/Requests abrufen und analysieren.

Versuchen Sie es im Editor

Übersicht

Während Anfragen normalerweise einen lokalen Betriebssystem-Socket erfordern, ordnetPyRundie Funktionalität von Anfragen über die Browser-Abruf-API zu.

Dies ermöglicht das Parsen geöffneter CORS-Seiten.

Code- und Ausführungsausgabe

Kratzt die Schlagzeilen der Top-Storys von Hacker News dynamisch ab.

import requests
from bs4 import BeautifulSoup

# PyRun uses micropip internally to make requests 
# through the browser's fetch API
url = 'https://news.ycombinator.com'
print(f"Fetching {url}...\n")

response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')

print("=== Hacker News Top Stories ===")
# Find the story titles
titles = soup.find_all('span', class_='titleline', limit=5)

for i, title in enumerate(titles):
    link = title.find('a')
    text = link.text
    href = link.get('href')
    print(f"{i+1}. {text}")
    print(f"   Link: {href}\n")
Terminal-Ausgabe
Fetching https://news.ycombinator.com...

=== Hacker News Top Stories ===
1. ...
   Link: ...

2. ...
   Link: ...

Schrittweise Umsetzung

  • Web Scraping
  • Datenaggregation
  • SEO-Audit

Häufig gestellte Fragen

Warum schlägt eine Anfrage manchmal fehl?

Wenn eine Site strikte CORS-Header hat, die Browser-Abrufvorgänge verhindern, schlägt sie fehl. News.ycombinator erlaubt derzeit Open-Read-CORS.

Verwandte Themen