Pengikis Sup yang Cantik

Ambil dan parsing HTML melalui micropip/permintaan.

Coba di Editor

Ikhtisar

Meskipun permintaan biasanya memerlukan soket OS lokal,PyRunmemetakan fungsionalitas permintaan melalui API pengambilan browser.

Ini memungkinkan penguraian halaman CORS yang terbuka.

Kode & Output Eksekusi

Mengikis berita utama Berita Peretas secara dinamis.

scraper.py
Coba di Editor
import requests
from bs4 import BeautifulSoup

# PyRun uses micropip internally to make requests 
# through the browser's fetch API
url = 'https://news.ycombinator.com'
print(f"Fetching {url}...\n")

response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')

print("=== Hacker News Top Stories ===")
# Find the story titles
titles = soup.find_all('span', class_='titleline', limit=5)

for i, title in enumerate(titles):
    link = title.find('a')
    text = link.text
    href = link.get('href')
    print(f"{i+1}. {text}")
    print(f"   Link: {href}\n")
Keluaran Terminal
Fetching https://news.ycombinator.com...

=== Hacker News Top Stories ===
1. ...
   Link: ...

2. ...
   Link: ...

Implementasi Langkah demi Langkah

  • Pengikisan Web
  • Agregasi Data
  • Audit SEO

Pertanyaan yang Sering Diajukan

Mengapa permintaan terkadang gagal?

Jika situs memiliki header CORS yang ketat yang mencegah operasi pengambilan browser, situs tersebut akan gagal. News.ycombinator saat ini mengizinkan CORS baca terbuka.

Topik Terkait