Pengikis Sup yang Cantik
Ambil dan parsing HTML melalui micropip/permintaan.
Ikhtisar
Meskipun permintaan biasanya memerlukan soket OS lokal,PyRunmemetakan fungsionalitas permintaan melalui API pengambilan browser.
Ini memungkinkan penguraian halaman CORS yang terbuka.
Kode & Output Eksekusi
Mengikis berita utama Berita Peretas secara dinamis.
scraper.py
Coba di Editorimport requests
from bs4 import BeautifulSoup
# PyRun uses micropip internally to make requests
# through the browser's fetch API
url = 'https://news.ycombinator.com'
print(f"Fetching {url}...\n")
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
print("=== Hacker News Top Stories ===")
# Find the story titles
titles = soup.find_all('span', class_='titleline', limit=5)
for i, title in enumerate(titles):
link = title.find('a')
text = link.text
href = link.get('href')
print(f"{i+1}. {text}")
print(f" Link: {href}\n")Keluaran Terminal
Fetching https://news.ycombinator.com...
=== Hacker News Top Stories ===
1. ...
Link: ...
2. ...
Link: ...Implementasi Langkah demi Langkah
- Pengikisan Web
- Agregasi Data
- Audit SEO
Pertanyaan yang Sering Diajukan
Mengapa permintaan terkadang gagal?
Jika situs memiliki header CORS yang ketat yang mencegah operasi pengambilan browser, situs tersebut akan gagal. News.ycombinator saat ini mengizinkan CORS baca terbuka.