GüzelÇorba Kazıyıcı
HTML'yi mikropip/requests aracılığıyla getir ve ayrıştır.
Genel Bakış
İstekler normalde yerel bir işletim sistemi soketi gerektirse de,PyRunistek işlevselliğini tarayıcı getirme API'si üzerinden eşler.
Bu, açık CORS sayfalarının ayrıştırılmasına olanak tanır.
Kod ve Yürütme Çıkışı
Hacker News'in en önemli haber başlıklarını dinamik olarak sıyırır.
scraper.py
Editör'de deneyinimport requests
from bs4 import BeautifulSoup
# PyRun uses micropip internally to make requests
# through the browser's fetch API
url = 'https://news.ycombinator.com'
print(f"Fetching {url}...\n")
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
print("=== Hacker News Top Stories ===")
# Find the story titles
titles = soup.find_all('span', class_='titleline', limit=5)
for i, title in enumerate(titles):
link = title.find('a')
text = link.text
href = link.get('href')
print(f"{i+1}. {text}")
print(f" Link: {href}\n")Terminal Çıkışı
Fetching https://news.ycombinator.com...
=== Hacker News Top Stories ===
1. ...
Link: ...
2. ...
Link: ...Adım Adım Uygulama
- Web Kazıma
- Veri Toplama
- SEO Denetimi
Sıkça Sorulan Sorular
Bir istek neden ara sıra başarısız oluyor?
Bir site, tarayıcı getirme işlemlerini engelleyen katı CORS başlıklarına sahipse başarısız olur. News.ycombinator şu anda açık okuma CORS'a izin veriyor.