GüzelÇorba Kazıyıcı

HTML'yi mikropip/requests aracılığıyla getir ve ayrıştır.

Editör'de deneyin

Genel Bakış

İstekler normalde yerel bir işletim sistemi soketi gerektirse de,PyRunistek işlevselliğini tarayıcı getirme API'si üzerinden eşler.

Bu, açık CORS sayfalarının ayrıştırılmasına olanak tanır.

Kod ve Yürütme Çıkışı

Hacker News'in en önemli haber başlıklarını dinamik olarak sıyırır.

import requests
from bs4 import BeautifulSoup

# PyRun uses micropip internally to make requests 
# through the browser's fetch API
url = 'https://news.ycombinator.com'
print(f"Fetching {url}...\n")

response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')

print("=== Hacker News Top Stories ===")
# Find the story titles
titles = soup.find_all('span', class_='titleline', limit=5)

for i, title in enumerate(titles):
    link = title.find('a')
    text = link.text
    href = link.get('href')
    print(f"{i+1}. {text}")
    print(f"   Link: {href}\n")
Terminal Çıkışı
Fetching https://news.ycombinator.com...

=== Hacker News Top Stories ===
1. ...
   Link: ...

2. ...
   Link: ...

Adım Adım Uygulama

  • Web Kazıma
  • Veri Toplama
  • SEO Denetimi

Sıkça Sorulan Sorular

Bir istek neden ara sıra başarısız oluyor?

Bir site, tarayıcı getirme işlemlerini engelleyen katı CORS başlıklarına sahipse başarısız olur. News.ycombinator şu anda açık okuma CORS'a izin veriyor.

İlgili Konular