beautifulsoup4

Parsing

Web kazıma

Genel Bakış beautifulsoup4

BeautifulSoup4 (bs4), HTML ve XML belgelerini ayrıştırmaya yönelik bir Python kitaplığıdır. Sayfa kaynak kodundan, gezinmeyi, aramayı ve veri çıkarmayı kolaylaştıran bir ayrıştırma ağacı oluşturur. İstek kitaplığıyla birleştirildiğinde en yaygın Python web kazıma yığınının temelini oluşturur.

PyRun'da BeautifulSoup4 mikropip aracılığıyla yüklenir ve hemen çalışır. Ham HTML dizelerini ayrıştırabilir, etiketleri, nitelikleri ve metin içeriğini çıkarabilir ve belge yapısını keşfedebilirsiniz; bunların tümünü yerel bir Python ortamı olmadan yapabilirsiniz. Web kazıma kavramlarını güvenli bir şekilde öğrenmek için harika bir araçtır.

Kod ve Yürütme Çıkışı

Bir HTML belgesinde gezinin ve verileri çıkarın.

HTML Parsing with BeautifulSoupDüzenleyicide Çalıştır
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

İlgili Paketler

Önerilen Python Kaynakları

İlgili etkileşimli eğitimler, yardımcı sayfalar ve kod karşılaştırmalarıyla bilginizi genişletin.