beautifulsoup4

Parsing

Pengikisan web

Ikhtisar beautifulsoup4

BeautifulSoup4 (bs4) adalah perpustakaan Python untuk mengurai dokumen HTML dan XML. Ini membuat pohon parse dari kode sumber halaman yang memudahkan navigasi, pencarian, dan mengekstrak data. Dikombinasikan dengan perpustakaan permintaan, ini membentuk dasar dari tumpukan pengikisan web Python yang paling umum.

DiPyRun, BeautifulSoup4 dimuat melalui micropip dan langsung berfungsi. Anda dapat mengurai string HTML mentah, mengekstrak tag, atribut, dan konten teks, serta menjelajahi struktur dokumen — semuanya tanpa lingkungan Python lokal. Ini adalah alat yang hebat untuk mempelajari konsep web scraping dengan aman.

Kode & Output Eksekusi

Navigasi dan ekstrak data dari dokumen HTML.

HTML Parsing with BeautifulSoupJalankan di Editor
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

Paket Terkait

Sumber Daya Python yang Direkomendasikan

Perluas pengetahuan Anda dengan tutorial interaktif terkait, lembar contekan, dan perbandingan kode.