beautifulsoup4

Parsing

Web-Scraping

Übersicht beautifulsoup4

BeautifulSoup4 (bs4) ist eine Python-Bibliothek zum Parsen von HTML- und XML-Dokumenten. Es erstellt einen Analysebaum aus dem Seitenquellcode, der das Navigieren, Suchen und Extrahieren von Daten erleichtert. In Kombination mit der Requests-Bibliothek bildet es die Grundlage des gängigsten Python-Web-Scraping-Stacks.

InPyRunwird BeautifulSoup4 über Micropip geladen und funktioniert sofort. Sie können rohe HTML-Strings analysieren, Tags, Attribute und Textinhalte extrahieren und die Dokumentstruktur erkunden – alles ohne eine lokale Python-Umgebung. Es ist ein großartiges Tool zum sicheren Erlernen von Web-Scraping-Konzepten.

Code- und Ausführungsausgabe

Navigieren Sie und extrahieren Sie Daten aus einem HTML-Dokument.

HTML Parsing with BeautifulSoupIm Editor ausführen
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

Verwandte Pakete

Empfohlene Python-Ressourcen

Erweitern Sie Ihr Wissen mit zugehörigen interaktiven Tutorials, Spickzetteln und Codevergleichen.