beautifulsoup4

Parsing

Skrobanie sieci

Przegląd beautifulsoup4

BeautifulSoup4 (bs4) to biblioteka Pythona do analizowania dokumentów HTML i XML. Tworzy drzewo analizy z kodu źródłowego strony, które ułatwia nawigację, wyszukiwanie i wyodrębnianie danych. W połączeniu z biblioteką żądań tworzy podstawę najpopularniejszego stosu do przeglądania stron internetowych w języku Python.

WPyRunBeautifulSoup4 jest ładowany przez micropip i działa natychmiast. Możesz analizować surowe ciągi HTML, wyodrębniać znaczniki, atrybuty i treść tekstową oraz eksplorować strukturę dokumentu — a wszystko to bez lokalnego środowiska Python. To świetne narzędzie do bezpiecznego uczenia się koncepcji skrobania stron internetowych.

Dane wyjściowe kodu i wykonania

Nawiguj i wyodrębniaj dane z dokumentu HTML.

HTML Parsing with BeautifulSoupUruchom w Edytorze
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

Powiązane pakiety

Polecane zasoby Pythona

Poszerzaj swoją wiedzę dzięki powiązanym interaktywnym samouczkom, ściągawkom i porównaniom kodów.