beautifulsoup4

Parsing

Raschiamento del web

Panoramica beautifulsoup4

BeautifulSoup4 (bs4) è una libreria Python per l'analisi di documenti HTML e XML. Crea un albero di analisi dal codice sorgente della pagina che semplifica la navigazione, la ricerca e l'estrazione dei dati. Combinato con la libreria request, costituisce la base del più comune stack di web-scraping Python.

InPyRun, BeautifulSoup4 viene caricato tramite micropip e funziona immediatamente. Puoi analizzare stringhe HTML non elaborate, estrarre tag, attributi e contenuto di testo ed esplorare la struttura del documento, il tutto senza un ambiente Python locale. È un ottimo strumento per apprendere i concetti di web scraping in modo sicuro.

Codice e output di esecuzione

Naviga ed estrai dati da un documento HTML.

HTML Parsing with BeautifulSoupEsegui nell'editor
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

Pacchetti correlati

Risorse Python consigliate

Espandi le tue conoscenze con tutorial interattivi, foglietti illustrativi e confronti di codici correlati.