beautifulsoup4

Parsing

Scrapage Web

Aperçu beautifulsoup4

BeautifulSoup4 (bs4) est une bibliothèque Python pour analyser les documents HTML et XML. Il crée un arbre d'analyse à partir du code source de la page qui facilite la navigation, la recherche et l'extraction de données. Combiné avec la bibliothèque de requêtes, il constitue la base de la pile de web-scraping Python la plus courante.

DansPyRun, BeautifulSoup4 est chargé via micropip et fonctionne immédiatement. Vous pouvez analyser des chaînes HTML brutes, extraire des balises, des attributs et du contenu textuel et explorer la structure du document, le tout sans environnement Python local. C'est un excellent outil pour apprendre les concepts de web scraping en toute sécurité.

Sortie de code et d'exécution

Naviguez et extrayez des données à partir d’un document HTML.

HTML Parsing with BeautifulSoupExécuter dans l'éditeur
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

Forfaits associés

Ressources Python recommandées

Développez vos connaissances avec des didacticiels interactifs, des aide-mémoire et des comparaisons de codes associés.