beautifulsoup4

Parsing

raspado web

Descripción general beautifulsoup4

BeautifulSoup4 (bs4) es una biblioteca de Python para analizar documentos HTML y XML. Crea un árbol de análisis a partir del código fuente de la página que facilita la navegación, la búsqueda y la extracción de datos. Combinado con la biblioteca de solicitudes, forma la base de la pila de raspado web de Python más común.

EnPyRun, BeautifulSoup4 se carga mediante micropip y funciona de inmediato. Puede analizar cadenas HTML sin formato, extraer etiquetas, atributos y contenido de texto, y explorar la estructura del documento, todo sin un entorno Python local. Es una gran herramienta para aprender conceptos de web scraping de forma segura.

Código y salida de ejecución

Navegar y extraer datos de un documento HTML.

HTML Parsing with BeautifulSoupEjecutar en el editor
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

Paquetes relacionados

Recursos recomendados de Python

Amplíe sus conocimientos con tutoriales interactivos relacionados, hojas de trucos y comparaciones de códigos.