beautifulsoup4

Parsing

Raspagem da Web

Visão geral beautifulsoup4

BeautifulSoup4 (bs4) é uma biblioteca Python para análise de documentos HTML e XML. Ele cria uma árvore de análise do código-fonte da página que facilita a navegação, pesquisa e extração de dados. Combinado com a biblioteca de solicitações, ele forma a base da pilha de web scraping mais comum do Python.

EmPyRun, BeautifulSoup4 é carregado via micropip e funciona imediatamente. Você pode analisar strings HTML brutas, extrair tags, atributos e conteúdo de texto e explorar a estrutura do documento — tudo isso sem um ambiente Python local. É uma ótima ferramenta para aprender conceitos de web scraping com segurança.

Saída de código e execução

Navegue e extraia dados de um documento HTML.

HTML Parsing with BeautifulSoupExecutar no Editor
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

Pacotes Relacionados

Recursos Python recomendados

Expanda seu conhecimento com tutoriais interativos relacionados, folhas de dicas e comparações de código.