beautifulsoup4

Parsing

网页抓取

概述 beautifulsoup4

BeautifulSoup4 (bs4) 是一个用于解析 HTML 和 XML 文档的 Python 库。它从页面源代码创建一个解析树,使导航、搜索和提取数据变得容易。与 requests 库相结合,它构成了最常见的 Python 网络抓取堆栈的基础。

在PyRun中,BeautifulSoup4 通过 micropip 加载并立即运行。您可以解析原始 HTML 字符串、提取标签、属性和文本内容,并探索文档结构 - 所有这些都无需本地 Python 环境。它是安全学习网络抓取概念的绝佳工具。

代码和执行输出

导航 HTML 文档并从中提取数据。

HTML Parsing with BeautifulSoup在编辑器中运行
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

相关套餐

推荐的 Python 资源

通过相关的交互式教程、备忘单和代码比较来扩展您的知识。