beautifulsoup4
Parsing网页抓取
概述 beautifulsoup4
BeautifulSoup4 (bs4) 是一个用于解析 HTML 和 XML 文档的 Python 库。它从页面源代码创建一个解析树,使导航、搜索和提取数据变得容易。与 requests 库相结合,它构成了最常见的 Python 网络抓取堆栈的基础。
在PyRun中,BeautifulSoup4 通过 micropip 加载并立即运行。您可以解析原始 HTML 字符串、提取标签、属性和文本内容,并探索文档结构 - 所有这些都无需本地 Python 环境。它是安全学习网络抓取概念的绝佳工具。
代码和执行输出
导航 HTML 文档并从中提取数据。
HTML Parsing with BeautifulSoup在编辑器中运行
from bs4 import BeautifulSoup
html_doc = """
<html>
<head><title>Sample Page</title></head>
<body>
<h1>Article List</h1>
<ul>
<li><a href="/post/1" class="post">Intro to Python</a></li>
<li><a href="/post/2" class="post">NumPy Basics</a></li>
<li><a href="/post/3" class="post">Pandas Guide</a></li>
</ul>
<p class="footer">© 2025 PyRun</p>
</body>
</html>
"""
soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
print(f" {a.string} → {a['href']}")相关套餐
推荐的 Python 资源
通过相关的交互式教程、备忘单和代码比较来扩展您的知识。
Python教程
Python 循环:For 和 While 循环解释
了解如何使用 Python 循环来迭代数据。通过交互式示例掌握 for 循环、while 循环、break、continue 和循环最佳实践。
查看资源
操作指南
如何在 Python 中对列表进行排序(升序和降序)
了解如何在 Python 中使用 sort() 方法和sorted() 函数对列表进行排序。发现自定义键排序和逆序示例。
查看资源
备忘单
Python 字符串方法备忘单
Python 字符串操作的完整参考指南。掌握格式化、搜索、拆分、替换和检查字符串属性。
查看资源
语言比较
Python 与 JavaScript:哪种编程语言最好?
Python 和 JavaScript 的全面比较。探索语法差异、性能、用例(后端与前端)和编码示例。
查看资源