beautifulsoup4

Parsing

Quét web

Tổng quan beautifulsoup4

BeautifulSoup4 (bs4) là thư viện Python để phân tích tài liệu HTML và XML. Nó tạo ra một cây phân tích cú pháp từ mã nguồn trang giúp dễ dàng điều hướng, tìm kiếm và trích xuất dữ liệu. Kết hợp với thư viện yêu cầu, nó tạo thành nền tảng của ngăn xếp quét web Python phổ biến nhất.

TrongPyRun, BeautifulSoup4 được tải qua micropip và hoạt động ngay lập tức. Bạn có thể phân tích cú pháp các chuỗi HTML thô, trích xuất thẻ, thuộc tính và nội dung văn bản cũng như khám phá cấu trúc tài liệu — tất cả đều không có môi trường Python cục bộ. Đây là một công cụ tuyệt vời để học các khái niệm quét web một cách an toàn.

Đầu ra mã & thực thi

Điều hướng và trích xuất dữ liệu từ một tài liệu HTML.

HTML Parsing with BeautifulSoupChạy trong Trình chỉnh sửa
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

Gói liên quan

Tài nguyên Python được đề xuất

Mở rộng kiến thức của bạn với các hướng dẫn tương tác, bảng ghi chú và so sánh mã có liên quan.