beautifulsoup4

Parsing

ウェブスクレイピング

概要 beautifulsoup4

BeautifulSoup4 (bs4) は、HTML および XML ドキュメントを解析するための Python ライブラリです。ページのソース コードから解析ツリーを作成し、データの移動、検索、抽出を容易にします。リクエスト ライブラリと組み合わせることで、最も一般的な Python Web スクレイピング スタックの基礎を形成します。

PyRunでは、BeautifulSoup4 がマイクロピップ経由でロードされ、すぐに動作します。ローカルの Python 環境を使用せずに、生の HTML 文字列を解析し、タグ、属性、テキスト コンテンツを抽出し、ドキュメント構造を調査できます。これは、Web スクレイピングの概念を安全に学習するための優れたツールです。

コードと実行の出力

HTML ドキュメントに移動してデータを抽出します。

HTML Parsing with BeautifulSoupエディターで実行
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

関連パッケージ

推奨される Python リソース

関連するインタラクティブなチュートリアル、チートシート、コード比較で知識を深めてください。