beautifulsoup4
Parsingウェブスクレイピング
概要 beautifulsoup4
BeautifulSoup4 (bs4) は、HTML および XML ドキュメントを解析するための Python ライブラリです。ページのソース コードから解析ツリーを作成し、データの移動、検索、抽出を容易にします。リクエスト ライブラリと組み合わせることで、最も一般的な Python Web スクレイピング スタックの基礎を形成します。
PyRunでは、BeautifulSoup4 がマイクロピップ経由でロードされ、すぐに動作します。ローカルの Python 環境を使用せずに、生の HTML 文字列を解析し、タグ、属性、テキスト コンテンツを抽出し、ドキュメント構造を調査できます。これは、Web スクレイピングの概念を安全に学習するための優れたツールです。
コードと実行の出力
HTML ドキュメントに移動してデータを抽出します。
HTML Parsing with BeautifulSoupエディターで実行
from bs4 import BeautifulSoup
html_doc = """
<html>
<head><title>Sample Page</title></head>
<body>
<h1>Article List</h1>
<ul>
<li><a href="/post/1" class="post">Intro to Python</a></li>
<li><a href="/post/2" class="post">NumPy Basics</a></li>
<li><a href="/post/3" class="post">Pandas Guide</a></li>
</ul>
<p class="footer">© 2025 PyRun</p>
</body>
</html>
"""
soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
print(f" {a.string} → {a['href']}")関連パッケージ
推奨される Python リソース
関連するインタラクティブなチュートリアル、チートシート、コード比較で知識を深めてください。
Python チュートリアル
Python ループ
Python ループを使用してデータを反復処理する方法を学びます。インタラクティブな例を使用して、for ループ、while ループ、ブレーク、継続、ループのベスト プラクティスをマスターします。
リソースの表示
ハウツーガイド
Python でリストを並べ替える方法
sort() メソッドとsorted() 関数を使用して、Python でリストを並べ替える方法を学びます。カスタムキーの並べ替えと逆順の例をご覧ください。
リソースの表示
チートシート
Python 文字列メソッドのチートシート
Python 文字列操作の完全なリファレンス ガイド。文字列プロパティの書式設定、検索、分割、置換、チェックをマスターします。
リソースの表示
言語の比較
Python と JavaScript: どちらのプログラミング言語が最適ですか?
Python と JavaScript の包括的な比較。構文の違い、パフォーマンス、使用例 (バックエンドとフロントエンド)、およびコーディング例を調べます。
リソースの表示