beautifulsoup4

Parsing

웹스크래핑

개요 beautifulsoup4

BeautifulSoup4(bs4)는 HTML 및 XML 문서를 구문 분석하기 위한 Python 라이브러리입니다. 데이터 탐색, 검색 및 추출을 쉽게 해주는 페이지 소스 코드에서 구문 분석 트리를 생성합니다. 요청 라이브러리와 결합되어 가장 일반적인 Python 웹 스크래핑 스택의 기초를 형성합니다.

PyRun에서 BeautifulSoup4는 micropip을 통해 로드되고 즉시 작동합니다. 로컬 Python 환경 없이 원시 HTML 문자열을 구문 분석하고, 태그, 속성 및 텍스트 콘텐츠를 추출하고, 문서 구조를 탐색할 수 있습니다. 웹 스크래핑 개념을 안전하게 학습할 수 있는 훌륭한 도구입니다.

코드 및 실행 출력

HTML 문서에서 데이터를 탐색하고 추출합니다.

HTML Parsing with BeautifulSoup에디터에서 실행
from bs4 import BeautifulSoup

html_doc = """
<html>
  <head><title>Sample Page</title></head>
  <body>
    <h1>Article List</h1>
    <ul>
      <li><a href="/post/1" class="post">Intro to Python</a></li>
      <li><a href="/post/2" class="post">NumPy Basics</a></li>
      <li><a href="/post/3" class="post">Pandas Guide</a></li>
    </ul>
    <p class="footer">© 2025 PyRun</p>
  </body>
</html>
"""

soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
    print(f"  {a.string}  →  {a['href']}")

관련 패키지

권장 Python 리소스

관련 대화형 튜토리얼, 치트 시트, 코드 비교를 통해 지식을 확장하세요.