beautifulsoup4
Parsing웹스크래핑
개요 beautifulsoup4
BeautifulSoup4(bs4)는 HTML 및 XML 문서를 구문 분석하기 위한 Python 라이브러리입니다. 데이터 탐색, 검색 및 추출을 쉽게 해주는 페이지 소스 코드에서 구문 분석 트리를 생성합니다. 요청 라이브러리와 결합되어 가장 일반적인 Python 웹 스크래핑 스택의 기초를 형성합니다.
PyRun에서 BeautifulSoup4는 micropip을 통해 로드되고 즉시 작동합니다. 로컬 Python 환경 없이 원시 HTML 문자열을 구문 분석하고, 태그, 속성 및 텍스트 콘텐츠를 추출하고, 문서 구조를 탐색할 수 있습니다. 웹 스크래핑 개념을 안전하게 학습할 수 있는 훌륭한 도구입니다.
코드 및 실행 출력
HTML 문서에서 데이터를 탐색하고 추출합니다.
HTML Parsing with BeautifulSoup에디터에서 실행
from bs4 import BeautifulSoup
html_doc = """
<html>
<head><title>Sample Page</title></head>
<body>
<h1>Article List</h1>
<ul>
<li><a href="/post/1" class="post">Intro to Python</a></li>
<li><a href="/post/2" class="post">NumPy Basics</a></li>
<li><a href="/post/3" class="post">Pandas Guide</a></li>
</ul>
<p class="footer">© 2025 PyRun</p>
</body>
</html>
"""
soup = BeautifulSoup(html_doc, 'html.parser')
print("Title:", soup.title.string)
print("H1:", soup.h1.string)
print("\nLinks:")
for a in soup.find_all('a', class_='post'):
print(f" {a.string} → {a['href']}")관련 패키지
권장 Python 리소스
관련 대화형 튜토리얼, 치트 시트, 코드 비교를 통해 지식을 확장하세요.
파이썬 튜토리얼
Python 루프
Python 루프를 사용하여 데이터를 반복하는 방법을 알아보세요. 대화형 예제를 통해 for 루프, while 루프, 중단, 계속 및 루프 모범 사례를 마스터하세요.
리소스 보기
사용법 가이드
Python에서 목록을 정렬하는 방법(오름차순 및 내림차순)
sort() 메서드와 sorted() 함수를 사용하여 Python에서 목록을 정렬하는 방법을 알아보세요. 사용자 정의 키 정렬 및 역순 예시를 살펴보세요.
리소스 보기
치트 시트
Python 문자열 메서드 치트 시트
Python 문자열 조작에 대한 완전한 참조 가이드입니다. 문자열 속성의 서식 지정, 검색, 분할, 바꾸기 및 확인을 마스터합니다.
리소스 보기
언어 비교
Python 대 JavaScript: 어떤 프로그래밍 언어가 가장 좋나요?
Python과 JavaScript를 포괄적으로 비교합니다. 구문 차이점, 성능, 사용 사례(백엔드와 프런트엔드) 및 코딩 예제를 살펴보세요.
리소스 보기