PythonPandas데이터 분석 치트 시트

Pandas시리즈 및 DataFrames에 대한 참조 가이드입니다. 데이터 로드, 정리, 선택, 그룹화 및 집계에 대해 알아보세요.

데이터 로딩 및 초기 검사

데이터세트를 로드하고 구조적 개요를 검사하는 작업입니다.

방법/기능구문설명
pd.DataFrame()pd.DataFrame(data, columns=...)열을 사용하여 레이블이 지정된 2차원 데이터 구조를 구성합니다.
pd.read_csv()pd.read_csv(filepath)CSV 파일을PandasDataFrame에 로드합니다.
head() / tail()df.head(n=5) / df.tail(n=5)DataFrame의 처음 n개 또는 마지막 n개 행을 반환합니다.
info()df.info()DataFrame 열, Null이 아닌 개수 및 메모리 사용량에 대한 간결한 요약을 인쇄합니다.
describe()df.describe()중심 경향, 분산 및 형태를 요약하는 기술 통계를 생성합니다.

데이터 선택, 필터링 및 정리

열/행을 분할하고, 데이터를 집계하고, 누락된 레코드를 해결하는 방법입니다.

방법/기능구문설명
loc[]df.loc[row_label, col_label]레이블별로 행과 열 그룹에 액세스합니다.
iloc[]df.iloc[row_pos, col_pos]정수 인덱스 위치로 행과 열 그룹에 액세스합니다.
groupby()df.groupby(col).mean()col 값을 공유하는 행을 그룹화하고 숫자 필드를 집계합니다.
value_counts()df[col].value_counts()열의 고유 값 개수를 포함하는 시리즈를 반환합니다.
dropna()df.dropna(axis=0)누락된 값이나 Null 값이 포함된 행(또는 열)을 제거합니다.
fillna()df.fillna(value)누락된 값을 지정된 값이나 전략으로 채웁니다.

대화형 데모 스크립트

run_all_cheat_methods.py
에디터에서 실행
# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

자주 묻는 질문

loc과 iloc의 차이점은 무엇입니까?

loc는 레이블 기반 인덱싱(행/열 이름으로 데이터 선택)인 반면 iloc는 정수 기반 인덱싱(인덱스 위치로 데이터 선택)입니다.

Pandas에서 누락된 값을 어떻게 처리합니까?

null 값이 있는 행/열을 제거하려면 dropna()를 사용하고, null 값을 특정 기본값으로 바꾸려면 fillna(value)를 사용하세요.

관련 주제

권장 Python 리소스

관련 대화형 튜토리얼, 치트 시트, 코드 비교를 통해 지식을 확장하세요.