Bảng tóm tắt phân tích dữ liệu PythonPandas

Hướng dẫn tham khảo về chuỗiPandasvà DataFrames. Tìm hiểu cách tải, làm sạch, lựa chọn, nhóm và tổng hợp dữ liệu.

Đang tải dữ liệu và kiểm tra ban đầu

Các hoạt động để tải tập dữ liệu và kiểm tra phác thảo cấu trúc của chúng.

Phương thức/Chức năngCú phápMô tả
pd.DataFrame()pd.DataFrame(data, columns=...)Xây dựng cấu trúc dữ liệu được gắn nhãn hai chiều với các cột.
pd.read_csv()pd.read_csv(filepath)Tải tệp CSV vào Khung dữ liệuPandas.
head() / tail()df.head(n=5) / df.tail(n=5)Trả về n hàng đầu tiên hoặc n hàng cuối cùng của DataFrame.
info()df.info()In bản tóm tắt ngắn gọn về các cột DataFrame, số lượng không rỗng và mức sử dụng bộ nhớ.
describe()df.describe()Tạo số liệu thống kê mô tả tóm tắt xu hướng trung tâm, độ phân tán và hình dạng.

Lựa chọn, lọc và làm sạch dữ liệu

Các phương pháp cắt cột/hàng, tổng hợp dữ liệu và giải quyết các bản ghi bị thiếu.

Phương thức/Chức năngCú phápMô tả
loc[]df.loc[row_label, col_label]Truy cập một nhóm hàng và cột theo nhãn.
iloc[]df.iloc[row_pos, col_pos]Truy cập một nhóm hàng và cột theo vị trí chỉ số nguyên.
groupby()df.groupby(col).mean()Nhóm các hàng chia sẻ giá trị col và tổng hợp các trường số.
value_counts()df[col].value_counts()Trả về một Chuỗi chứa số lượng giá trị duy nhất trong col.
dropna()df.dropna(axis=0)Xóa các hàng (hoặc cột) chứa giá trị bị thiếu hoặc null.
fillna()df.fillna(value)Điền vào các giá trị còn thiếu bằng một giá trị hoặc chiến lược được chỉ định.

Tập lệnh demo tương tác

run_all_cheat_methods.py
Chạy trong Trình chỉnh sửa
# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

Câu hỏi thường gặp

Đâu là sự khác biệt giữa locvà iloc?

loc là lập chỉ mục dựa trên nhãn (chọn dữ liệu theo tên hàng/cột), trong khi iloc là lập chỉ mục dựa trên số nguyên (chọn dữ liệu theo vị trí chỉ mục).

Bạn xử lý các giá trị bị thiếu trongPandasnhư thế nào?

Sử dụng dropna() để xóa các hàng/cột có giá trị null hoặc sử dụng fillna(value) để thay thế giá trị null bằng một giá trị mặc định cụ thể.

Chủ đề liên quan

Tài nguyên Python được đề xuất

Mở rộng kiến thức của bạn với các hướng dẫn tương tác, bảng ghi chú và so sánh mã có liên quan.