PythonPandas数据分析备忘单

Pandas系列和数据帧的参考指南。学习数据加载、清理、选择、分组和聚合。

加载数据和初步检查

加载数据集并检查其结构轮廓的操作。

方法/功能语法描述
pd.DataFrame()pd.DataFrame(data, columns=...)使用列构造二维标记数据结构。
pd.read_csv()pd.read_csv(filepath)将 CSV 文件加载到PandasDataFrame 中。
head() / tail()df.head(n=5) / df.tail(n=5)返回 DataFrame 的前 n 或后 n 行。
info()df.info()打印 DataFrame 列、非空计数和内存使用情况的简明摘要。
describe()df.describe()生成总结集中趋势、离散度和形状的描述性统计数据。

数据选择、过滤和清理

对列/行进行切片、聚合数据和解决丢失记录的方法。

方法/功能语法描述
loc[]df.loc[row_label, col_label]通过标签访问一组行和列。
iloc[]df.iloc[row_pos, col_pos]通过整数索引位置访问一组行和列。
groupby()df.groupby(col).mean()对共享 col 值的行进行分组并聚合数字字段。
value_counts()df[col].value_counts()返回包含 col 中唯一值计数的 Series。
dropna()df.dropna(axis=0)删除包含缺失值或空值的行(或列)。
fillna()df.fillna(value)使用指定值或策略填充缺失值。

交互式演示脚本

run_all_cheat_methods.py
在编辑器中运行
# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

常见问题解答

loc 和 iloc 有什么区别?

loc 是基于标签的索引(按行/列名称选择数据),而 iloc 是基于整数的索引(按索引位置选择数据)。

如何处理Pandas中的缺失值?

使用 dropna() 删除具有空值的行/列,或使用 fillna(value) 将空值替换为特定的默认值。

相关主题

推荐的 Python 资源

通过相关的交互式教程、备忘单和代码比较来扩展您的知识。