PythonPandas数据分析备忘单
Pandas系列和数据帧的参考指南。学习数据加载、清理、选择、分组和聚合。
加载数据和初步检查
加载数据集并检查其结构轮廓的操作。
| 方法/功能 | 语法 | 描述 |
|---|---|---|
| pd.DataFrame() | pd.DataFrame(data, columns=...) | 使用列构造二维标记数据结构。 |
| pd.read_csv() | pd.read_csv(filepath) | 将 CSV 文件加载到PandasDataFrame 中。 |
| head() / tail() | df.head(n=5) / df.tail(n=5) | 返回 DataFrame 的前 n 或后 n 行。 |
| info() | df.info() | 打印 DataFrame 列、非空计数和内存使用情况的简明摘要。 |
| describe() | df.describe() | 生成总结集中趋势、离散度和形状的描述性统计数据。 |
数据选择、过滤和清理
对列/行进行切片、聚合数据和解决丢失记录的方法。
| 方法/功能 | 语法 | 描述 |
|---|---|---|
| loc[] | df.loc[row_label, col_label] | 通过标签访问一组行和列。 |
| iloc[] | df.iloc[row_pos, col_pos] | 通过整数索引位置访问一组行和列。 |
| groupby() | df.groupby(col).mean() | 对共享 col 值的行进行分组并聚合数字字段。 |
| value_counts() | df[col].value_counts() | 返回包含 col 中唯一值计数的 Series。 |
| dropna() | df.dropna(axis=0) | 删除包含缺失值或空值的行(或列)。 |
| fillna() | df.fillna(value) | 使用指定值或策略填充缺失值。 |
交互式演示脚本
run_all_cheat_methods.py
在编辑器中运行# pd.DataFrame()
pd.DataFrame(data, columns=...)
# pd.read_csv()
pd.read_csv(filepath)
# head() / tail()
df.head(n=5) / df.tail(n=5)
# info()
df.info()
# describe()
df.describe()
# loc[]
df.loc[row_label, col_label]
# iloc[]
df.iloc[row_pos, col_pos]
# groupby()
df.groupby(col).mean()
# value_counts()
df[col].value_counts()
# dropna()
df.dropna(axis=0)
# fillna()
df.fillna(value)常见问题解答
loc 和 iloc 有什么区别?
loc 是基于标签的索引(按行/列名称选择数据),而 iloc 是基于整数的索引(按索引位置选择数据)。
如何处理Pandas中的缺失值?
使用 dropna() 删除具有空值的行/列,或使用 fillna(value) 将空值替换为特定的默认值。
相关主题
推荐的 Python 资源
通过相关的交互式教程、备忘单和代码比较来扩展您的知识。