PythonPandas資料分析備忘單

Pandas系列和資料幀的參考指南。學習資料載入、清理、選擇、分組和聚合。

加載數據和初步檢查

載入資料集並檢查其結構輪廓的操作。

方法/功能文法描述
pd.DataFrame()pd.DataFrame(data, columns=...)使用列構造二維標記資料結構。
pd.read_csv()pd.read_csv(filepath)將 CSV 檔案載入到PandasDataFrame 中。
head() / tail()df.head(n=5) / df.tail(n=5)傳回 DataFrame 的前 n 或後 n 行。
info()df.info()列印 DataFrame 欄位、非空計數和記憶體使用情況的簡明摘要。
describe()df.describe()產生總結集中趨勢、離散度和形狀的描述性統計。

資料選擇、過濾和清理

對列/行進行切片、聚合資料和解決遺失記錄的方法。

方法/功能文法描述
loc[]df.loc[row_label, col_label]透過標籤存取一組行和列。
iloc[]df.iloc[row_pos, col_pos]透過整數索引位置存取一組行和列。
groupby()df.groupby(col).mean()對共享 col 值的行進行分組並聚合數字欄位。
value_counts()df[col].value_counts()傳回包含 col 中唯一值計數的 Series。
dropna()df.dropna(axis=0)刪除包含缺失值或空值的行(或列)。
fillna()df.fillna(value)使用指定值或策略填入缺失值。

互動式簡報腳本

run_all_cheat_methods.py
在編輯器中執行
# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

常見問題解答

loc 和 iloc 有什麼差別?

loc 是基於標籤的索引(按行/列名稱選擇資料),而 iloc 是基於整數的索引(按索引位置選擇資料)。

如何處理Pandas中的缺失值?

使用 dropna() 刪除具有空值的行/列,或使用 fillna(value) 將空值替換為特定的預設值。

相關主題

推薦的 Python 資源

透過相關的互動式教學、備忘單和程式碼比較來擴展您的知識。