PythonPandasデータ分析チートシート

Pandasシリーズと DataFrame のリファレンス ガイド。データのロード、クリーニング、選択、グループ化、集計について学びます。

データの読み込みと初期検査

データセットをロードし、その構造アウトラインを検査する操作。

メソッド・機能構文説明
pd.DataFrame()pd.DataFrame(data, columns=...)列を含む 2 次元のラベル付きデータ構造を構築します。
pd.read_csv()pd.read_csv(filepath)CSV ファイルをPandasデータフレームにロードします。
head() / tail()df.head(n=5) / df.tail(n=5)DataFrame の最初の n 行または最後の n 行を返します。
info()df.info()DataFrame 列、NULL 以外の数、およびメモリ使用量の簡潔な概要を出力します。
describe()df.describe()中心の傾向、分散、形状を要約した記述統計を生成します。

データの選択、フィルタリング、クリーニング

列/行をスライスし、データを集約し、欠落しているレコードを解決するメソッド。

メソッド・機能構文説明
loc[]df.loc[row_label, col_label]ラベルによって行と列のグループにアクセスします。
iloc[]df.iloc[row_pos, col_pos]整数のインデックス位置によって行と列のグループにアクセスします。
groupby()df.groupby(col).mean()列値を共有する行をグループ化し、数値フィールドを集計します。
value_counts()df[col].value_counts()列内の一意の値の数を含む Series を返します。
dropna()df.dropna(axis=0)欠損値または null 値を含む行 (または列) を削除します。
fillna()df.fillna(value)欠損値を指定された値または戦略で埋めます。

インタラクティブなデモスクリプト

run_all_cheat_methods.py
エディターで実行
# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

よくある質問

loc と iloc はどう違いますか?

loc はラベルベースのインデックス付け (行/列名によってデータを選択) ですが、 iloc は整数ベースのインデックス付け (インデックス位置によってデータを選択) です。

Pandasの欠損値をどのように処理しますか?

null 値を含む行/列を削除するには、dropna() を使用します。または、null 値を特定のデフォルト値に置き換えるには、fillna(value) を使用します。

関連トピック

推奨される Python リソース

関連するインタラクティブなチュートリアル、チートシート、コード比較で知識を深めてください。