PythonPandasAide-mémoire pour l'analyse des données

Guide de référence pour les sériesPandaset DataFrames. Apprenez le chargement, le nettoyage, la sélection, le regroupement et les agrégations de données.

Chargement des données et inspection initiale

Opérations pour charger des ensembles de données et inspecter leurs contours structurels.

Méthode / FonctionSyntaxeDescriptif
pd.DataFrame()pd.DataFrame(data, columns=...)Construit une structure de données étiquetée en deux dimensions avec des colonnes.
pd.read_csv()pd.read_csv(filepath)Charge un fichier CSV dans un DataFramePandas.
head() / tail()df.head(n=5) / df.tail(n=5)Renvoie les n premières ou les n dernières lignes du DataFrame.
info()df.info()Imprime un résumé concis des colonnes DataFrame, des décomptes non nuls et de l'utilisation de la mémoire.
describe()df.describe()Génère des statistiques descriptives résumant la tendance centrale, la dispersion et la forme.

Sélection, filtrage et nettoyage des données

Méthodes pour découper les colonnes/lignes, agréger les données et résoudre les enregistrements manquants.

Méthode / FonctionSyntaxeDescriptif
loc[]df.loc[row_label, col_label]Accède à un groupe de lignes et de colonnes par étiquettes.
iloc[]df.iloc[row_pos, col_pos]Accède à un groupe de lignes et de colonnes par positions d’index entier.
groupby()df.groupby(col).mean()Regroupe les lignes partageant des valeurs de colonne et agrège les champs numériques.
value_counts()df[col].value_counts()Renvoie une série contenant le nombre de valeurs uniques dans la colonne.
dropna()df.dropna(axis=0)Supprime les lignes (ou colonnes) qui contiennent des valeurs manquantes ou nulles.
fillna()df.fillna(value)Remplit les valeurs manquantes avec une valeur ou une stratégie spécifiée.

Script de démonstration interactif

run_all_cheat_methods.py
Exécuter dans l'éditeur
# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

Foire aux questions

Quelle est la différence entre loc et iloc ?

loc est une indexation basée sur des étiquettes (sélectionne les données par noms de ligne/colonne), tandis qu'iloc est une indexation basée sur des entiers (sélectionne les données par position d'index).

Comment gérez-vous les valeurs manquantes dansPandas?

Utilisez dropna() pour supprimer les lignes/colonnes avec des valeurs nulles, ou utilisez fillna(value) pour remplacer les valeurs nulles par une valeur par défaut spécifique.

Sujets connexes

Ressources Python recommandées

Développez vos connaissances avec des didacticiels interactifs, des aide-mémoire et des comparaisons de codes associés.