PythonPandasSpickzettel zur Datenanalyse

Referenzhandbuch fürPandasSerien und DataFrames. Lernen Sie das Laden, Bereinigen, Auswählen, Gruppieren und Aggregieren von Daten.

Laden von Daten und Erstinspektion

Vorgänge zum Laden von Datensätzen und Überprüfen ihrer Strukturumrisse.

Methode / FunktionSyntaxBeschreibung
pd.DataFrame()pd.DataFrame(data, columns=...)Konstruiert eine zweidimensionale beschriftete Datenstruktur mit Spalten.
pd.read_csv()pd.read_csv(filepath)Lädt eine CSV-Datei in einenPandasDataFrame.
head() / tail()df.head(n=5) / df.tail(n=5)Gibt die ersten n oder letzten n Zeilen des DataFrame zurück.
info()df.info()Druckt eine kurze Zusammenfassung der DataFrame-Spalten, der Nicht-Null-Zählungen und der Speichernutzung.
describe()df.describe()Erstellt deskriptive Statistiken, die die zentrale Tendenz, Streuung und Form zusammenfassen.

Datenauswahl, Filterung und Reinigung

Methoden zum Aufteilen von Spalten/Zeilen, zum Aggregieren von Daten und zum Auflösen fehlender Datensätze.

Methode / FunktionSyntaxBeschreibung
loc[]df.loc[row_label, col_label]Greift über Beschriftungen auf eine Gruppe von Zeilen und Spalten zu.
iloc[]df.iloc[row_pos, col_pos]Greift über ganzzahlige Indexpositionen auf eine Gruppe von Zeilen und Spalten zu.
groupby()df.groupby(col).mean()Gruppiert Zeilen mit gemeinsamen Spaltenwerten und aggregiert numerische Felder.
value_counts()df[col].value_counts()Gibt eine Reihe zurück, die die Anzahl der eindeutigen Werte in der Spalte enthält.
dropna()df.dropna(axis=0)Entfernt Zeilen (oder Spalten), die fehlende oder Nullwerte enthalten.
fillna()df.fillna(value)Füllt fehlende Werte mit einem angegebenen Wert oder einer angegebenen Strategie.

Interaktives Demo-Skript

run_all_cheat_methods.py
Im Editor ausführen
# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

Häufig gestellte Fragen

Was ist der Unterschied zwischen loc und iloc?

loc ist eine labelbasierte Indizierung (wählt Daten nach Zeilen-/Spaltennamen aus), während iloc eine ganzzahlbasierte Indizierung ist (wählt Daten nach Indexposition aus).

Wie gehen Sie mit fehlenden Werten inPandasum?

Verwenden Sie dropna(), um Zeilen/Spalten mit Nullwerten zu entfernen, oder verwenden Sie fillna(value), um Nullwerte durch einen bestimmten Standardwert zu ersetzen.

Verwandte Themen

Empfohlene Python-Ressourcen

Erweitern Sie Ihr Wissen mit zugehörigen interaktiven Tutorials, Spickzetteln und Codevergleichen.