PythonPandasŚciągawka do analizy danych

Przewodnik referencyjny dla seriiPandasi ramek DataFrame. Dowiedz się, jak ładować, czyścić, wybierać, grupować i agregować dane.

Ładowanie danych i wstępna kontrola

Operacje ładowania zbiorów danych i sprawdzania ich konturów strukturalnych.

Metoda / FunkcjaSkładniaOpis
pd.DataFrame()pd.DataFrame(data, columns=...)Konstruuje dwuwymiarową oznaczoną strukturę danych z kolumnami.
pd.read_csv()pd.read_csv(filepath)Ładuje plik CSV do ramki danychPandas.
head() / tail()df.head(n=5) / df.tail(n=5)Zwraca pierwsze n lub ostatnie n wierszy ramki DataFrame.
info()df.info()Drukuje zwięzłe podsumowanie kolumn DataFrame, liczników innych niż null i użycia pamięci.
describe()df.describe()Generuje statystyki opisowe podsumowujące tendencję centralną, rozproszenie i kształt.

Wybór danych, filtrowanie i czyszczenie

Metody dzielenia kolumn/wierszy, agregowania danych i rozwiązywania brakujących rekordów.

Metoda / FunkcjaSkładniaOpis
loc[]df.loc[row_label, col_label]Dostęp do grupy wierszy i kolumn według etykiet.
iloc[]df.iloc[row_pos, col_pos]Dostęp do grupy wierszy i kolumn według pozycji indeksu w postaci liczb całkowitych.
groupby()df.groupby(col).mean()Grupuje wiersze o wspólnych wartościach col i agreguje pola liczbowe.
value_counts()df[col].value_counts()Zwraca serię zawierającą liczbę unikalnych wartości w kol.
dropna()df.dropna(axis=0)Usuwa wiersze (lub kolumny) zawierające wartości brakujące lub null.
fillna()df.fillna(value)Wypełnia brakujące wartości określoną wartością lub strategią.

Interaktywny skrypt demonstracyjny

run_all_cheat_methods.py
Uruchom w Edytorze
# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

Często zadawane pytania

Jaka jest różnica między loci iloc?

loc to indeksowanie oparte na etykietach (wybiera dane według nazw wierszy/kolumn), podczas gdy iloc to indeksowanie oparte na liczbach całkowitych (wybiera dane według pozycji indeksu).

Jak sobie radzisz z brakującymi wartościami wPandas?

Użyj dropna(), aby usunąć wiersze/kolumny z wartościami null, lub użyj fillna(value), aby zastąpić wartości null określoną wartością domyślną.

Powiązane tematy

Polecane zasoby Pythona

Poszerzaj swoją wiedzę dzięki powiązanym interaktywnym samouczkom, ściągawkom i porównaniom kodów.