PythonPandasШпаргалка по анализу данных

Справочное руководство для серийPandasи DataFrames. Изучите загрузку, очистку, выбор, группировку и агрегирование данных.

Загрузка данных и первоначальная проверка

Операции по загрузке наборов данных и проверке их структурных очертаний.

Метод/ФункцияСинтаксисОписание
pd.DataFrame()pd.DataFrame(data, columns=...)Создает двумерную помеченную структуру данных со столбцами.
pd.read_csv()pd.read_csv(filepath)Загружает файл CSV вPandasDataFrame.
head() / tail()df.head(n=5) / df.tail(n=5)Возвращает первые n или последние n строк DataFrame.
info()df.info()Печатает краткую сводку столбцов DataFrame, ненулевых значений и использования памяти.
describe()df.describe()Формирует описательную статистику, обобщающую центральную тенденцию, дисперсию и форму.

Выбор, фильтрация и очистка данных

Методы разделения столбцов/строк, агрегирования данных и устранения отсутствующих записей.

Метод/ФункцияСинтаксисОписание
loc[]df.loc[row_label, col_label]Доступ к группе строк и столбцов по меткам.
iloc[]df.iloc[row_pos, col_pos]Получает доступ к группе строк и столбцов по позициям целочисленного индекса.
groupby()df.groupby(col).mean()Группирует строки, имеющие общие значения столбцов, и объединяет числовые поля.
value_counts()df[col].value_counts()Возвращает серию, содержащую количество уникальных значений в столбце.
dropna()df.dropna(axis=0)Удаляет строки (или столбцы), содержащие пропущенные или нулевые значения.
fillna()df.fillna(value)Заполняет пропущенные значения указанным значением или стратегией.

Интерактивный демонстрационный сценарий

# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

Часто задаваемые вопросы

В чем разница между loc и iloc?

loc — индексация на основе меток (выбирает данные по именам строк/столбцов), тогда как iloc — индексация на основе целых чисел (выбирает данные по позиции индекса).

Как вы обрабатываете пропущенные значения вPandas?

Используйте dropna() для удаления строк/столбцов с нулевыми значениями или используйте fillna(value) для замены нулевых значений определенным значением по умолчанию.

Связанные темы

Рекомендуемые ресурсы Python

Расширьте свои знания с помощью соответствующих интерактивных руководств, шпаргалок и сравнений кода.