PythonPandasШпаргалка по анализу данных
Справочное руководство для серийPandasи DataFrames. Изучите загрузку, очистку, выбор, группировку и агрегирование данных.
Загрузка данных и первоначальная проверка
Операции по загрузке наборов данных и проверке их структурных очертаний.
| Метод/Функция | Синтаксис | Описание |
|---|---|---|
| pd.DataFrame() | pd.DataFrame(data, columns=...) | Создает двумерную помеченную структуру данных со столбцами. |
| pd.read_csv() | pd.read_csv(filepath) | Загружает файл CSV вPandasDataFrame. |
| head() / tail() | df.head(n=5) / df.tail(n=5) | Возвращает первые n или последние n строк DataFrame. |
| info() | df.info() | Печатает краткую сводку столбцов DataFrame, ненулевых значений и использования памяти. |
| describe() | df.describe() | Формирует описательную статистику, обобщающую центральную тенденцию, дисперсию и форму. |
Выбор, фильтрация и очистка данных
Методы разделения столбцов/строк, агрегирования данных и устранения отсутствующих записей.
| Метод/Функция | Синтаксис | Описание |
|---|---|---|
| loc[] | df.loc[row_label, col_label] | Доступ к группе строк и столбцов по меткам. |
| iloc[] | df.iloc[row_pos, col_pos] | Получает доступ к группе строк и столбцов по позициям целочисленного индекса. |
| groupby() | df.groupby(col).mean() | Группирует строки, имеющие общие значения столбцов, и объединяет числовые поля. |
| value_counts() | df[col].value_counts() | Возвращает серию, содержащую количество уникальных значений в столбце. |
| dropna() | df.dropna(axis=0) | Удаляет строки (или столбцы), содержащие пропущенные или нулевые значения. |
| fillna() | df.fillna(value) | Заполняет пропущенные значения указанным значением или стратегией. |
Интерактивный демонстрационный сценарий
# pd.DataFrame()
pd.DataFrame(data, columns=...)
# pd.read_csv()
pd.read_csv(filepath)
# head() / tail()
df.head(n=5) / df.tail(n=5)
# info()
df.info()
# describe()
df.describe()
# loc[]
df.loc[row_label, col_label]
# iloc[]
df.iloc[row_pos, col_pos]
# groupby()
df.groupby(col).mean()
# value_counts()
df[col].value_counts()
# dropna()
df.dropna(axis=0)
# fillna()
df.fillna(value)Часто задаваемые вопросы
В чем разница между loc и iloc?
loc — индексация на основе меток (выбирает данные по именам строк/столбцов), тогда как iloc — индексация на основе целых чисел (выбирает данные по позиции индекса).
Как вы обрабатываете пропущенные значения вPandas?
Используйте dropna() для удаления строк/столбцов с нулевыми значениями или используйте fillna(value) для замены нулевых значений определенным значением по умолчанию.
Связанные темы
Краткое справочное руководство по массивамNumPy. Изучите создание массивов, изменение формы, индексацию, нарезку и математические операции.
Памятка по коллекциям и структурам данных PythonПолное руководство по модулю коллекций Python и собственным структурам данных. Изучите списки, словари, наборы, кортежи, деки и именованные кортежи.
Шпаргалка по встроенным функциям PythonСправочное руководство по встроенным функциям Python. Узнайте, как использовать print, len, range, enumerate, zip, map, filter и многое другое.
Рекомендуемые ресурсы Python
Расширьте свои знания с помощью соответствующих интерактивных руководств, шпаргалок и сравнений кода.
Циклы Python
Узнайте, как использовать циклы Python для перебора данных. Освойте циклы for, while, прерывание, продолжение и лучшие практики работы с циклами с помощью интерактивных примеров.
Как отсортировать список в Python
Узнайте, как сортировать список в Python с помощью метода sort() и функции sorted(). Ознакомьтесь с примерами пользовательской сортировки ключей и обратного порядка.
Python против JavaScript: какой язык программирования лучше?
Всестороннее сравнение Python и JavaScript. Изучите синтаксические различия, производительность, варианты использования (серверная и клиентская части) и примеры кодирования.