Folha de referências de análise de dados PythonPandas

Guia de referência para sériesPandase DataFrames. Aprenda carregamento, limpeza, seleção, agrupamento e agregações de dados.

Carregando dados e inspeção inicial

Operações para carregar conjuntos de dados e inspecionar seus contornos estruturais.

Método/FunçãoSintaxeDescrição
pd.DataFrame()pd.DataFrame(data, columns=...)Constrói uma estrutura de dados rotulada bidimensional com colunas.
pd.read_csv()pd.read_csv(filepath)Carrega um arquivo CSV em um DataFramePandas.
head() / tail()df.head(n=5) / df.tail(n=5)Retorna as primeiras n ou últimas n linhas do DataFrame.
info()df.info()Imprime um resumo conciso das colunas DataFrame, contagens não nulas e uso de memória.
describe()df.describe()Gera estatísticas descritivas resumindo tendência central, dispersão e forma.

Seleção, filtragem e limpeza de dados

Métodos para dividir colunas/linhas, agregar dados e resolver registros ausentes.

Método/FunçãoSintaxeDescrição
loc[]df.loc[row_label, col_label]Acessa um grupo de linhas e colunas por rótulos.
iloc[]df.iloc[row_pos, col_pos]Acessa um grupo de linhas e colunas por posições de índice inteiro.
groupby()df.groupby(col).mean()Agrupa linhas que compartilham valores de colunas e agrega campos numéricos.
value_counts()df[col].value_counts()Retorna uma série contendo contagens de valores exclusivos na col.
dropna()df.dropna(axis=0)Remove linhas (ou colunas) que contêm valores nulos ou ausentes.
fillna()df.fillna(value)Preenche valores ausentes com um valor ou estratégia especificada.

Script de demonstração interativo

run_all_cheat_methods.py
Executar no Editor
# pd.DataFrame()
pd.DataFrame(data, columns=...)

# pd.read_csv()
pd.read_csv(filepath)

# head() / tail()
df.head(n=5) / df.tail(n=5)

# info()
df.info()

# describe()
df.describe()

# loc[]
df.loc[row_label, col_label]

# iloc[]
df.iloc[row_pos, col_pos]

# groupby()
df.groupby(col).mean()

# value_counts()
df[col].value_counts()

# dropna()
df.dropna(axis=0)

# fillna()
df.fillna(value)

Perguntas frequentes

Qual é a diferença entre loc e iloc?

loc é uma indexação baseada em rótulo (seleciona dados por nomes de linha/coluna), enquanto iloc é uma indexação baseada em números inteiros (seleciona dados por posição de índice).

Como você lida com valores ausentes emPandas?

Use dropna() para remover linhas/colunas com valores nulos ou use fillna(value) para substituir valores nulos por um valor padrão específico.

Tópicos Relacionados

Recursos Python recomendados

Expanda seu conhecimento com tutoriais interativos relacionados, folhas de dicas e comparações de código.