(data)praktycznie i bez chaosu · workflow każdego projektu — od pliku do wniosków
01 Wczytywanie · 02 Inicjalna analiza · 03 Czyszczenie i przygotowanie · 04 Eksploracja (EDA)
import pandas as pd
import numpy as np
df = pd.read_csv("dane.csv") # CSV
df = pd.read_csv("dane.csv", sep=";", decimal=",") # europejski format
df = pd.read_excel("dane.xlsx", sheet_name=0) # Excel
df = pd.read_parquet("dane.parquet") # szybki format kolumnowy
df = pd.read_json("dane.json") # JSON
pd.read_csv("dane.csv",
usecols=["a", "b"], # tylko wybrane kolumny
nrows=1000, # tylko N pierwszych wierszy (podgląd)
parse_dates=["data"], # od razu parsuj daty
dtype={"id": str}) # wymuś typy
df.shape # liczba wierszy i kolumn
df.columns # nazwy kolumn
df.dtypes # typy danych kolumn
df.info() # typy + non-null + pamięć (najważniejsze!)
df.memory_usage(deep=True) # zużycie pamięci per kolumna
df.head() # pierwsze 5 wierszy
df.tail() # ostatnie 5 wierszy
df.sample(5) # losowe 5 — lepsze niż head przy danych posortowanych
df.isna().sum() # liczba braków w każdej kolumnie
df.isna().mean() # udział braków (× 100 dla procentów)
df[df.isna().any(axis=1)] # wiersze z jakimkolwiek brakiem
df.isna().sum().sum() # łączna liczba braków
df.duplicated().sum() # liczba zduplikowanych wierszy
df[df.duplicated()] # podgląd duplikatów
df.duplicated(subset=["kol1", "kol2"]) # duplikaty po wybranych kolumnach