(data)praktycznie i bez chaosu · workflow każdego projektu — od pliku do wniosków

01 Wczytywanie · 02 Inicjalna analiza · 03 Czyszczenie i przygotowanie · 04 Eksploracja (EDA)


01 · Wczytywanie danych

Import bibliotek

import pandas as pd
import numpy as np

Wczytanie pliku

df = pd.read_csv("dane.csv")                        # CSV
df = pd.read_csv("dane.csv", sep=";", decimal=",")  # europejski format
df = pd.read_excel("dane.xlsx", sheet_name=0)        # Excel
df = pd.read_parquet("dane.parquet")                 # szybki format kolumnowy
df = pd.read_json("dane.json")                       # JSON

Przydatne argumenty read_csv

pd.read_csv("dane.csv",
    usecols=["a", "b"],      # tylko wybrane kolumny
    nrows=1000,              # tylko N pierwszych wierszy (podgląd)
    parse_dates=["data"],    # od razu parsuj daty
    dtype={"id": str})       # wymuś typy

02 · Inicjalna analiza danych

Podstawowe informacje

df.shape                     # liczba wierszy i kolumn
df.columns                   # nazwy kolumn
df.dtypes                    # typy danych kolumn
df.info()                    # typy + non-null + pamięć (najważniejsze!)
df.memory_usage(deep=True)   # zużycie pamięci per kolumna

Podgląd wartości

df.head()      # pierwsze 5 wierszy
df.tail()      # ostatnie 5 wierszy
df.sample(5)   # losowe 5 — lepsze niż head przy danych posortowanych

Braki danych

df.isna().sum()              # liczba braków w każdej kolumnie
df.isna().mean()             # udział braków (× 100 dla procentów)
df[df.isna().any(axis=1)]    # wiersze z jakimkolwiek brakiem
df.isna().sum().sum()        # łączna liczba braków

Duplikaty

df.duplicated().sum()                   # liczba zduplikowanych wierszy
df[df.duplicated()]                     # podgląd duplikatów
df.duplicated(subset=["kol1", "kol2"])  # duplikaty po wybranych kolumnach