01-10-2025 11 minut Kreditní riziko
Secsmo - metodika kurzu

Gradientní boosting pro kreditní skórování

Regresní modely patří k nejpoužívanějším nástrojům kvantitativní analýzy ve financích. Tento kurz propojuje statistickou teorii s praktickými aplikacemi v prostředí reálných tržních dat.

8 týdnů 11 minut
Gradientní boosting pro kreditní skórování
Cena kurzu 7800 Kč* Model slouží výhradně pro vzdělávací demonstraci, nikoli pro reálné úvěrové rozhodování.
Kompletní metodika s notebooky, daty a šablonou validačního reportu Přihlásit se ke kurzu
Struktura programu

Průběh a obsah výuky

01

Kroky metodiky

  1. Analýza a čištění dat
    Průzkumná analýza, detekce úniku informací, ošetření chybějících hodnot.
  2. Feature engineering
    Tvorba odvozených proměnných, WoE transformace pro kategorické příznaky.
  3. Trénování modelu
    XGBoost s Bayesovskou optimalizací hyperparametrů.
  4. Kalibraci pravděpodobností
    Plattovo škálování pro správnou interpretaci výstupních pravděpodobností.
  5. Interpretace
    SHAP analýza na úrovni celého modelu i jednotlivých žadatelů.
  6. Validace a monitoring
    Out-of-time testování, PSI statistika pro sledování stability modelu v čase.
Podrobný popis

O čem tento kurz skutečně je

Kreditní skórování rozhoduje o tom, zda banka nebo nebankovní instituce poskytne úvěr. Tradičně se používaly logistická regrese a scorecardové modely. Gradientní boosting, konkrétně XGBoost nebo LightGBM, dosahuje na stejných datech nižší chybovosti.

Specifika finančních dat pro skórování

Data pro kreditní modely jsou silně nevyvážená. Podíl nesplácejících klientů se pohybuje typicky mezi 2 a 8 procenty. Metodika zahrnuje techniky převzorkování a úpravu prahové hodnoty klasifikace.

Dalším problémem je informační únik. Proměnné jako výše splátky nebo zůstatek po splatnosti jsou dostupné až po poskytnutí úvěru. Metodika detailně popisuje, jak tyto proměnné správně vyloučit z trénovací sady.

Interpretace modelu

SHAP hodnoty umožňují vysvětlit, proč model přiřadil konkrétnímu žadateli dané skóre. To je požadavek regulátorů v zemích EU, kde musí instituce umět vysvětlit automatizovaná rozhodnutí. Metodika zahrnuje generování individuálních i souhrnných SHAP grafů.

Model je validován pomocí Gini koeficientu a Kolmogorov-Smirnov statistiky na out-of-time vzorku dat.