PROJECT 022 · PYTHON SOURCE
Subscription probability calibration
Study-specific code. Shared modules, dependency versions, and reproduction instructions are included in all project files.
Download Python file ↓from pathlib import Path
import sys
ROOT = Path(__file__).resolve().parents[2]
sys.path.insert(0, str(ROOT))
import numpy as np
import pandas as pd
from scipy.stats import spearmanr
from sklearn.decomposition import PCA
from sklearn.ensemble import IsolationForest
from sklearn.preprocessing import StandardScaler
from sklearn.metrics import confusion_matrix, precision_score, recall_score
from portfolio.data import load
from portfolio.constants import *
from portfolio.methods import result, sql, rates, associations, distribution, regression, classification, cluster
from portfolio.engine import execute
META = {'id': 22, 'dataset': 'bank', 'title': 'Subscription probability calibration', 'question': 'Do predicted probability bands match observed subscriptions on later records?', 'method': 'Reliability table for a fixed logistic model, with equal-frequency probability bins.', 'action': 'Check calibration on new campaigns before interpreting probabilities as expected response rates.', 'limitations': 'Observational marketing records do not identify campaign uplift. Month and row order are not precise timestamps; repeated-client identifiers are unavailable. Models are research diagnostics, not financial eligibility or automated contact decisions. '}
def analyze():
df = load('bank').copy()
scores,p,e=classification(df,BANK_FEATURES,'subscribed',split='ordered')
p['bin']=pd.qcut(p['Logistic regression probability'],10,duplicates='drop')
t=p.groupby('bin',observed=True).agg(n=('actual','size'),predicted_probability=('Logistic regression probability','mean'),observed_rate=('actual','mean')).reset_index()
t['bin']=t['bin'].astype(str);t['absolute_gap']=abs(t.predicted_probability-t.observed_rate)
out=result(t,'bin','absolute_gap','Absolute calibration gap','These are diagnostics on a previously defined test set, not a new independent experiment.',extra={'model_scores':scores},evaluation=e)
return out
if __name__ == "__main__":
execute(Path(__file__).parent, META, analyze)