PROJECT 088 · PYTHON SOURCE
Fault recognition confusion analysis
Study-specific code. Shared modules, dependency versions, and reproduction instructions are included in all project files.
Download Python file ↓from pathlib import Path
import sys
ROOT = Path(__file__).resolve().parents[2]
sys.path.insert(0, str(ROOT))
import numpy as np
import pandas as pd
from scipy.stats import spearmanr
from sklearn.decomposition import PCA
from sklearn.ensemble import IsolationForest
from sklearn.preprocessing import StandardScaler
from sklearn.metrics import confusion_matrix, precision_score, recall_score
from portfolio.data import load
from portfolio.constants import *
from portfolio.methods import result, sql, rates, associations, distribution, regression, classification, cluster
from portfolio.engine import execute
META = {'id': 88, 'dataset': 'steel', 'title': 'Fault recognition confusion analysis', 'question': 'Which true fault classes are most often confused with another class?', 'method': 'Row-normalized confusion table for the fixed forest on the grouped holdout.', 'action': 'Review recurring class confusions with inspectors before changing labels or workflow.', 'limitations': 'Every source row is a recorded fault. The data cannot estimate a production defect rate or distinguish healthy plates. Batch and machine IDs are absent, so grouped exact-input holdouts do not prove factory transfer. '}
def analyze():
df = load('steel').copy()
scores,p,e=classification(df,STEEL_FEATURES,'fault')
t=pd.crosstab(p.actual,p['Random forest']).stack().rename('count').reset_index();t.columns=['actual','predicted','count']
t['actual_class_share']=t['count']/t.groupby('actual')['count'].transform('sum');t=t[t.actual!=t.predicted].sort_values('count',ascending=False)
t['confusion']=t.actual+' -> '+t.predicted
out=result(t,'confusion','actual_class_share','Share of true-class test records','Rates use the true-class denominator; the full CSV includes zero-count off-diagonal pairs.',extra={'model_scores':scores},evaluation=e)
return out
if __name__ == "__main__":
execute(Path(__file__).parent, META, analyze)