PROJECT 083 · PYTHON SOURCE
Recorded fault class balance
Study-specific code. Shared modules, dependency versions, and reproduction instructions are included in all project files.
Download Python file ↓from pathlib import Path
import sys
ROOT = Path(__file__).resolve().parents[2]
sys.path.insert(0, str(ROOT))
import numpy as np
import pandas as pd
from scipy.stats import spearmanr
from sklearn.decomposition import PCA
from sklearn.ensemble import IsolationForest
from sklearn.preprocessing import StandardScaler
from sklearn.metrics import confusion_matrix, precision_score, recall_score
from portfolio.data import load
from portfolio.constants import *
from portfolio.methods import result, sql, rates, associations, distribution, regression, classification, cluster
from portfolio.engine import execute
META = {'id': 83, 'dataset': 'steel', 'title': 'Recorded fault class balance', 'question': 'Which defect classes dominate the labeled inspection sample?', 'method': 'Class counts and proportions across recorded faults.', 'action': 'Use class balance to choose metrics and inspect rare-class coverage before model fitting.', 'limitations': 'Every source row is a recorded fault. The data cannot estimate a production defect rate or distinguish healthy plates. Batch and machine IDs are absent, so grouped exact-input holdouts do not prove factory transfer. '}
def analyze():
df = load('steel').copy()
t=df.fault.value_counts().rename_axis('fault').reset_index(name='records');t['sample_share']=t.records/len(df)
out=result(t,'fault','sample_share','Share of labeled faults','The denominator contains faulty observations only. This is not a defect rate across manufactured plates.')
return out
if __name__ == "__main__":
execute(Path(__file__).parent, META, analyze)