Formal Model of RLHF-vs-Filters Says Character Fragility, Not Deployment Scale, Decides Safety Architecture
This comparative-statics model parameterizes AI safety design as an allocation alpha between character shaping (RLHF, Constitutional AI) and rule enforcement (output filters, classifiers), incorporating scale-dependent filter degradation, common-mode failures, and character fragility, with closed-form expected harm plus Monte Carlo CVaR tail analysis. Optimal alpha shifts only weakly toward character shaping as deployment scale T grows — from +0.01 to +0.21 across optimistic, moderate, and pessimistic scenarios. The dominant term by a wide margin is the baseline character-fragility rate, which moves alpha by 0.50 across its range, exceeding tail severity, filter quality, and common-mode failure probability combined.
↳ Follow the thread