Search Your Block Floating Point Scales: NAS for Low-Precision Inference
arXiv·medium signal
Tanmaey Gupta et al. apply neural architecture search to block floating point (BFP) scale selection for quantized inference of generative models. The work shows that searching over BFP configurations rather than using fixed formats yields meaningful accuracy improvements at the same precision level. Practical for anyone deploying large models: better quantization configurations can reduce serving costs without quality regression.