Back to all

fairsteer-dynamic-debiasing

by bitlabsdevteam

00Feb 6, 2026Visit Source
An inference-time debiasing framework for Large Language Models (LLMs) that uses Dynamic Activation Steering (DAS). It operates by detecting bias signatures in hidden layer activations (Biased Activation Detection - BAD) and applying a pre-computed Debiasing Steering Vector (DSV) to adjust the activation space toward an unbiased direction, mitigating social bias without model retraining or complex prompting. Applicable to various tasks (Q/A, Text Generation, Counterfactual Evaluation) while preserving general model capabilities.