Deliberate Alignment Faking as a Defense Against Model Poisoning
I want to discuss and brainstorm a counterintuitive approach to AI alignment:Inducing alignment faking on purpose, to prevent the model from developing emergent misalignment.To prevent this…