Data Filtering Fails To Remove Undesirable Traits | dailyai.report
23 stories from today
Safety
53d ago
Data Filtering Fails To Remove Undesirable Traits
Targeted filtering of training data often fails to eliminate specific model behaviors like liberal-leaning responses or bold formatting. Researchers using OLMo SFT datasets found that removing problematic data points had little effect on the final model output.
The Signal
This suggests that standard data attribution methods are insufficient for precise behavioral control during fine-tuning.