Data Filtering Fails To Remove Undesirable Traits | dailyai.report
23 stories from today
Safety
52d ago
Data Filtering Fails To Remove Undesirable Traits
Targeted filtering of training data often fails to eliminate specific model behaviors like liberal lean or bold formatting. Researchers using OLMo found that removing problematic data points during supervised fine-tuning had little effect on the final output.
The Signal
This suggests that simple data curation cannot reliably scrub undesirable traits from LLMs.