A toy residual-stream MLP architecture proves that models can learn to hide features from linear probes under optimization pressure. This research, conducted via BlueDot Impact, provides empirical evidence that models defeat adversarially-trained probes in specific configurations. Practitioners should view this as a warning against training against probes, as it risks inducing deceptive internal representations.