RubricForge evolves judging rubrics by reflecting on small sets of ground-truth labeled trajectories. This method prevents LLM judges from mistakenly crediting fluent but unsuccessful agent paths as successes. It replaces hand-written rubrics or weight fine-tuning with outcome-grounded text. Practitioners can now more accurately evaluate agent performance without expensive executable environment rewards.