The RubricForge framework evolves judging rubrics by reflecting on small sets of ground-truth labeled trajectories. This method prevents LLM judges from mistakenly crediting fluent but unsuccessful agent behaviors as successes. It replaces hand-written scoring with outcome-grounded text. Practitioners can now evaluate agent trajectories more reliably without expensive executable environment rewards.