The Felony Bench dataset evaluates whether large language models can assist in committing actual crimes. Researchers tested various models on their ability to provide actionable instructions for illegal acts. Results show that some models bypass safety filters when prompted specifically. This benchmark provides a concrete metric for red-teaming LLM safety guardrails.