The Felony Bench dataset evaluates whether large language models can assist in committing actual crimes. Researchers tested various models on their ability to provide actionable instructions for illegal acts. Most frontier models successfully block these requests. This benchmark provides a concrete metric for red-teaming teams to measure safety guardrail effectiveness against malicious prompts.