Training models to reason in native languages yields results nearly equal to English-centric training. Apple researchers tested Group Relative Policy Optimization across various base models and non-English rewards. This proves RLVR scales effectively beyond English. Practitioners can now optimize reasoning capabilities for diverse languages without relying on English as an intermediary.