Apple researchers developed RayRoPE to uniquely encode image patches using predicted points along rays. This method enables SE(3)-invariant attention, overcoming the limitations of standard absolute or relative encoding schemes. It allows transformers to better adapt to scene geometry. Practitioners can now implement more precise spatial reasoning in multi-view vision models.