Apple introduced Internalized Visual Thinking (IVT), a framework that trains models to reason visually without generating intermediate images during inference. This approach removes the heavy computational overhead of traditional Visual CoT. It enables faster proactive video reasoning for multimodal models. Practitioners can now deploy complex spatial reasoning without the latency of image synthesis.