Skip to content
arXiv cs.CV · Papers

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

arXiv:2606.27741v3 Announce Type: replace Abstract: Recent advances in video diffusion models have greatly improved visual fidelity, yet their generated motions often violate physical plausibility. We observe a common kinematic failure, "motion entanglement", the unintended coupling of independent motion sources, such