Dual VQA
Measures how many spatiotemporal facts the reconstruction preserves.
A VLM judge answers the same questions on source and rendered videos. Retention is scored only on questions answered correctly on the source.
Judge: GPT-5.4 mini · 16 frames per video