› Marek Hradil i Danae Sánchez Villegas opublikowali 24 sierpnia 2026 roku na arXiv pracę zatytułowaną "What's the Catch?
› Evaluating Temporal Consistency in Vision-Language Models".
› Liczy ona 17 stron i została napisana w formacie ACL.Na czym polega problemModele wizualno-językowe (VLM - Vision-Language Models) osiągają dobre wyniki na popularnych benchmarkach wideo i sekwencji obrazów.
› Autorzy zadają jednak konkretne pytanie: czy te modele faktycznie rozumieją strukturę czasową, czyli to, że zdarzenia dzieją się w określonej kolejności?