› Modele VLA (vision-language-action) to duże modele, które łączą rozumienie obrazu, języka i sterowania ruchem robota.
› Standardowa procedura polega na tym, że bierzemy gotowy, wstępnie wytrenowany model i dostrajamy go na demonstracjach konkretnego zadania - np.
› Problem w tym, że taka procedura optymalizuje tylko to, co wpływa na przewidywane akcje.
› Wszystko inne w reprezentacji wizualnej modelu może się po drodze rozpaść.Na czym polega problemAutorzy formalizują to zjawisko jako "residual visual collapse along local action fibers" - czyli rozpad wizualnych residuałów wzdłuż lokalnych włókien akcji.