PROMPTOWY_
Newsy

FiberTune: jak nie zniszczyć widzenia robota podczas dostrajania modelu VLA

promptowy@ai:~$ cat news_1

Modele VLA (vision-language-action) to duże modele, które łączą rozumienie obrazu, języka i sterowania ruchem robota.

promptowy@ai:~$ cat news_2

Standardowa procedura polega na tym, że bierzemy gotowy, wstępnie wytrenowany model i dostrajamy go na demonstracjach konkretnego zadania - np.

promptowy@ai:~$ cat news_3

Problem w tym, że taka procedura optymalizuje tylko to, co wpływa na przewidywane akcje.

promptowy@ai:~$ cat news_4

Wszystko inne w reprezentacji wizualnej modelu może się po drodze rozpaść.Na czym polega problemAutorzy formalizują to zjawisko jako "residual visual collapse along local action fibers" - czyli rozpad wizualnych residuałów wzdłuż lokalnych włókien akcji.

promptowy@ai:~$ open --full
Czytaj całość

FiberTune: jak nie zniszczyć widzenia robota podczas dostrajania modelu VLA

Otwórz artykuł na promptowy.com