PROMPTOWY_
Newsy

RAPID: jak efektywniej uczyć małe modele od dużych dzięki selekcji par

promptowy@ai:~$ cat news_1

Destylacja wiedzy to technika, w której duży, dobrze wytrenowany model (nauczyciel) pomaga trenować mniejszy, tańszy model (uczeń).

promptowy@ai:~$ cat news_2

Jeden ze sposobów przeprowadzania tego procesu polega na dopasowywaniu relacji między przykładami - tzw.

promptowy@ai:~$ cat news_3

destylacja relacyjna między przykładami (inter-example relational distillation).

promptowy@ai:~$ cat news_4

Chodzi o to, żeby uczeń nauczył się nie tylko odpowiedzi na poszczególne pytania, ale też ogólnej geometrii reprezentacji nauczyciela: jak przykłady układają się względem siebie w przestrzeni.Problem z parami: rosnąca liczba kombinacjiKłopot polega na złożoności obliczeniowej.

promptowy@ai:~$ open --full
Czytaj całość

RAPID: jak efektywniej uczyć małe modele od dużych dzięki selekcji par

Otwórz artykuł na promptowy.com