Blog pod ręką. Teraz w nowej odsłonie.
Wygodny czytnik, zapisane artykuły i wygląd, który znasz z Promptowego.
RLHF
Uczenie modelu na ludzkich ocenach odpowiedzi - dzięki temu jest pomocny, a nie tylko „przewiduje tekst”.
RLHF (Reinforcement Learning from Human Feedback) to etap treningu, w którym model uczy się na ludzkich ocenach: ludzie porównują różne odpowiedzi modelu, wskazują lepsze, a algorytm dostraja model tak, by częściej generował te preferowane.
To właśnie RLHF i pokrewne techniki zamieniły surowe „przewidywacze tekstu” w pomocnych asystentów, którzy odpowiadają na pytania zamiast je kontynuować, odmawiają szkodliwych próśb i trzymają kulturalny ton. Cena bywa taka, że model robi się przesadnie ugodowy i przytakuje użytkownikowi.