Transformer
Architektura, na której opierają się współczesne modele językowe. To „T” w GPT.
Transformer to architektura sieci neuronowej opisana przez badaczy Google w pracy „Attention Is All You Need” z 2017 roku. Jej kluczowym pomysłem jest mechanizm atencji (uwagi), który pozwala modelowi ważyć, jak bardzo poszczególne słowa w tekście odnoszą się do siebie nawzajem - niezależnie od odległości między nimi.
To właśnie transformer umożliwił skok jakości, który obserwujemy od kilku lat: skaluje się znakomicie z ilością danych i mocy obliczeniowej. Litera „T” w nazwie GPT pochodzi właśnie od transformera; na tej architekturze opierają się praktycznie wszystkie czołowe modele językowe.