Čo je Transformer?
Transformer je architektúra neurónovej siete prezentovaná v slávnom článku "Attention Is All You Need" (Vaswani et al., 2017). Nahradila predchádzajúce sekvenčné architektúry (RNN, LSTM) pre spracovanie jazykových postupností a stala sa základom všetkých moderných LLM – GPT, BERT, T5, LLaMA, Claude.
Kľúčovou inováciou je mechanizmus pozornosti (attention), ktorý umožňuje modelu priamo spracovať závislosti medzi všetkými prvkami vstupu naraz, bez obmedzenia sekvenčným spracovaním.
Self-attention mechanizmus
Multi-head self-attention je srdcom Transformera. Pre každý token v sekvencii počíta model dotazové (Query), kľúčové (Key) a hodnotové (Value) vektory. Skóre pozornosti medzi tokenmi sa počítajú ako skalárne súčiny, ktoré určujú, ako veľmi každý token "venuje pozornosť" ostatným tokenom v sekvencii.
Viacero "hláv pozornosti" (multi-head) umožňuje modelu súčasne sledovať rôzne typy závislostí – syntaktické, sémantické aj dlhodobého dosahu.
Vplyv a dedičia
Transformer transformoval AI priemysel ďaleko za hranice NLP – Vision Transformers (ViT) dominujú computer vision, Audio Transformers spracúvajú reč a hudbu, Protein Language Models ako AlphaFold2 riešia skladanie proteínov. Škálovateľnosť je kľúčová výhoda: Transformer škáluje takmer lineárne s výpočtovými zdrojmi, čo umožnilo trénovanie modelov s biliardami parametrov.