Časť obsahu tejto stránky bola vytvorená s pomocou AI
Späť na slovník Technológie

Transformer architektura

Transformer je architektúra neurónovej siete založená na mechanizme pozornosti (attention), ktorá je základom väčšiny moderných LLM a ďalších AI modelov.

Čo je Transformer?

Transformer je architektúra neurónovej siete prezentovaná v slávnom článku "Attention Is All You Need" (Vaswani et al., 2017). Nahradila predchádzajúce sekvenčné architektúry (RNN, LSTM) pre spracovanie jazykových postupností a stala sa základom všetkých moderných LLM – GPT, BERT, T5, LLaMA, Claude.

Kľúčovou inováciou je mechanizmus pozornosti (attention), ktorý umožňuje modelu priamo spracovať závislosti medzi všetkými prvkami vstupu naraz, bez obmedzenia sekvenčným spracovaním.

Self-attention mechanizmus

Multi-head self-attention je srdcom Transformera. Pre každý token v sekvencii počíta model dotazové (Query), kľúčové (Key) a hodnotové (Value) vektory. Skóre pozornosti medzi tokenmi sa počítajú ako skalárne súčiny, ktoré určujú, ako veľmi každý token "venuje pozornosť" ostatným tokenom v sekvencii.

Viacero "hláv pozornosti" (multi-head) umožňuje modelu súčasne sledovať rôzne typy závislostí – syntaktické, sémantické aj dlhodobého dosahu.

Vplyv a dedičia

Transformer transformoval AI priemysel ďaleko za hranice NLP – Vision Transformers (ViT) dominujú computer vision, Audio Transformers spracúvajú reč a hudbu, Protein Language Models ako AlphaFold2 riešia skladanie proteínov. Škálovateľnosť je kľúčová výhoda: Transformer škáluje takmer lineárne s výpočtovými zdrojmi, čo umožnilo trénovanie modelov s biliardami parametrov.