Què és el Transformer?
El Transformer és una arquitectura de xarxa neuronal presentada el 2017 en l'article influent "Attention is All You Need" (Vaswani et al., Google). Va revolucionar el camp del processament del llenguatge natural i és avui la base de gairebé tots els grans models de llenguatge moderns, des de GPT fins a BERT i Claude.
Principis arquitectònics
El Transformer reemplaça les connexions recurrents amb mecanismes d'autoatenció que permeten el processament paral·lel. Els components centrals són la multi-head self-attention (aprendeix diferents tipus de relacions entre tokens), les xarxes feed-forward, la codificació posicional (dona al model informació sobre les posicions dels tokens) i la normalització de capes. Les variants encoder-decoder (per a traducció) i les variants solo-decoder (per a generació de text) han demostrat ser eficaces per a diferents tasques.
Importància històrica
L'arquitectura Transformer és un dels conceptes tècnics més influents de les últimes dècades. Va permetre l'escalada a milers de milions de paràmetres, l'entrenament amb dades a escala d'internet i l'aparició de capacitats emergents en models grans. Sense Transformer no hi hauria ChatGPT, no hi hauria Claude, no hi hauria era moderna de la IA.