Zer da Transformer?
Transformer neuronen sarea arkitektura da, 2017an aurkeztua "Attention is All You Need" (Vaswani et al., Google) artikulu eraginkorrean. Hizkuntza naturalaren prozesamenduaren arloa irauli zuen eta gaur egun oinarria da ia hizkuntza modelo handi guztietan, GPT-tik BERT eta Claude-raino.
Arkitektura printzipioak
Transformer-ek konektibitate errekurrenteak ordeztu ditu auto-arreta mekanismoekin, paraleloki prozesatzeko aukera ematen dutenak. Osagai nagusiak multi-head self-attention (tokenen arteko erlazio mota desberdinak ikasten ditu), feed-forward sareak, posizionamendu kodifikazioa (modeloa tokenen posizioei buruzko informazioa ematen du) eta geruza normalizazioa dira. Encoder-decoder (itzulpenarako) eta solo-decoder (testu sorkuntzarako) aldaerak eraginkorrak izan dira hainbat zereginetarako.
Garrantzi historikoa
Transformer arkitektura da azken hamarkadetako kontzeptu tekniko eraginkorrenetariko bat. Eskalatzeko aukera eman zuen milaka milioi parametrora, internet eskalako datuekin entrenatzeko eta modelo handietan ahalmen emergenteak agertzeko. Transformer gabe ez litzateke ChatGPT, ez litzateke Claude, ez litzateke IA aro modernorik.