Časť obsahu tejto stránky bola vytvorená s pomocou AI
Späť na slovník Umelá inteligencia

Scaling Laws

Scaling laws sú empirické vzťahy, ktoré popisujú, ako výkon AI modelov rastie so zvyšovaním parametrov, trénovacích dát a výpočtových zdrojov.

Čo sú scaling laws?

Scaling laws sú jedným z najvplyvnejších empirických zistení v modernom AI vývoji. Ukazujú, že výkon jazykových modelov – meraný stratovou funkciou – sa predpokladateľne zlepšuje so zvyšovaním troch faktorov: počtu parametrov modelu (N), veľkosti trénovacieho datasetu (D) a množstva výpočtových zdrojov (C).

Kľúčová je predpokladateľnosť: na základe merania na menších modeloch je možné odhadnúť výkon väčšieho modelu pred jeho natrénovaním.

Chinchilla a optimálny pomer

Práca DeepMind (Hoffmann et al., 2022) – známa ako Chinchilla scaling laws – ukázala, že väčšina predchádzajúcich modelov bola "undertrained" – mali príliš veľa parametrov na príliš malom množstve dát. Optimálna stratégia je rovnomerne škálovať parametre aj trénovacie dáta.

GPT-3 so 175B parametrami trénovaný na 300B tokenoch je podľa Chinchilla podoptimálny; optimum by bolo cca 70B parametrov s 1.4 triliónu tokenov.

Za hranice traditional scaling

Scaling laws mali hlboké implikácie pre AI stratégiu – justifikovali masívne investície do compute a dát. Avšak súčasné diskusie sa týkajú post-training scaling (inference-time compute) – dlhšie uvažovanie pri inferencii môže dopĺňať pretrainovací scaling a otvoriť novú cestu k lepším modelom bez rastu parametrov.