Què és el caché semàntic?
El caché semàntic és una tècnica d'optimització per a sistemes d'IA en la qual les respostes a consultes anteriors es reutilitzen basant-se en similitud semàntica (no en coincidència exacta de text). Quan una nova consulta és semànticament similar a una consulta en caché, es retorna la resposta emmagatzemada sense tornar a invocar el LLM.
Implementació tècnica
El caché semàntic utilitza models d'embedding per representar les consultes com a vectors i cerca per similitud en una base de dades vectorial per trobar consultes en caché semànticament similars. Un llindar de similitud configurable determina quan es pot utilitzar una resposta en caché. Eines com GPTCache ofereixen implementacions listes per utilitzar.
Valor empresarial
En entorns de producció amb molts usuaris, les consultes semànticament similars poden ser freqüents (p. ex., FAQs de suport al client). El caché semàntic pot reduir els costos de l'API de LLM entre un 20 i un 60% i millorar dramàticament els temps de resposta. És especialment valuós per a sistemes RAG amb una base de coneixement estable.