Parte do contido deste sitio creouse con asistencia de IA
Volver ao glosario Tecnoloxía

Streaming de Tokens

A saída gradual de respostas de IA token por token, en lugar de esperar á xeración completa, o que mellora a capacidade de resposta percibida.

¿O que é o streaming de tokens?

O streaming de tokens é unha técnica de transmisión na que un LLM transmite a súa resposta de forma gradual — token por token ou en pequenos lotes — en lugar de esperar a que se complete a xeración completa. Dende a perspectiva do usuario, o texto parece estar sendo escrito, o que mellora significativamente a capacidade de resposta percibida.

Implementación técnica

O streaming impléntase tipicamente mediante Eventos Enviados polo Servidor (SSE) ou WebSockets. No lado do servidor, o LLM envía cada token xerado inmediatamente. No lado do cliente, os tokens móstranse progresivamente. APIs como OpenAI, Anthropic e Gemini admiten modo de streaming mediante parámetros especiais (stream: true).

UX e rendemento

O streaming reduce o tempo até o primeiro token (TTFT) — o tempo até o primeiro texto visible — tipicamente a menos de 1 segundo, incluso cando a resposta completa tarda máis de 10 segundos. Isto mellora significativamente a experiencia do usuario. O streaming é especialmente importante para chatbots interactivos, xeración de código e respostas largas en aplicacions empresariais.