Latencia

Tiempo que tarda el modelo en devolver una respuesta.

Explicación completa

La latencia depende del tamaño del modelo, la longitud de la salida y la carga del proveedor. El streaming, que muestra la respuesta token a token, mejora mucho la latencia percibida sin reducir la real.

Ejemplo

Un modelo grande puede tardar 8 segundos en un texto largo.

Última actualización:

Términos relacionados