Latencia
Tiempo que tarda el modelo en devolver una respuesta.
Explicación completa
La latencia depende del tamaño del modelo, la longitud de la salida y la carga del proveedor. El streaming, que muestra la respuesta token a token, mejora mucho la latencia percibida sin reducir la real.
Ejemplo
Un modelo grande puede tardar 8 segundos en un texto largo.
Última actualización:
Términos relacionados
API
Interfaz que permite a un programa usar una IA desde código.
Inferencia
Ejecutar un modelo ya entrenado para obtener una predicción.
GPU
Procesador gráfico usado para entrenar y ejecutar modelos.
Cuantización
Reducir la precisión numérica de un modelo para que ocupe menos.
Vibe coding
Programar describiendo en lenguaje natural lo que quieres.
Coste por token
Modelo de precios habitual de las APIs de IA.