Inferencia
Ejecutar un modelo ya entrenado para obtener una predicción.
Explicación completa
La inferencia es el uso del modelo en producción, frente al entrenamiento. Su coste se mide en tokens o segundos de GPU y es el gasto recurrente principal de cualquier producto con IA.
Ejemplo
Cada respuesta de un chatbot es una inferencia.
Última actualización:
Términos relacionados
API
Interfaz que permite a un programa usar una IA desde código.
GPU
Procesador gráfico usado para entrenar y ejecutar modelos.
Cuantización
Reducir la precisión numérica de un modelo para que ocupe menos.
Vibe coding
Programar describiendo en lenguaje natural lo que quieres.
Coste por token
Modelo de precios habitual de las APIs de IA.
Latencia
Tiempo que tarda el modelo en devolver una respuesta.