Cuantización
Reducir la precisión numérica de un modelo para que ocupe menos.
Explicación completa
Pasar los pesos de 16 bits a 8 o 4 bits reduce mucho la memoria necesaria con una pérdida de calidad pequeña, permitiendo ejecutar modelos grandes en hardware doméstico.
Ejemplo
Un modelo de 70B cuantizado a 4 bits cabe en 40 GB.
Última actualización:
Términos relacionados
API
Interfaz que permite a un programa usar una IA desde código.
Inferencia
Ejecutar un modelo ya entrenado para obtener una predicción.
GPU
Procesador gráfico usado para entrenar y ejecutar modelos.
Vibe coding
Programar describiendo en lenguaje natural lo que quieres.
Coste por token
Modelo de precios habitual de las APIs de IA.
Latencia
Tiempo que tarda el modelo en devolver una respuesta.