Cuantización

Reducir la precisión numérica de un modelo para que ocupe menos.

Explicación completa

Pasar los pesos de 16 bits a 8 o 4 bits reduce mucho la memoria necesaria con una pérdida de calidad pequeña, permitiendo ejecutar modelos grandes en hardware doméstico.

Ejemplo

Un modelo de 70B cuantizado a 4 bits cabe en 40 GB.

Última actualización:

Términos relacionados