RLHF

Aprendizaje por refuerzo con retroalimentación humana.

Explicación completa

Tras el preentrenamiento, personas puntúan distintas respuestas del modelo y se entrena un modelo de recompensa que guía el ajuste. Es la técnica que hizo a ChatGPT útil y seguro en conversación.

Ejemplo

Elegir cuál de dos respuestas es mejor, miles de veces.

Última actualización:

Términos relacionados