RLHF
Aprendizaje por refuerzo con retroalimentación humana.
Explicación completa
Tras el preentrenamiento, personas puntúan distintas respuestas del modelo y se entrena un modelo de recompensa que guía el ajuste. Es la técnica que hizo a ChatGPT útil y seguro en conversación.
Ejemplo
Elegir cuál de dos respuestas es mejor, miles de veces.
Última actualización:
Términos relacionados
RAG (Retrieval-Augmented Generation)
Técnica que combina búsqueda de documentos con generación de texto.
Embedding
Representación numérica del significado de un texto o imagen.
Base de datos vectorial
Base de datos optimizada para buscar por similitud de embeddings.
Fine-tuning
Reentrenar un modelo base con datos propios para especializarlo.
Destilación
Entrenar un modelo pequeño para imitar a uno grande.
Ventana deslizante
Estrategia para gestionar conversaciones más largas que el contexto.