Benchmark
Prueba estandarizada para comparar modelos.
Explicación completa
Los benchmarks miden capacidades concretas: razonamiento (MMLU), programación (HumanEval), matemáticas (GSM8K). Son útiles como orientación, pero no sustituyen a probar el modelo en tu caso real.
Ejemplo
Comparar dos modelos por su puntuación en MMLU.
Última actualización:
Términos relacionados
LLM (Large Language Model)
Modelo de lenguaje de gran tamaño entrenado con billones de palabras.
Transformer
Arquitectura de red neuronal basada en atención, base de los LLM modernos.
Multimodal
Modelo capaz de procesar varios tipos de datos: texto, imagen, audio o vídeo.
Modelo open source
Modelo cuyos pesos se publican y pueden ejecutarse libremente.