Inteligencia Artificial·1 sept 2026¿Qué miden realmente los benchmarks de LLMs?Un análisis de Allen Institute revela que los benchmarks estándar de modelos de lenguaje no capturan capacidades reales de inferencia. BenchMIRT propone una evaluación más rigurosa basada en tareas industriales concretas.Fuente: Hugging Face Blog