Sobre MíQué hagoProyectosLabContacto
  • LLM
  • EVALUATION
  • BENCHMARK

LLM Eval Harness

LLM Eval Harness

Arnés de evaluación que compara un LLM con clasificadores baseline en una tarea concreta: métricas reproducibles para saber cuándo el LLM merece la pena y cuándo no. Código en github.com/delcenjo/llm-eval-harness.

Antes de usar un LLM para clasificar texto merece la pena preguntarse si se lo gana. Un puñado de reglas por palabra clave es gratis, instantáneo y fácil de razonar. Este arnés responde la pregunta con números en lugar de intuición: sobre un dataset etiquetado, ¿el LLM gana al baseline, y por cuánto?

  • Baseline0.840 acc
  • Macro-F10.853
  • ComparaciónLLM vs reglas

El mismo contrato para todos

Una tarea (enrutar mensajes de soporte a intenciones), dos predictores con la misma interfaz predict(text) y una evaluación que los puntúa en la misma tabla: accuracy, precision/recall por clase, macro-F1 y matriz de confusión. Comparación directa, sin trampas de formato.

El baseline pone el listón alto

Las reglas por palabra clave solas: 0,840 de accuracy y 0,853 de macro-F1 sobre el conjunto etiquetado. Ese es el número que el LLM tiene que batir con claridad para justificar su coste y su latencia. A veces lo bate; a veces la diferencia no paga la factura.

De aquí salió una herramienta

La costumbre de comparar contra baseline con tests de significancia acabó convertida en evalgate, una de mis herramientas open-source: un gate de CI que bloquea el despliegue si la evaluación empeora de verdad, no por ruido.

¿Conectamos?

Hablemos: feedback, colaboración o una oportunidad.

Puedes escribirme por un proyecto, una duda técnica, para darme feedback o por unas prácticas o un primer puesto junior. Respondo siempre.

Escríbeme

Próximos proyectos:

Hecho con

PythonPyTorchscikit-learnpandasNumPyJupyterHugging FaceLangChainFastAPIPydanticDockerGitHub ActionsPrometheusGrafanaMLflowPostgreSQLGitGitHubLinuxStreamlitSQLiteAnthropicBashPyPIOllamaPythonPyTorchscikit-learnpandasNumPyJupyterHugging FaceLangChainFastAPIPydanticDockerGitHub ActionsPrometheusGrafanaMLflowPostgreSQLGitGitHubLinuxStreamlitSQLiteAnthropicBashPyPIOllama
hola@jmwebsoluciones.com