- LLM
- EVALUATION
- BENCHMARK
LLM Eval Harness

Arnés de evaluación que compara un LLM con clasificadores baseline en una tarea concreta: métricas reproducibles para saber cuándo el LLM merece la pena y cuándo no. Código en github.com/delcenjo/llm-eval-harness.
Antes de usar un LLM para clasificar texto merece la pena preguntarse si se lo gana. Un puñado de reglas por palabra clave es gratis, instantáneo y fácil de razonar. Este arnés responde la pregunta con números en lugar de intuición: sobre un dataset etiquetado, ¿el LLM gana al baseline, y por cuánto?
- Baseline0.840 acc
- Macro-F10.853
- ComparaciónLLM vs reglas
El mismo contrato para todos
Una tarea (enrutar mensajes de soporte a intenciones), dos predictores con la misma interfaz predict(text) y una evaluación que los puntúa en la misma tabla: accuracy, precision/recall por clase, macro-F1 y matriz de confusión. Comparación directa, sin trampas de formato.
El baseline pone el listón alto
Las reglas por palabra clave solas: 0,840 de accuracy y 0,853 de macro-F1 sobre el conjunto etiquetado. Ese es el número que el LLM tiene que batir con claridad para justificar su coste y su latencia. A veces lo bate; a veces la diferencia no paga la factura.
De aquí salió una herramienta
La costumbre de comparar contra baseline con tests de significancia acabó convertida en evalgate, una de mis herramientas open-source: un gate de CI que bloquea el despliegue si la evaluación empeora de verdad, no por ruido.
Próximos proyectos:

Credit Risk Platform
Plataforma MLOps de scoring de crédito de punta a punta: entrenamiento reproducible con registro de modelos versionado, API de inferencia en FastAPI con validación de entrada, monitorización de drift por PSI y observabilidad con Prometheus y Grafana, todo dockerizado y con CI. Código en github.com/delcenjo/credit-risk-platform.

Transformer from scratch
Modelo de lenguaje tipo GPT implementado desde cero en PyTorch: atención multi-cabeza, máscara causal y bloques residuales escritos a mano, más un tokenizador byte-pair propio y un estudio de ablaciones. Código en github.com/delcenjo/transformer-from-scratch.