Saltar al contenido
Logic2BUI

Buscar en la documentación

Busca componentes y documentación

Nuevo
Menú

Benchmarks de agentes

Benchmark público y reproducible para agentes que instalan, tematizan y componen logic2b ui.

Este benchmark mide la afirmación central del producto: si un agente puede usar logic2b de extremo a extremo en vez de limitarse a leer documentación. El protocolo es público, cada regla tiene puntos y el scorer nunca ejecuta el código enviado.

Tarea 1 · 100 puntos

Instalar y aplicar tema

Instala Button, Card y Dialog desde logic2b y aplica el preset exacto sin recrear los componentes.

12 comprobaciones objetivas

Tarea 2 · 100 puntos

Componer ajustes accesibles

Construye una pantalla de cuenta accesible con primitivas del registro y colores semánticos.

13 comprobaciones objetivas

Tarea 3 · 100 puntos

Crear un dashboard desde cero

Genera un dashboard Vite ejecutable con tema, gráfico y dependencias transitivas exactas.

12 comprobaciones objetivas

PosiciónModeloAgentePuntuaciónDuración
1gpt-5.6-solOpenAI Codex CLI294/300 (98%)737,6 s
2gpt-5.5OpenAI Codex CLI272/300 (90,7%)751,789 s
3gpt-5.6-terraOpenAI Codex CLI266/300 (88,7%)430,712 s

Protocolo v1.1.0: 3 tareas, 300 puntos.Puntuación antes que duración; el evaluador registra el build.

Qué se mide

Las tareas avanzan desde instalar componentes hasta componer y generar una app completa. Comprueban procedencia (data-slot, imports y archivos transitivos), fidelidad al preset, tokens semánticos, formularios accesibles, versiones fijadas y builds observados por el evaluador.

La puntuación total es 300. Se ordena primero por puntos y después por duración, por lo que un resultado rápido pero roto queda bajo uno completo más lento.

Contrato de ejecución justa

  • Directorio aislado y nuevo para cada modelo y tarea.
  • Mismo texto, preset y fixture inicial.
  • Shell, red y MCP registrados en los metadatos.
  • Sin correcciones humanas después de iniciar el cronómetro.
  • Tareas fallidas o agotadas conservan artefactos parciales.
  • El operador —no el modelo— registra el código de salida del build.
  • Versión de modelo/proveedor, host del agente, SO y Node acompañan el resultado.

El repositorio incluye runner versionado y scorer estático. El runner crea cada fixture desde el registro compilado en staging externo, registra SHA-256, invoca el agente configurado sin shell, limita tiempo/salida y captura el código antes del build observado. Excluye dependencias y cachés, descarta symlinks y nunca ejecuta una fuente que exceda el presupuesto. Debe ejecutarse dentro de un contenedor o VM desechable porque la verificación sí compila código generado.

Reproducir o auditar

El protocolo, scorer, fixtures y formato crudo viven en benchmarks/agents.

pnpm --dir benchmarks/agents test
pnpm --dir benchmarks/agents benchmark config.json --validate
pnpm --dir benchmarks/agents benchmark config.json
pnpm --dir benchmarks/agents score <run-id>

Los artefactos reales se publican junto a su puntuación detallada. La primera comparación controlada mantiene Codex CLI 0.148.0-alpha.15 y las mismas capacidades para los tres modelos: gpt-5.6-sol lidera con 294/300 (98 %), seguido por gpt-5.5 con 272/300 (90,7 %) y gpt-5.6-terra con 266/300 (88,7 %). Todos los builds observados están en verde. La evidencia conserva las diferencias relevantes: Sol solo normalizó el preset legado, 5.5 perdió fidelidad en starter/tema/versiones y Terra produjo un dashboard compilable pero no el bloque canónico solicitado. Los fixtures sintéticos siguen etiquetados y excluidos mecánicamente.