Este benchmark mide la afirmación central del producto: si un agente puede usar logic2b de extremo a extremo en vez de limitarse a leer documentación. El protocolo es público, cada regla tiene puntos y el scorer nunca ejecuta el código enviado.
Tarea 1 · 100 puntos
Instalar y aplicar tema
Instala Button, Card y Dialog desde logic2b y aplica el preset exacto sin recrear los componentes.
12 comprobaciones objetivas
Tarea 2 · 100 puntos
Componer ajustes accesibles
Construye una pantalla de cuenta accesible con primitivas del registro y colores semánticos.
13 comprobaciones objetivas
Tarea 3 · 100 puntos
Crear un dashboard desde cero
Genera un dashboard Vite ejecutable con tema, gráfico y dependencias transitivas exactas.
12 comprobaciones objetivas
| Posición | Modelo | Agente | Puntuación | Duración |
|---|---|---|---|---|
| 1 | gpt-5.6-sol | OpenAI Codex CLI | 294/300 (98%) | 737,6 s |
| 2 | gpt-5.5 | OpenAI Codex CLI | 272/300 (90,7%) | 751,789 s |
| 3 | gpt-5.6-terra | OpenAI Codex CLI | 266/300 (88,7%) | 430,712 s |
Protocolo v1.1.0: 3 tareas, 300 puntos.Puntuación antes que duración; el evaluador registra el build.
Qué se mide
Las tareas avanzan desde instalar componentes hasta componer y generar una app
completa. Comprueban procedencia (data-slot, imports y archivos transitivos),
fidelidad al preset, tokens semánticos, formularios accesibles, versiones
fijadas y builds observados por el evaluador.
La puntuación total es 300. Se ordena primero por puntos y después por duración, por lo que un resultado rápido pero roto queda bajo uno completo más lento.
Contrato de ejecución justa
- Directorio aislado y nuevo para cada modelo y tarea.
- Mismo texto, preset y fixture inicial.
- Shell, red y MCP registrados en los metadatos.
- Sin correcciones humanas después de iniciar el cronómetro.
- Tareas fallidas o agotadas conservan artefactos parciales.
- El operador —no el modelo— registra el código de salida del build.
- Versión de modelo/proveedor, host del agente, SO y Node acompañan el resultado.
El repositorio incluye runner versionado y scorer estático. El runner crea cada fixture desde el registro compilado en staging externo, registra SHA-256, invoca el agente configurado sin shell, limita tiempo/salida y captura el código antes del build observado. Excluye dependencias y cachés, descarta symlinks y nunca ejecuta una fuente que exceda el presupuesto. Debe ejecutarse dentro de un contenedor o VM desechable porque la verificación sí compila código generado.
Reproducir o auditar
El protocolo, scorer, fixtures y formato crudo viven en
benchmarks/agents.
pnpm --dir benchmarks/agents test
pnpm --dir benchmarks/agents benchmark config.json --validate
pnpm --dir benchmarks/agents benchmark config.json
pnpm --dir benchmarks/agents score <run-id>
Los artefactos reales se publican junto a su puntuación detallada. La primera
comparación controlada mantiene Codex CLI 0.148.0-alpha.15 y las mismas
capacidades para los tres modelos: gpt-5.6-sol lidera con 294/300 (98 %),
seguido por gpt-5.5 con 272/300 (90,7 %) y gpt-5.6-terra con 266/300
(88,7 %). Todos los builds observados están en verde. La evidencia conserva
las diferencias relevantes: Sol solo normalizó el preset legado, 5.5 perdió
fidelidad en starter/tema/versiones y Terra produjo un dashboard compilable
pero no el bloque canónico solicitado. Los fixtures sintéticos siguen
etiquetados y excluidos mecánicamente.