Skip to content

CompanyBench · the aeqi Harness Index

Can your harness run a Company?

Everyone benchmarks the model. We run every open-source harness across the same models on the job of running a Company — then score the scaffold, not the LLM.

6
Harnesses tracked
8
Tasks
2
Models
32
Executions
0
LLM judges

Stage-1 results · first real numbers

8 tasks × 2 models · N=1updated 2026-07-14how it’s scored →

Eight code-graded tasks (no LLM judge) × two models. aeqi’s cost is real metered spend read from its own ledger — every cell reproducible in one command.

  • count error-level log lines· trivial
  • sum invoice amounts (2dp, skip non-numeric)· easy
  • CSV region totals, RFC-4180 quoted fields· medium
  • dedup to latest timestamp, file-order tie-break· medium
  • multi-key employee sort· medium
  • unicode revenue, round-half-away cents· hard
  • access-log report (per-endpoint error rates)· hard
  • register-VM simulation· hard
HarnessModelSolvedExecTurnsTokens inCachedTokens outEmbedDurationScoreCost
aeqihostglm-5.28/88651,463,2531,347,45615,1279m 33s7$0.5351
aeqihostdeepseek-v4-pro8/88521,238,4201,105,47211,1894m 23s12$0.3125
Piglm-5.28/88327,53502,12102m 56s65$0.0154
Pideepseek-v4-pro8/88278,67202,01604m 39s100$0.0056

Cost vs. success

log scale · real metered $
leanest100%0%$0.001$0.01$0.10cost / task (log) →success ↑12341Pi · deepseek-v4-pro$0.0007/task2Pi · glm-5.2$0.0019/task3aeqi · deepseek-v4-pro$0.039/task4aeqi · glm-5.2$0.067/task
Success
100%32 / 32 cells
Cost / task
$0.0007–$0.067leanest → priciest
aeqi vs Pi
35–56×cost multiple
LLM judges
0code-graded
method + analysis →

Tracked harnesses

6 in the field · StoreOps queued

headless · same models · trace per cell · aeqi never ranked #1 without independent reproduction

What we measure that others don't

autonomy over time, not a snapshot

Intervention rate

new

Coherence horizon

new

Cost to operate

Unattended recovery

new
metric definitions →

Scenarios

a family of Company-operations tasks

Store back-office

Scenario 1 · preview

Support & ops desk

Scenario 2 · soon

Coding harness index

Track · soon
run by aeqicode-graded · 0 LLM judgescompetitors on default configwe publish our lossesevery number ships its tracereproducible in one commandcharter →
Builds on Terminal-Bench · Holistic Agent Leaderboard (HAL) · Coding Agent Index · Claw-SWE-Bench

Built by the Company OS it measures.

Cookies for sign-in and analytics. No third-party tracking.