Generated 2026-07-21 21:32 UTC
This report summarizes Compitum's test and benchmark results alongside common baselines.
Charts: bars include Compitum (blue/green) and baselines (gray). The scatter shows average cost vs performance for all models.
Coverage: win-rate denominator = 86 evals; Compitum evals at this WTP = 86.
(skipped)
Exit code: N/A
| Step | Return Code | Timed Out | Duration (s) | Timeout Cap (s) |
|---|---|---|---|---|
| Unit Tests | N/A | |||
| RouterBench | N/A | |||
| Compitum | 0 | NO | 591.044 | 900 |
Full machine-readable log stored alongside this report as JSON.
data\rb_clean\eval_results\eval_results-eval-all-07-21-21-31-val_split.csv| Model | Avg Performance | Avg Total Cost |
|---|---|---|
| compitum | 0.5111 | 2.611772 |
| claude-instant-v1 | 0.3923 | 0.257096 |
| claude-v1 | 0.4612 | 2.491849 |
| claude-v2 | 0.5111 | 2.611772 |
| gpt-3.5-turbo-1106 | 0.5842 | 0.300727 |
| gpt-4-1106-preview | 0.7091 | 3.371482 |
| Mean Regret | P95 Regret | Win Rate | Avg Cost Delta on Wins |
|---|---|---|---|
| 0.201801 | 0.486364 | 2.3% | 0.000000 |
Regret computed at best WTP=0.001