Compitum Test & Benchmark Report

Generated 2026-07-21 21:32 UTC

Overview

This report summarizes Compitum's test and benchmark results alongside common baselines.

Charts: bars include Compitum (blue/green) and baselines (gray). The scatter shows average cost vs performance for all models.

Topline Takeaways

Coverage: win-rate denominator = 86 evals; Compitum evals at this WTP = 86.

Unit Tests

(skipped)

Exit code: N/A

Step Status

StepReturn CodeTimed OutDuration (s)Timeout Cap (s)
Unit TestsN/A
RouterBenchN/A
Compitum0NO591.044900

Full machine-readable log stored alongside this report as JSON.

RouterBench Artifacts

Compitum Artifacts

Average Performance
Average Cost
Mean Regret
Avg Cost vs Performance

Numerical Summary

ModelAvg PerformanceAvg Total Cost
compitum0.51112.611772
claude-instant-v10.39230.257096
claude-v10.46122.491849
claude-v20.51112.611772
gpt-3.5-turbo-11060.58420.300727
gpt-4-1106-preview0.70913.371482

Regret & Wins (WTP-selected)

Mean RegretP95 RegretWin RateAvg Cost Delta on Wins
0.201801 0.486364 2.3% 0.000000

Regret computed at best WTP=0.001

Glossary