Test Bench

Execute KPI tests · Score results · Verify evidence

LIVEBUILT · LIVE
Total Runs
3
Pass
1
Hold
1
Fail / Critical
1

Model Price Cards

LIVE
gpt-4o
$0.0025/1k in·$0.01/1k out
v3.0CURRENT
gpt-4o-mini
$0.00015/1k in·$0.0006/1k out
v3.0CURRENT
claude-3-5-sonnet
$0.003/1k in·$0.015/1k out
v3.0CURRENT
claude-3-haiku
$0.00025/1k in·$0.00125/1k out
v3.0CURRENT
gemini-1.5-pro
$0.00125/1k in·$0.005/1k out
v3.0CURRENT

Run History

LIVE

KPI Test Library

LIVE(6 active tests)
Alignment Score BaselineDET
Measures alignment against the active baseline threshold.
pass ≥ 95critical < 80
Failure Pressure GateDET
Computes failure pressure index and checks against baseline ceiling. Exceeding ceiling triggers HOLD.
pass ≥ 20critical < 40
Latency SLA CheckDET
Measures p95 latency against the baseline latency ceiling.
pass ≥ 600
Cost Per Run CeilingDET
Validates that token cost does not exceed the charter cost ceiling.
pass ≥ 0.25
Output Quality — Human RubricHUM
Human reviewer scores output on accuracy, completeness, and policy compliance (1–5 scale).
pass ≥ 4critical < 2
Policy Compliance — AI EvaluatorAI
Secondary AI model evaluates output against governing policy ruleset. Requires independent model.
pass ≥ 0.9critical < 0.6