Evaluation Dashboards
← Evaluator
ℹ️ About
Initial Screening
Mission Assignment
Deep Space
▶ Run Evaluation
📁 Load past run…
Funnel Overview
AI–Human Alignment
Routing Intelligence
Score Distribution
Risk Signals
Reviewer Performance
Total evaluated
—
awaiting run
Approved
—
Waitlisted
—
Declined
—
AI–Human agreement
—
Decision funnel
live
⏳
Run evaluation to see funnel
Outcome distribution
No data.
Routing breakdown
No data.
Score distribution
approve ≥70 · waitlist 50–69 · decline <50
No data.
AI confidence vs score
colored by final outcome
No data.
Cases reviewed by human
—
Agreement rate
—
Disagreements
—
Avg score adjustment
—
AI score vs human-adjusted score
⬤ agree ⬤ disagree
No data.
AI recommendation vs final outcome
No data.
Disagreement cases
Auto Decision
—
Parallel Review
—
Escalation
—
Senior Adjudication
—
Cases per routing tier
No data.
Avg score & avg composite risk per tier
No data.
Outcome distribution per routing tier
No data.
Mean score
—
out of 100
Median score
—
50th percentile
Near-cutoff cases
—
within ±5 pts of 50 or 70
Score std dev
—
spread of scores
Score histogram
stacked by outcome · approve ≥70 · waitlist 50–69
No data.
Avg rubric dimension scores
each dimension 0–25
No data.
Score by confidence level
No data.
Rubric dimension breakdown per outcome
No data.
Avg composite risk
—
0 = low · 1 = high
High-risk cases
—
composite risk > 0.6
Near-cutoff cases
—
within ±5 pts of boundary
Evidence mismatches
—
score ≠ narrative signal
Sensitivity vs disagreement score
bubble = composite risk · color = routing
No data.
↖ Low sensitivity, high disagreement
↗ High sensitivity & disagreement → escalate
↙ Low risk → auto-decide
↘ High sensitivity, low disagreement
Composite risk distribution per routing tier
No data.
Rubric variance distribution
high variance = uneven dimension scores
No data.
Signal flags breakdown
Total human reviews
—
Active reviewers
—
unique reviewers
Drift flags
—
agreement rate < 60%
Largest avg adjustment
—
pts from AI score
Agreement rate per reviewer
No data.
Avg score adjustment per reviewer
+ = reviewer scores higher than AI
No data.
Reviewer summary