Public Calibration
Valuation & Financial Modeling
Kaelum Bench · FMB-FIN-VAL-01
This view covers the concrete 60-task suite only. Its provisional 600-point score uses deterministic verification only. It exposes sanitized score, execution, token, and cost aggregates, with no prompts, responses, expected solutions, task IDs, provider generation IDs, keys, rationales, digests, or file paths.
Valuation & Financial Modeling · 60-task sub-benchmark
Calibration results
Sanitized lifecycle, coverage, score, token, and cost aggregates for FMB-FIN-VAL-01. Results are provisional and specific to the recorded model configuration.
- Sub-benchmark
- Valuation & Financial Modeling · FMB-FIN-VAL-01
- Models
- 9 calibration runs
- Coverage
- 60 tasks per model
- Deterministic
- 600 deterministic points
Execution detail
Model runs
Provisional deterministic results use deterministic verification only.
Provisional · Configuration-specific calibration · Single runs; no statistical ranking.
60 / 60
98.3%
590.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
118,456
$0.7013
60 / 60
100.0%
600.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
214,531
$1.44
60 / 60
95.0%
570.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
88,601
$0.6096
60 / 60
86.7%
520.0 / 600
59 valid answers
1 invalid JSON response
0 provider failures
232,493
$0.2001
60 / 60
31.7%
190.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
54,015
$0.045
together · high reasoning
nemotron-3-ultra-550b-a55b — open run evidence
nvidia/nemotron-3-ultra-550b-a55b
60 / 60
40.0%
240.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
48,652
$0.06
60 / 60
31.7%
190.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
44,964
$0.0689
60 / 60
95.0%
570.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
198,697
$0.0472
60 / 60
75.0%
450.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
83,194
$0.2448