Public Calibration
Capital Budgeting
Kaelum Bench · FMB-FIN-CAPBUD-01
This view covers the concrete 60-task suite only. Its provisional 600-point score uses deterministic verification only. It exposes sanitized score, execution, token, and cost aggregates, with no prompts, responses, expected solutions, task IDs, provider generation IDs, keys, rationales, digests, or file paths.
Capital Budgeting · 60-task sub-benchmark
Calibration results
Sanitized lifecycle, coverage, score, token, and cost aggregates for FMB-FIN-CAPBUD-01. Results are provisional and specific to the recorded model configuration.
- Sub-benchmark
- Capital Budgeting · FMB-FIN-CAPBUD-01
- Models
- 6 calibration runs
- Coverage
- 60 tasks per model
- Deterministic
- 600 deterministic points
Execution detail
Model runs
Provisional deterministic results use deterministic verification only.
Provisional · Configuration-specific calibration · Single runs; no statistical ranking.
together · high reasoning
nemotron-3-ultra-550b-a55b — open run evidence
nvidia/nemotron-3-ultra-550b-a55b
60 / 60
10.0%
60.0 / 600
58 valid answers
0 invalid JSON responses
0 provider failures
66,532
$0.0722
60 / 60
58.3%
350.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
182,945
$0.7665
60 / 60
11.7%
70.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
62,004
$0.0945
60 / 60
10.0%
60.0 / 600
59 valid answers
0 invalid JSON responses
0 provider failures
72,055
$0.0587
60 / 60
55.0%
330.0 / 600
47 valid answers
13 invalid JSON responses
0 provider failures
203,154
$1.31
60 / 60
86.7%
520.0 / 600
60 valid answers
0 invalid JSON responses
0 provider failures
193,669
$1.89