Public Calibration

Capital Budgeting

Kaelum Bench · FMB-FIN-CAPBUD-01

This view covers the concrete 60-task suite only. Its provisional 600-point score uses deterministic verification only. It exposes sanitized score, execution, token, and cost aggregates, with no prompts, responses, expected solutions, task IDs, provider generation IDs, keys, rationales, digests, or file paths.

Provisional · Deterministic

Capital Budgeting · 60-task sub-benchmark

Calibration results

Sanitized lifecycle, coverage, score, token, and cost aggregates for FMB-FIN-CAPBUD-01. Results are provisional and specific to the recorded model configuration.

Public Calibration
Sub-benchmark
Capital Budgeting · FMB-FIN-CAPBUD-01
Models
6 calibration runs
Coverage
60 tasks per model
Deterministic
600 deterministic points

Execution detail

Model runs

Provisional deterministic results use deterministic verification only.

Provisional · Configuration-specific calibration · Single runs; no statistical ranking.

together · high reasoning

nemotron-3-ultra-550b-a55b — open run evidence

nvidia/nemotron-3-ultra-550b-a55b

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

10.0%

60.0 / 600

Valid

58 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

66,532

Cost

$0.0722

xai · high reasoning

grok-4.5 — open run evidence

x-ai/grok-4.5

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

58.3%

350.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

182,945

Cost

$0.7665

together · xhigh reasoning

glm-5.2 — open run evidence

z-ai/glm-5.2

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

11.7%

70.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

62,004

Cost

$0.0945

morph · max reasoning

minimax-m3 — open run evidence

minimax/minimax-m3

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

10.0%

60.0 / 600

Valid

59 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

72,055

Cost

$0.0587

google-vertex/global · high reasoning

gemini-3.5-flash — open run evidence

google/gemini-3.5-flash

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

55.0%

330.0 / 600

Valid

47 valid answers

13 invalid JSON responses

Provider

0 provider failures

Tokens

203,154

Cost

$1.31

moonshotai/int4 · max reasoning

kimi-k3 — open run evidence

moonshotai/kimi-k3

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

86.7%

520.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

193,669

Cost

$1.89