Public Calibration

Valuation & Financial Modeling

Kaelum Bench · FMB-FIN-VAL-01

This view covers the concrete 60-task suite only. Its provisional 600-point score uses deterministic verification only. It exposes sanitized score, execution, token, and cost aggregates, with no prompts, responses, expected solutions, task IDs, provider generation IDs, keys, rationales, digests, or file paths.

Provisional · Deterministic

Valuation & Financial Modeling · 60-task sub-benchmark

Calibration results

Sanitized lifecycle, coverage, score, token, and cost aggregates for FMB-FIN-VAL-01. Results are provisional and specific to the recorded model configuration.

Public Calibration
Sub-benchmark
Valuation & Financial Modeling · FMB-FIN-VAL-01
Models
9 calibration runs
Coverage
60 tasks per model
Deterministic
600 deterministic points

Execution detail

Model runs

Provisional deterministic results use deterministic verification only.

Provisional · Configuration-specific calibration · Single runs; no statistical ranking.

google-vertex/global · high reasoning

gemini-3.5-flash — open run evidence

google/gemini-3.5-flash

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

98.3%

590.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

118,456

Cost

$0.7013

azure/us-east-2 · max reasoning

claude-sonnet-5 — open run evidence

anthropic/claude-sonnet-5

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

100.0%

600.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

214,531

Cost

$1.44

moonshotai/int4 · max reasoning

kimi-k3 — open run evidence

moonshotai/kimi-k3

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

95.0%

570.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

88,601

Cost

$0.6096

akashml/fp8 · max reasoning

qwen3.6-35b-a3b — open run evidence

qwen/qwen3.6-35b-a3b

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

86.7%

520.0 / 600

Valid

59 valid answers

1 invalid JSON response

Provider

0 provider failures

Tokens

232,493

Cost

$0.2001

morph · max reasoning

minimax-m3 — open run evidence

minimax/minimax-m3

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

31.7%

190.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

54,015

Cost

$0.045

together · high reasoning

nemotron-3-ultra-550b-a55b — open run evidence

nvidia/nemotron-3-ultra-550b-a55b

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

40.0%

240.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

48,652

Cost

$0.06

together · xhigh reasoning

glm-5.2 — open run evidence

z-ai/glm-5.2

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

31.7%

190.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

44,964

Cost

$0.0689

alibaba · xhigh reasoning

deepseek-v4-flash — open run evidence

deepseek/deepseek-v4-flash

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

95.0%

570.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

198,697

Cost

$0.0472

xai · high reasoning

grok-4.5 — open run evidence

x-ai/grok-4.5

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

75.0%

450.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

83,194

Cost

$0.2448