Release Date: Mar 5, 2026

Developer OpenAIย ๐Ÿ‡บ๐Ÿ‡ธ
Context Window 1M
Max Output Tokens 128k
Token Costs (in/out) $2.50/15.00
Weights Private
Input Modalities

Accuracy

61.72 %

Avg. Cost (In/Out)

$ 2.50 / $ 15.00

Latency

15 min 22 s

Vals Index
BenchmarksAccuracyRankings

0.0%

ยฑ4.11
21/57

0.0%

ยฑ5.65
9/24

0.0%

ยฑ2.15
44/90

0.0%

ยฑ3.32
55/92

0.0%

ยฑ0.92
17/98

0.0%

ยฑ3.12
40/80

0.0%

ยฑ0.87
44/145

0.0%

ยฑ4.84
25/93

0.0%

ยฑ1.91
21/138

0.0%

ยฑ9.87
6/62

0.0%

ยฑ1.04
41/143

0.0%

ยฑ0.41
13/142

0.0%

ยฑ0.42
27/138

0.0%

ยฑ0.80
15/93

0.0%

ยฑ0.00
23/45

0.0%

ยฑ4.72
18/33

0.0%

ยฑ1.85
30/88
Proprietary BenchmarksAcademic BenchmarksIndustry Partners
Vals
Default Provider : OpenAI
Temperature: Default
Top P: Default
Top K: Default
Max Output Tokens: 128,000
Reasoning Effort: xhigh

Updates

Mar 5, 2026

We evaluated GPT 5.4 (xhigh) across our full benchmark suite.

Evaluations were run via the official OpenAI API using โ€œxhighโ€ reasoning, except on Terminal-Bench 2.0, where we used โ€œhighโ€.