Recent Papers / arXiv:2602.10604

Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters

arXiv:2602.10604Submitted Feb 11, 202619 benchmark results

Authors pending

Tasks
edit
Results

19 results reproduced from this paper.

submit
Sorted instantly in-page
Results
17
SOTA rows
1
Models
3
Datasets
0
#ModelVendorBenchmarkValueSOTADateSource
01Step-3.5-Flash PaCoRe—AIME 202599.9%#1—source ↗
02Step-3.5-Flash—AIME 202597.3%——source ↗
03Step-3.5-Flash Base—HellaSwag90.2%——source ↗
04Step-3.5-Flash Base—BIG-Bench Hard88.2%——source ↗
05Step-3.5-Flash Base—GSM8K88.2%——source ↗
06Step-3.5-Flash—Tau2-Bench88.2%——source ↗
07Step-3.5-Flash Base—MMLU85.8%——source ↗
08Step-3.5-Flash PaCoRe—GPQA Diamond85.0%——source ↗
09Step-3.5-Flash—GPQA Diamond83.5%——source ↗
10Step-3.5-Flash Base—WinoGrande79.1%——source ↗
11Step-3.5-Flash—SWE-Bench Verified74.4%——source ↗
12Step-3.5-Flash Base—MATH66.8%——source ↗
13Step-3.5-Flash—BrowseComp51.6%——source ↗
14Step-3.5-Flash Base—GPQA Diamond41.7%——source ↗
15Step-3.5-Flash Base—SimpleQA31.6%——source ↗
16Step-3.5-Flash PaCoRe—HLE27.9%——source ↗
17Step-3.5-Flash—HLE23.1%——source ↗
CodeSOTA extraction

Benchmark evidence

edit

Link this paper to benchmark rows, datasets, model cards, and reproduced results as evidence is extracted.

§ 02 · Models

3 models from this paper.

evaluates
Step-3.5-Flash Base
—
evaluates
Step-3.5-Flash PaCoRe
—
evaluates
Step-3.5-Flash
—
Add or update benchmark results
Logged-in editor · benchmark trail
Log in is not configured in this environment.
Read next

Three places to go from here.

Index
All papers
All tracked papers in the registry, with benchmark result, model, and leaderboard linkage where available.
Replacement
Papers with Code is dead — alternatives
What replaced PWC for each use case: LLMs, OCR, speech, vision, robotics.
Top hub
LLM benchmarks
Every frontier LLM benchmark, scored.