Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility
Mohsen Hariri, Weicong Chen, Nahal Shahini, et al.
This paper formalizes test-time scaling in reasoning LLMs into three structural regimes and proposes evaluation principles, reproducibility requirements, and a large dataset of reasoning traces.