Enhancing Non-Reasoning Models with Reasoning Models
Haotian Wang, Han Zhao, Shuaiting Chen, et al.
This paper proposes using outputs from reasoning-intensive LLMs to improve non-reasoning models via supervised fine-tuning, showing consistent benchmark gains.