Knowledge or Reasoning
Juncheng Wu, Sheng Liu, Haoqin Tu, et al.
This paper introduces a fine-grained evaluation framework decomposing LLM reasoning into knowledge correctness and reasoning quality, revealing that SFT improves accuracy but degrades reasoning, while RL enhances medical reasoning by pruning inaccura