ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward
Unknown
ProcessThinker enhances multi-modal large language models' reasoning via rollout-based process reward, improving step-level feedback for test-time scaling.