ThinkPRM
Unknown
A generative PRM trained on small synthetic data outperforms discriminative PRMs and LLM-as-a-Judge baselines in step-by-step reasoning verification.
A comprehensive index of artificial intelligence and machine-learning research with AI-generated summaries, citation metrics, and direct links to papers and code.
Unknown
A generative PRM trained on small synthetic data outperforms discriminative PRMs and LLM-as-a-Judge baselines in step-by-step reasoning verification.
Rahul Raguram, Ondřej Chum, Marc Pollefeys, et al.
USAC extends RANSAC with a universal framework integrating advanced sampling, verification, and model refinement for robust estimation.
Unknown
A pipeline that generates system messages and aligned assistant responses for SFT datasets lacking them, using LLM-as-a-judge verification.
Unknown
Introduces Verifiable Process Reward Models (VPRMs), a reinforcement-learning framework that checks intermediate reasoning steps to improve structured reasoning beyond outcome verification.