Preprint2024
LearnLM
Unknown
LearnLM enhances Gemini for pedagogical instruction by co-training SFT and RLHF, outperforming leading LLMs in tutoring scenarios.
0Dec 1, 2024Fine TuningReinforcement Learning
arXiv
A comprehensive index of artificial intelligence and machine-learning research with AI-generated summaries, citation metrics, and direct links to papers and code.
Unknown
LearnLM enhances Gemini for pedagogical instruction by co-training SFT and RLHF, outperforming leading LLMs in tutoring scenarios.
Unknown
This paper proposes Double-Helix Co-Training, a method that iteratively improves a computer-use agent generator and an LLM-based verifier to provide accurate reward signals for reinforcement learning.