Preprint2022
Measuring progress on scalable oversight for large language models
Unknown
This paper outlines a research paradigm for scalable oversight of large language models, based on Cotra's sandwiching approach, to improve model reliability.
0Nov 1, 2022Large Language Models
arXiv