Llava-cot: Let vision language models reason step-by-step
Unknown
This paper introduces a chain-of-thought prompting method for vision-language models, enabling them to reason step-by-step over visual inputs to improve performance on complex visual reasoning tasks.