Evaluation of large language models’ ability to identify clinically relevant drug-drug interactions and generate high-quality clinical pharmacotherapy recommendations
Aaron Chase, Amoreena Most, Andrea Sikora, et al.
This study evaluates GPT-4, Gemini 1.5, and Claude 3 on identifying drug-drug interactions and generating clinical recommendations, finding high identification rates but variable recommendation quality and potential harm.