Journal Article
Machine Learning

Federated learning for predicting clinical outcomes in patients with COVID-19

Ittai Dayan(Harvard University), Holger R. Roth(Nvidia (United States)), Aoxiao Zhong(Harvard University), Ahmed Harouni(Nvidia (United States)), Amilcare Gentili, Anas Z. Abidin(Nvidia (United States)), Andy Liu(Nvidia (United States)), Anthony Costa(Icahn School of Medicine at Mount Sinai), Bradford J. Wood(National Institutes of Health), Chien‐Sung Tsai(Tri-Service General Hospital), Chih‐Hung Wang(Tri-Service General Hospital), Chun‐Nan Hsu(Tri-Service General Hospital), C. K. Lee(Tri-Service General Hospital), Peiying Ruan(Nvidia (United States)), Daguang Xu(Nvidia (United States)), Dufan Wu(Harvard University), Eddie Huang(Nvidia (United States)), Felipe Kitamura(DASA (Brazil)), Griffin Lacey(Nvidia (United States)), Gustavo César de Antônio Corradi(DASA (Brazil)), Gustavo Niño(Children's National), Hao-Hsin Shin(Memorial Sloan Kettering Cancer Center), Hirofumi Obinata(Self-Defense Forces Central Hospital), Hui Ren(Harvard University), Jason C. Crane(University of California, San Francisco), Jesse Tetreault(Nvidia (United States)), Jiahui Guan(Nvidia (United States)), John W. Garrett(University of Wisconsin–Madison), Joshua Kaggie(University of Cambridge), Jung Gil Park(Yeungnam University College), Keith J. Dreyer(Harvard University), Krishna Juluru(Memorial Sloan Kettering Cancer Center), Kristopher Kersten(Nvidia (United States)), Marcio Aloísio Bezerra Cavalcanti Rockenbach, Marius George Linguraru(Children's National), Masoom A. Haider(University of Toronto), Meena AbdelMaseeh(Lunenfeld-Tanenbaum Research Institute), Nicola Rieke(Nvidia (United States)), Pablo F. Damasceno(University of California, San Francisco), Pedro Mário Cruz e Silva(Nvidia (United States)), Po‐Chuan Wang(National Taiwan University), Sheng Xu(National Institutes of Health), Shuichi Kawano(Self-Defense Forces Central Hospital), Sira Sriswasdi(Chulalongkorn University), Soo Young Park(Kyungpook National University), Thomas M. Grist(University of Wisconsin–Madison), Varun Buch, Watsamon Jantarabenjakul(Chulalongkorn University), Weichung Wang(National Taiwan University), Won Young Tak(Kyungpook National University), Xiang Li(Harvard University), Xihong Lin(Harvard University), Young Joon Kwon(Icahn School of Medicine at Mount Sinai), Abood Quraini(Nvidia (United States)), Andrew Feng(Nvidia (United States)), Andrew N. Priest(University of Cambridge), Barış Türkbey(National Institutes of Health), Benjamin S. Glicksberg(Icahn School of Medicine at Mount Sinai), Bernardo C. Bizzo, Byung Seok Kim(Daegu Catholic University), Carlos Tor-Díez(Children's National), Chia‐Cheng Lee(Tri-Service General Hospital), Chia‐Jung Hsu(Tri-Service General Hospital), Chin Lin(National Defense Medical Center), Chiu-Ling Lai, Christopher P. Hess(University of California, San Francisco), Colin B. Compas(Nvidia (United States)), Deepeksha Bhatia(Nvidia (United States)), Eric K. Oermann(New York University), Evan Leibovitz, Hisashi Sasaki(Self-Defense Forces Central Hospital), Hitoshi Mori(Self-Defense Forces Central Hospital), Isaac Yang(Nvidia (United States)), Jae Ho Sohn(University of California, San Francisco), Krishna Nand Keshava Murthy(Memorial Sloan Kettering Cancer Center), Li‐Chen Fu(National Taiwan University), Matheus R. F. Mendonça(DASA (Brazil)), Mike Fralick(Sinai Health System), Min Kyu Kang(Yeungnam University College), Mohammad Adil(Nvidia (United States)), Natalie Gangai(Memorial Sloan Kettering Cancer Center), Peerapon Vateekul(Chulalongkorn University), Pierre Elnajjar(Memorial Sloan Kettering Cancer Center), Sarah Hickman(University of Cambridge), Sharmila Majumdar(University of California, San Francisco), Shelley McLeod(University of Toronto), Sheridan Reed(National Institutes of Health), Stefan Gräf(University of Cambridge), Stephanie A. Harmon(National Institutes of Health), Tatsuya Kodama(Self-Defense Forces Central Hospital), Thanyawee Puthanakit(Chulalongkorn University), Tony Mazzulli(University Health Network), Vitor Lima de Lavor(DASA (Brazil)), Yothin Rakvongthai(Chulalongkorn University), Yu Rim Lee(Kyungpook National University), Yuhong Wen(Nvidia (United States)), Fiona J. Gilbert(University of Cambridge), Mona G. Flores(Nvidia (United States)), Quanzheng Li(Harvard University)
September 15, 2021Nature Medicine741 citations

741

Citations

26

Influential Citations

Nature Medicine

Venue

2021

Year

Abstract

Federated learning (FL) is a method used for training artificial intelligence models with data from multiple sources while maintaining data anonymity, thus removing many barriers to data sharing. Here we used data from 20 institutes across the globe to train a FL model, called EXAM (electronic medical record (EMR) chest X-ray AI model), that predicts the future oxygen requirements of symptomatic patients with COVID-19 using inputs of vital signs, laboratory data and chest X-rays. EXAM achieved an average area under the curve (AUC) >0.92 for predicting outcomes at 24 and 72 h from the time of initial presentation to the emergency room, and it provided 16% improvement in average AUC measured across all participating sites and an average increase in generalizability of 38% when compared with models trained at a single site using that site's data. For prediction of mechanical ventilation treatment or death at 24 h at the largest independent test site, EXAM achieved a sensitivity of 0.950 and specificity of 0.882. In this study, FL facilitated rapid data science collaboration without data exchange and generated a model that generalized across heterogeneous, unharmonized datasets for prediction of clinical outcomes in patients with COVID-19, setting the stage for the broader use of FL in healthcare.

Analysis

Why This Paper Matters

This paper is a landmark demonstration of federated learning (FL) in a real-world, multi-institutional healthcare setting during the COVID-19 pandemic. It directly addresses a critical barrier in medical AI: the inability to share sensitive patient data across institutions due to privacy regulations and ethical concerns. By showing that a model trained across 20 global sites can outperform any single-site model, the authors provide compelling evidence that FL can unlock the power of diverse, large-scale datasets without compromising patient privacy. The rapid deployment and strong results (AUC >0.92) highlight FL's potential to accelerate AI development in urgent clinical scenarios.

Moreover, the paper tackles a clinically meaningful task—predicting oxygen requirements in COVID-19 patients—which has direct implications for resource allocation and triage. The use of heterogeneous, unharmonized data from different countries and healthcare systems makes the findings particularly robust and generalizable. This work serves as a blueprint for future FL studies in healthcare, demonstrating that collaborative AI can be both practical and impactful.

Technical Contributions

  • Federated Learning Framework: The authors implemented a FL system that trains a deep learning model across 20 sites without centralizing data, using a secure aggregation protocol to update a global model.
  • Multimodal Input Fusion: EXAM integrates vital signs, laboratory values, and chest X-ray images into a single predictive model, leveraging both structured and unstructured data.
  • Generalization Across Heterogeneous Data: The model was tested on data from multiple institutions with different equipment, populations, and clinical practices, showing robust performance without site-specific fine-tuning.
  • Privacy-Preserving Collaboration: The FL approach eliminates the need for data sharing, addressing legal, ethical, and logistical barriers that typically hinder multi-site studies.

Results

  • EXAM achieved an average AUC >0.92 for predicting oxygen requirements at 24 and 72 hours from emergency room presentation.
  • Compared to models trained at a single site, EXAM provided a 16% improvement in average AUC across all sites and a 38% increase in generalizability.
  • At the largest independent test site, the model achieved sensitivity of 0.950 and specificity of 0.882 for predicting mechanical ventilation or death at 24 hours.
  • These results were obtained using data from 20 institutions across multiple continents, demonstrating the model's ability to generalize across diverse populations and clinical settings.

Significance

This paper has broad implications for the AI field, particularly in healthcare. It validates federated learning as a viable paradigm for training high-performance models on sensitive data, opening the door to large-scale collaborations that were previously infeasible. The success of EXAM suggests that FL can be applied to other clinical prediction tasks, such as disease diagnosis, treatment planning, and prognosis, using electronic health records and medical imaging. Furthermore, the study provides a practical framework for deploying FL in real-world settings, including handling data heterogeneity, ensuring model convergence, and maintaining privacy. As AI becomes more integrated into clinical workflows, FL offers a path to develop models that are both accurate and respectful of patient privacy, potentially transforming how medical AI is developed and deployed globally.