Missing Data Imputation in RWD Exploration of Multiple Techniques on Open-Source Data

Missing Data Imputation in RWD Exploration of Multiple Techniques on Open-Source Data

Project Description 

This project aims to evaluate and compare multiple missing data imputation methods for real-world data (RWD) using a single open-source simulated dataset (Synthea). The goal is to produce a white paper assessing the strengths, limitations and efficiency of different techniques across varying missing data scenarios. 

Handling missing data is critical to ensuring RWD is fit to generate reliable real-world evidence (RWE) and meet regulatory expectations, as outlined in ICH E9 and FDA guidance. However, practical guidance on selecting appropriate imputation strategies remains limited. 

By systematically comparing models, this project will provide clear, evidence-based recommendations on which approaches are best suited to different types of missingness. It will also identify key challenges and limitations in current methods. The use of open-source tools ensures accessibility and cost-effectiveness, supporting broader industry adoption and improved data quality for regulatory submissions. 

Project Leads

Email

Project Leads

Email

Aren Ghulijanyan, BioBrain

aren201104@gmail.com

Likhita Kolli, GSK

likhita.x.kolli@gsk.com

Marieta Voskanyan, BioBrain

marieta.voskanyan.2811@gmail.com

Tuhin James Paul, ISF College of Pharmacy

tuhinjamespaul@gmail.com

Nicola Newton, PHUSE Project Coordinator

nicky@phuse.global 

Click above for the latest project status.​​