Multimodal Information Fusion Strategies for Biomedical Data Analysis
Multimodal biomedical data, including medical images, electronic health records, multi-omics data, and physiological signals, hold immense potential for improving clinical decision-making when integrated effectively. This paper presents a systematic review of 36 peer-reviewed studies published between 1997 and 2025 that address fusion strategies for multimodal data, with primary focus on biomedical applications. The five-level fusion taxonomy is proposed covering early fusion at the data level, intermediate fusion at the feature level, late fusion at the decision level, attention-based fusion, and adaptive fusion. This study provides a comparative analysis of their design trade-offs, interaction capabilities across modalities, missing modality handling, and reported performance in clinical applications. To empirically validate the proposed taxonomy, a comparative experiment is conducted on the VQA-RAD medical visual question answering dataset, evaluating nine representative methods spanning all five fusion categories. The results indicate that adaptive fusion achieves the highest performance and demonstrates robustness under partial image degradation conditions. The key open challenges include multimodal alignment, robustness to missing modalities, explainability, and computational efficiency. Future research directions are focused on adaptive fusion with uncertainty-calibrated fusion for clinical deployment.