Multimodal Fusion & Multi-Task Learning
Systematic Robustness Benchmarking of Incomplete Multimodal Learning Under Non-Random and Structured Missingness
Generated automatically from the limitations stated in 9 papers (ICML, CVPR, ICCV), listed under Evidence. It is not a paper, and it does not come from papers submitted to CSPaper.
The problem
Existing multimodal learning methods designed for missing data are predominantly evaluated under Missing at Random (MAR) or uniform independent drop assumptions, often requiring fully complete training data. In practical applications like clinical diagnostics and robotics, missingness is frequently structured, correlated across sensors, or Missing Not at Random (MNAR) due to cost or clinical decisions. Because existing literature only tests idealized missingness or uses simple mean imputation fallbacks, practitioners cannot determine whether current alignment, distillation, or generative imputation methods generalize to realistic incomplete data regimes.
Why it matters
Provides the first empirical failure-mode taxonomy and realistic benchmark for multimodal learning under non-random and incomplete training conditions. This enables researchers to develop methods validated against operational missingness rather than synthetic MAR artifacts.
Ways to approach it
Prior-work checks are free with an account. Results someone already ran are shown to everyone.
- 1
Standardized Missingness Testbed: Formalize parameterized MNAR and structured missingness patterns (e.g., target-dependent dropout, correlated multi-sensor failure) on standard multimodal benchmarks (e.g., BraTS, MIMIC, Food-101) and measure task performance degradation (AUROC, Dice score, F1) across representative imputation, distillation, and gating baselines.
- 2
Natively Incomplete Training Assessment: Evaluate baseline methods under varying ratios of incomplete training data (from 10% to 90% missingness at train time) rather than testing missingness exclusively at inference; measure feature representation alignment and downstream accuracy.
- 3
Inference Latency vs. Imputation Fidelity Tradeoff: Profile inference compute time and memory footprint alongside task accuracy across generative (diffusion/GAN), deterministic mapping, and heuristic averaging strategies under severe and structured missingness.
Have a different approach?
Describe how you would tackle this problem and we'll look for papers that already do it. Free; your text stays private.
Why it might fail
If existing methods demonstrate invariant performance across MAR and non-random missingness patterns, the empirical value of the robustness study is diminished. Additionally, synthesizing realistic MNAR distributions without access to real-world deployment logs could limit the ecological validity of the synthetic benchmark.
Evidence
Each paper's own statement of the limitation, verbatim.
- MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing ModalityCVPR 2026
Inference with a missing modality takes ~879ms per patient (50 DDIM steps × 5 samples) vs ≤70ms with complete data
- AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt TuningICML 2026
The reconstruction-baseline comparison used only 30% modality-complete training data, which the authors note undermines the imputation alternative
- Unbiased Missing-modality Multimodal LearningICCV 2025
Training assumes all modalities are complete and missingness occurs only at inference, so it does not handle natively incomplete training data
- Deep Fuzzy Multi-view Learning for Reliable ClassificationICML 2025
Assumes complete multi-view data availability during inference and does not handle arbitrary missing modalities without explicit imputation.
- Cross-Modal Alignment via Variational Copula ModellingICML 2025
Assumes missing modalities are Missing at Random (MAR) with complete ground-truth downstream labels.
- Amplifying Prominent Representations in Multimodal Learning via Variational Dirichlet ProcessNeurIPS 2025
Imputation assumes missing-at-random (MAR); performance under non-random missingness is not evaluated, and alignment complexity grows substantially with number of modalities (authors note tri-modal alignment complexity increases drastically)
- Partial Multi-View Multi-Label Classification via Semantic Invariance Learning and Prototype ModelingICML 2024
Several baselines (C2AE, GLOCAL, CDMM, DM2L, LVSL) are not natively designed for the combined missing-view and partial-label setting and required modifications (mean imputation of views, treating unknown labels as negatives), which may inflate SIP's advantage
- Multimodality Invariant Learning for Multimedia-Based New Item RecommendationSIGIR 2024
Missing modalities are handled via simple mean imputation at inference; the method assumes missing patterns are random single-modality drops rather than structured or correlated missingness
Show all 9 papers
- Multi-Modal Learning With Missing Modality via Shared-Specific Feature ModellingCVPR 2023
Missing modality feature imputation relies on simple arithmetic averaging of available shared features, which fails if none of the available modalities capture the shared representation.
Nearest existing work
- SimMLM: A Simple Framework for Multi-modal Learning with Missing ModalityICCV 2025
- MM-Align: Learning Optimal Transport-based Alignment Dynamics for Fast and Accurate Inference on Missing Modality SequencesEMNLP 2022
- MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing ModalityCVPR 2026
- Probabilistic Conformal Distillation for Enhancing Missing Modality RobustnessNeurIPS 2024
- Inference-Time Dynamic Modality Selection for Incomplete Multimodal ClassificationICLR 2026
- Distilled Prompt Learning for Incomplete Multimodal Survival PredictionCVPR 2025
- Distribution-Consistent Modal Recovering for Incomplete Multimodal LearningICCV 2023
- Are Multimodal Transformers Robust to Missing Modality?CVPR 2022
- BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing RatesCVPR 2026
- Identifiable Generative models for Missing Not at Random Data ImputationNeurIPS 2021
- HyperImpute: Generalized Iterative Imputation with Automatic Model SelectionICML 2022
- MIWAE: Deep Generative Modelling and Imputation of Incomplete Data SetsICML 2019
- Unbiased Missing-modality Multimodal LearningICCV 2025
- Deep Generative Missingness Pattern-Set Mixture ModelsAISTATS 2021
- GAMIN: Generative Adversarial Multiple Imputation Network for Highly Missing DataCVPR 2020