MedCAR: Conflict-Aware Multi-Agent Reasoning for Multimodal Clinical AI
Abstract
Multimodal generative AI transforms healthcare by integrating radiology images, pathology data, EHRs, and clinical reports for unified decision support. Modern systems use LLM-driven multi-agent frameworks with tools such as diagnostic predictors, segmentation models, VQA modules, and report generators for complex clinical reasoning. However, cross-modal conflicts (inconsistent diagnoses, implausible segmentations, and contradictory reports) reduce reliability and trust. We propose \textbf{MedCAR} (\textbf{Med}ical \textbf{C}onflict-\textbf{A}ware \textbf{R}easoner), a conflict-aware multi-agent framework with: (1) probabilistic-semantic conflict detection via neural entailment, (2) Graph-Based Anatomical Consistency Learning (GACL), and (3) bipolar weighted argumentation with adaptive trust calibration and abstention. We also introduce \textbf{ChestAgentBench-X}, a benchmark of 503 multimodal chest X-ray cases with tool-level conflicts. MedCAR achieves 58.57\% overall accuracy on ChestAgentBench-X, outperforming the strongest baseline (54.47\%), and 71.8\% overall accuracy on the larger 2,500-question ChestAgentBench, outperforming GPT-4o and MedRAX. These results highlight conflict-aware reasoning as key for reliable multimodal clinical AI.