LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
Yifan Dai ⋅ zhenhua wu ⋅ Bohan Zeng ⋅ Daili Hua ⋅ Jialing Liu ⋅ Bozhou Li ⋅ Yuran Wang ⋅ Chengzhuo Tong ⋅ Hao Liang ⋅ Xiaochen Ma ⋅ Junbo Niu ⋅ Tianyu Guo ⋅ Yang Shi ⋅ Yue Ding ⋅ Yiyan Ji ⋅ Bingyin Mei ⋅ Yushuo Guan ⋅ Yuanxing Zhang ⋅ Pengfei Wan ⋅ Fangcheng Fu ⋅ Wentao Zhang
Abstract
While joint audio-visual understanding is fundamental to advancing machine cognition, current multimodal large language models (MLLMs) still struggle with complex cross-modal reasoning. Existing text-based chain-of-thought (CoT) compresses rich multi-modal features into discrete text, incurring information loss and inducing a language-bound phenomenon that diminishes attention to audio-visual signals. In contrast, a continuous latent space inherently preserves dense representations, serving as an ideal carrier for audio-visual information. Motivated by this, we propose $\textbf{LatentOmni}$, a novel cross-modal reasoning framework. By introducing a feature-level supervision mechanism to directly reconstruct raw sensory inputs within the latent space, LatentOmni leverages native latent features to bridge audio-visual modalities and text, ensuring sustained attention on original audio-visual inputs throughout reasoning. Furthermore, to maintain temporal consistency across modalities in latent space, we design Omni-Sync Position Embedding (OSPE), which generalizes multimodal rotary position encodings to drive audio-visual synchrony. To supervise this reasoning process, we construct LatentOmni-Instruct-35K, a dataset interleaving text with audio-visual segments that serve as dense evidence for latent reconstruction. Comprehensive evaluation across multiple audio-visual reasoning benchmarks demonstrates that LatentOmni substantially outperforms strong explicit-CoT baselines, validating latent space joint reasoning as a promising path toward genuine omnimodal understanding.
Chat is not available.
Successful Page Load