Vision-language and multimodal: research map
Multimodal LLMs, CLIP-style models, VQA and embodied tasks.
7,482 accepted papers at ICML, NeurIPS, ICLR, CVPR and AAAI (2016–2026), in 6 topics. Within all five venues, its share grew from 6.0% in 2023–24 to 10.5% in 2025–26 (1,587 → 4,783 papers at ICML, NeurIPS, CVPR and AAAI, the venues with data for all four years).
Explore Vision-language and multimodal in the interactive map
Topics
- Multimodal LLMs · 2,371 papers
VLM capability analysis, Chain-of-thought multimodal reasoning, Multimodal LLM benchmarks - Human and embodied modeling · 1,673 papers
Scene graph generation, Language-grounded scene text and structure, Multimodal retrieval-augmented modeling - Cross-modal learning · 1,303 papers
Multimodal fusion with missing modalities, Multi-modality image fusion, Medical multimodal fusion - CLIP and zero-shot · 959 papers
Open-vocabulary alignment from VLMs, Attribute-based zero-shot learning, Adapting VLMs for zero-shot classification - Robot action and navigation · 630 papers
Vision-language-action foundation models, Memory and subgoal-based manipulation, Embodied multimodal LLM agents - Visual question answering · 546 papers
Universal VQA models, Attention and prior-robust VQA, Vision-language model VQA evaluation
Most cited papers in Vision-language and multimodal
- Deep contextualized word representations (ICLR 2018 · 12,263 citations)
- Learning Transferable Visual Models From Natural Language Supervision (ICML 2021 · 5,285 citations)
- Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering (CVPR 2018 · 5,159 citations)
- Making the v in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering (CVPR 2017 · 2,316 citations)
- Stacked Attention Networks for Image Question Answering (CVPR 2016 · 2,094 citations)
- CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning (CVPR 2017 · 1,831 citations)
- Image Captioning With Semantic Attention (CVPR 2016 · 1,739 citations)
- Conditional Prompt Learning for Vision-Language Models (CVPR 2022 · 1,735 citations)
- Knowing When to Look: Adaptive Attention via a Visual Sentinel for Image Captioning (CVPR 2017 · 1,734 citations)
- Improved Baselines with Visual Instruction Tuning (CVPR 2024 · 1,490 citations)
- Visual Instruction Tuning (NeurIPS 2023 · 1,198 citations)
- Vision-and-Language Navigation: Interpreting Visually-Grounded Navigation Instructions in Real Environments (CVPR 2018 · 1,195 citations)
