Co-occurring keywords
Papers
TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration
EMNLP 2025
POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversion
EMNLP 2025
COCO-Tree: Compositional Hierarchical Concept Trees for Enhanced Reasoning in Vision-Language Models
EMNLP 2025
ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering
EMNLP 2025
End-to-End Optimization for Multimodal Retrieval-Augmented Generation via Reward Backpropagation
EMNLP 2025
ProPy: Building Interactive Prompt Pyramids upon CLIP for Partially Relevant Video Retrieval
EMNLP 2025
One More Modality: Does Abstract Meaning Representation Benefit Visual Question Answering?
EMNLP 2025