conftrace
_
Papers
Trends
Conferences
Explore
More
Authors
Topics
Keywords
Insights
Papers
Trends
Conferences
Explore
Authors
Topics
Keywords
Insights
Achievements
Home
›
Keywords
›
vision-language model
vision-language model
2348 papers
Explore in graph
Also known as
VLM
VL MODEL
VLMS
Co-occurring keywords
multimodal learning
(4645)
zero-shot learning
(3650)
vision language model
(767)
contrastive learning
(4032)
large language model
(13587)
visual question answering
(1017)
transfer learning
(5449)
few-shot learning
(3398)
knowledge distillation
(3725)
semantic segmentation
(3186)
Papers
Unveiling the Invisible: Captioning Videos with Metaphors
EMNLP 2024
AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models
EMNLP 2024
Can Textual Unlearning Solve Cross-Modality Safety Alignment?
EMNLP 2024
VPL: Visual Proxy Learning Framework for Zero-Shot Medical Image Diagnosis
EMNLP 2024
BiasDora: Exploring Hidden Biased Associations in Vision-Language Models
EMNLP 2024
AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
EMNLP 2024
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
EMNLP 2024
Why do LLaVA Vision-Language Models Reply to Images in English?
EMNLP 2024
Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM
EMNLP 2024
Advancing Vision-Language Models with Adapter Ensemble Strategies
EMNLP 2024
RWKV-CLIP: A Robust Vision-Language Representation Learner
EMNLP 2024
Divide and Conquer Radiology Report Generation via Observation Level Fine-grained Pretraining and Prompt Tuning
EMNLP 2024
Efficient Vision-Language pre-training via domain-specific learning for human activities
EMNLP 2024
SignCLIP: Connecting Text and Sign Language by Contrastive Learning
EMNLP 2024
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
EMNLP 2024
Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
EMNLP 2024
FoodieQA: A Multimodal Dataset for Fine-Grained Understanding of Chinese Food Culture
EMNLP 2024
Training-free Deep Concept Injection Enables Language Models for Video Question Answering
EMNLP 2024
AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
EMNLP 2024
Text2Model: Text-based Model Induction for Zero-shot Image Classification
EMNLP 2024
M5 – A Diverse Benchmark to Assess the Performance of Large Multimodal Models Across Multilingual and Multicultural Vision-Language Tasks
EMNLP 2024
UniTabNet: Bridging Vision and Language Models for Enhanced Table Structure Recognition
EMNLP 2024
Is GPT-4V (ision) All You Need for Automating Academic Data Visualization? Exploring Vision-Language Models’ Capability in Reproducing Academic Charts
EMNLP 2024
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
EMNLP 2024
Multimodal Misinformation Detection by Learning from Synthetic Data with Multimodal LLMs
EMNLP 2024
<
1
…
55
56
57
…
94
>