Co-occurring keywords
Papers
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
NIPS 2024
MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens
NIPS 2024
VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought
NIPS 2024
Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification
CVPR 2024
ViLa-MIL: Dual-scale Vision-Language Multiple Instance Learning for Whole Slide Image Classification
CVPR 2024