Papers
BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
Junnan Li, Dongxu Li, Caiming Xiong et al.
UniCLIP: Unified Framework for Contrastive Language-Image Pre-training
Janghyeon Lee, Jongsuk Kim, Hyounguk Shon et al.
CLIPDraw: Exploring Text-to-Drawing Synthesis through Language-Image Encoders
Kevin Frans, Lisa Soros, Olaf Witkowski
CyCLIP: Cyclic Contrastive Language-Image Pretraining
Shashank Goel, Hritik Bansal, Sumit Bhatia et al.
Multimodal Contrastive Learning with LIMoE: the Language-Image Mixture of Experts
Basil Mustafa, Carlos Riquelme, Joan Puigcerver et al.
Contrastive Language-Image Pre-Training with Knowledge Graphs
Xuran Pan, Tianzhu Ye, Dongchen Han et al.
RLIP: Relational Language-Image Pre-training for Human-Object Interaction Detection
Hangjie Yuan, Jianwen Jiang, Samuel Albanie et al.
Grounded Language-Image Pre-Training
Liunian Harold Li, Pengchuan Zhang, Haotian Zhang et al.
RegionCLIP: Region-Based Language-Image Pretraining
Yiwu Zhong, Jianwei Yang, Pengchuan Zhang et al.
RelCLIP: Adapting Language-Image Pretraining for Visual Relationship Detection via Relational Contrastive Learning
Yi Zhu, Zhaoqing Zhu, Bingqian Lin et al.
Utilizing Language-Image Pretraining for Efficient and Robust Bilingual Word Alignment
Tuan Dinh, Jy-yong Sohn, Shashank Rajput et al.
FILIP: Fine-grained Interactive Language-Image Pre-Training
Lewei Yao, Runhui Huang, Lu Hou et al.
Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm
Yangguang Li, Feng Liang, Lichen Zhao et al.