Co-occurring keywords
Papers
Panoptic Video Scene Graph Generation
CVPR 2023
Collaborative Static and Dynamic Vision-Language Streams for Spatio-Temporal Video Grounding
CVPR 2023
VLTinT: Visual-Linguistic Transformer-in-Transformer for Coherent Video Paragraph Captioning
AAAI 2023
Towards Parameter-Efficient Integration of Pre-Trained Language Models In Temporal Video Grounding
ACL 2023