Co-occurring keywords
Papers
VLTinT: Visual-Linguistic Transformer-in-Transformer for Coherent Video Paragraph Captioning
AAAI 2023
Video-Helpful Multimodal Machine Translation
EMNLP 2023
Panoptic Video Scene Graph Generation
CVPR 2023