Papers
Docopilot: Improving Multimodal Models for Document-Level Understanding
Yuchen Duan, Zhe Chen, Yusong Hu et al.
Doc-React: Multi-page Heterogeneous Document Question-answering
Junda Wu, Yu Xia, Tong Yu et al.
DocReRank: Single-Page Hard Negative Query Generation for Training Multi-Modal RAG Rerankers
Navve Wasserman, Oliver Heinimann, Yuval Golbari et al.
DocSAM: Unified Document Image Segmentation via Query Decomposition and Heterogeneous Mixed Learning
Xiao-Hui Li, Fei Yin, Cheng-Lin Liu
DocSpiral: A Platform for Integrated Assistive Document Annotation through Human-in-the-Spiral
Qiang Sun, Sirui Li, Tingting Bi et al.
DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models
Zeping Min, Xinshang Wang
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
Wenwen Yu, Zhibo Yang, Yuliang Liu et al.
DocTTT: Test-Time Training for Handwritten Document Recognition using Meta-Auxiliary Learning
Wenhao Gu, Li Gu, Ziqiang Wang et al.
Documentation Retrieval Improves Planning Language Generation
Renxiang Wang, Li Zhang
Documentation Retrieval Improves Planning Language Generation
Renxiang Wang, Li Zhang
Document Attribution: Examining Citation Relationships using Large Language Models
Vipula Rawte, Ryan A. Rossi, Franck Dernoncourt et al.
Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ Documents
Jun Chen, Dannong Xu, Junjie Fei et al.
Document-Level Event-Argument Data Augmentation for Challenging Role Types
Joseph Gatto, Omar Sharif, Parker Seegmiller et al.
Document-Level Relation Extraction with Global Relations and Entity Pair Reasoning
Fu Zhang, Yi Yan, Jingwei Cheng
Document-level Simplification and Illustration Generation Multimodal Coherence
Yuhang Liu, Mo Zhang, Zhaoyi Cheng et al.
Document Segmentation Matters for Retrieval-Augmented Generation
Zhitong Wang, Cheng Gao, Chaojun Xiao et al.
Do Current Video LLMs Have Strong OCR Abilities? A Preliminary Study
Yulin Fei, Yuhui Gao, Xingyuan Xian et al.
DocVLM: Make Your VLM an Efficient Reader
Mor Shpigel Nacson, Aviad Aberdam, Roy Ganz et al.
Do Deep Neural Network Solutions Form a Star Domain?
Ankit Sonthalia, Alexander Rubinstein, Ehsan Abbasnejad et al.
DoDS-IITPKD:Submissions to the WMT25 Low-Resource Indic Language Translation Task
Ontiwell Khongthaw, G.l. Salvin, Shrikant Budde et al.
Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
Boshen Xu, Ziheng Wang, Yang Du et al.
Do Emotions Really Affect Argument Convincingness? A Dynamic Approach with LLM-based Manipulation Checks
Yanran Chen, Steffen Eger
Does Acceleration Cause Hidden Instability in Vision Language Models? Uncovering Instance-Level Divergence Through a Large-Scale Empirical Study
Yizheng Sun, Hao Li, Chang Xu et al.
Does a code-switching dialogue system help users learn conversational fluency in Choctaw?
Jacqueline Brixey, David Traum