Papers
Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models
Yifan Jia, Yuntao Du, Kailin Jiang et al.
Benchmarking Offensive Language Detection in Persian and Pashto
Zahra Bokaei, Bonnie Webber, Walid Magdy
Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
Manyi Zhang, Ji-Fu Li, Zhongao Sun et al.
Benchmarking Temporal Reasoning and Alignment Across Chinese Dynasties
Zhenglin Wang, Jialong Wu, Pengfei Li et al.
Benchmarking Testing in Automated Theorem Proving
Jongyoon Kim, Hojae Han, Seung-Won Hwang
Benchmarking the Energy Savings with Speculative Decoding Strategies
Rohit Dutta, Paramita Koley, Soham Poddar et al.
Benchmarking the Reproducibility of Brain Tissue Segmentation Across MRI Scanners
Ekaterina Kondrateva, Abdalla Z Mohamed, Sandzhi Barg et al.
Benchmarking Trustworthiness in Multimodal LLMs for Video Understanding
Youze Wang, Zijun Chen, Ruoyu Chen et al.
Benchmarking Visual LLMs Resilience to Unanswerable Questions on Visually Rich Documents
Davide Napolitano, Luca Cagliero, Fabrizio Battiloro
Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
Zijing Shi, Meng Fang, Ling Chen
Benchmarking XAI Explanations with Human-Aligned Evaluations
Rémi Kazmierczak, Steve Azzolin, Eloïse Berthier et al.
BERT, are you paying attention? Attention regularization with human-annotated rationales
Elize Herrewijnen, Dong Nguyen, Floris Bex et al.
Best Arm Identification with Biased Contexts
James Cheshire, Stephan Clémençon
Best-Effort Policies for Robust Markov Decision Processes
Alessandro Abate, Thom Badings, Giuseppe De Giacomo et al.
Best of Both Worlds Guarantees for Equitable Allocations
Umang Bhaskar, Vishwa Prakash HV, Aditi Sethia et al.
Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning
Sara Rajaee, Rochelle Choenni, Ekaterina Shutova et al.
Beta Distribution Learning for Reliable Roadway Crash Risk Assessment
Ahmad Elallaf, Nathan Jacobs, Xinyue Ye et al.
BETA: Resting-state fMRI Biotypes for tDCS Efficacy in Anxiety Among Older Adults At Risk For Alzheimer’s Disease
Skylar E. Stolte, Junfu Cheng, Chintan Acharya et al.
Better as Generators Than Classifiers: Leveraging LLMs and Synthetic Data for Low-Resource Multilingual Classification
Branislav Pecher, Jan Cegin, Robert Belanec et al.
Better Call CLAUSE: A Discrepancy Benchmark for Auditing LLMs Legal Reasoning Capabilities
Manan Roy Choudhury, Adithya Chandramouli, Mannan Anand et al.
Better Datasets Start from RefineLab: Automatic Optimization for High-Quality Dataset Refinement
Xiaonan Luo, Yue Huang, Ping He et al.
Better Generalizing to Unseen Concepts: An Evaluation Framework and An LLM-Based Auto-Labeled Pipeline for Biomedical Concept Recognition
Shanshan Liu, Noriki Nishida, Fei Cheng et al.
Better Literary Translation: A Multi-Aspect Data Generation and LLM Training Approach
Zhihao Lin, Ziqi Zhu, Hao Huang et al.
Better Matching, Less Forgetting: A Quality-Guided Matcher for Transformer-based Incremental Object Detection
Qirui Wu, Shizhou Zhang, De Cheng et al.