Papers
Beetrap-MC: A Minecraft-Based AI Literacy Tool for Teaching Filter Bubbles to Middle School Students
Erfan Farhadi, Kenneth Fei, Yifan Jiang et al.
BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes
Baichuan Huang, Ananth Balashankar, Amir Aminifar
Behavioral-Similarity and Clustering-Based Methods for Static Graph Estimation in Hybrid GNNs (Student Abstract)
Ryusei Otani, Keichi Namikoshi, Yuko Sakurai et al.
Behavior Knowledge Merge in Reinforced Agentic Models
Xiangchi Yuan, Dachuan Shi, Chunhui Zhang et al.
Behavior Regularization with Flow Latent Policy for Offline Reinforcement Learning
Yulong Xia, Fuchun Sun
Behavior Tokens Speak Louder: Disentangled Explainable Recommendation with Behavior Vocabulary
Xinshun Feng, Mingzhe Liu, Yi Qiao et al.
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
Alex W. Goodall, Edwin Hamel-De Le Court, Francesco Belardinelli
Being Kind Isn’t Always Being Safe: Diagnosing Affective Hallucination in LLMs
Sewon Kim, Jiwon Kim, SeungWoo Shin et al.
Being Positive about Negative Queries: Exclusion Aware Multimodal Retrieval using Disentangled Representations
Prachi Jha, Sumit Bhatia, Srikanta Bedathur
Belief-Driven Value Alignment for Human-Robot Collaboration
Saisai Li, Bing Shi, Yiming Xia et al.
Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model Explanations
Keyu He, Tejas Srinivasan, Brihi Joshi et al.
BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks
Nishant Balepur, Bhavya Rajasekaran, Hyunjin Jane Oh et al.
Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders
Angqing Jiang, Jianlyu Chen, Zhefang et al.
Benchmarking and Enhancing Rule Knowledge-Driven Reasoning of Large Language Models
Zijie Xu, Wenjun Ke, Peng Wang et al.
Benchmarking and Learning Real-World Customer Service Dialogue
Tianhong Gao, Jundong Shen, Jiapeng Wang et al.
Benchmarking and Mitigating the Impact of Noisy User Prompts in Medical VLMs via Cross-Modal Reflection
Zhiyu Xue, Reza Abbasi-Asl, Ramtin Pedarsani
Benchmarking Deflection and Hallucination in Large Vision-Language Models
Nicholas Moratelli, Christopher Davis, Leonardo F. R. Ribeiro et al.
Benchmarking Direct Preference Optimization for Medical Large Vision–Language Models
Dain Kim, Jiwoo Lee, Jaehoon Yun et al.
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
Shaonan Liu, Guo Yu, Xiaoling Luo et al.
Benchmarking Fine-Grained Error Detection in Multimodal Reasoning
Chi-Min Chan, Han Zhu, Chunyang Jiang et al.
Benchmarking Hate Speech Detection in Azerbaijani with Turkish Cross-Lingual Transfer and Transformer Models
Tural Alizada, Haim Dubossarsky
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
Qian Chen, Xianyin Zhang, Yanzhi Liu et al.
Benchmarking LLM’s Capability in Reasoning over Conflicting Web References
Yizhen Yuan, Rui Kong, Dongze Li et al.
Benchmarking LLMs for Political Science: A United Nations Perspective
Yueqing Liang, Liangwei Yang, Chen Wang et al.
Benchmarking LLMs’ Mathematical Reasoning with Unseen Random Variables Questions
Zijin Hong, Hao Wu, Su Dong et al.