Papers
Evaluating Bias in LLMs for Job-Resume Matching: Gender, Race, and Education
Hayate Iso, Pouya Pezeshkpour, Nikita Bhutani et al.
Evaluating Calibration of Arabic Pre-trained Language Models on Dialectal Text
Ali Al-Laith, Rachida Kebdani
Evaluating Cognitive-Behavioral Fixation via Multimodal User Viewing Patterns on Social Media
Yujie Wang, Yunwei Zhao, Jing Yang et al.
Evaluating Compositional Generalisation in VLMs and Diffusion Models
Beth Pearson, Bilal Boulbarss, Michael Wray et al.
Evaluating Compound AI Systems through Behaviors, Not Benchmarks
Pranav Bhagat, K N Ajay Shastry, Pranoy Panda et al.
Evaluating Contextualized Representations of (Spanish) Ambiguous Words: A New Lexical Resource and Empirical Analysis
Pamela D Riviere, Anne L. Beatty-Martínez, Sean Trott
Evaluating Conversational Agents with Persona-driven User Simulations based on Large Language Models: A Sales Bot Case Study
Justyna Gromada, Alicja Kasicka, Ewa Komkowska et al.
Evaluating Credibility and Political Bias in LLMs for News Outlets in Bangladesh
Tabia Tanzin Prama, Md. Saiful Islam
Evaluating Cultural and Social Awareness of LLM Web Agents
Haoyi Qiu, Alexander Fabbri, Divyansh Agarwal et al.
Evaluating Cultural Knowledge and Reasoning in LLMs Through Persian Allusions
Melika Nobakhtian, Yadollah Yaghoobzadeh, Mohammad Taher Pilehvar
Evaluating Design Choices in Verifiable Generation with Open-source Models
Shuyang Cao, Lu Wang
Evaluating Design Decisions for Dual Encoder-based Entity Disambiguation
Susanna Rücker, Alan Akbik
Evaluating Dialect Robustness of Language Models via Conversation Understanding
Dipankar Srirag, Nihar Ranjan Sahoo, Aditya Joshi
Evaluating distillation methods for data-efficient syntax learning
Takateru Yamakoshi, Thomas L. Griffiths, R. Thomas McCoy et al.
Evaluating Evaluation Metrics for Ancient Chinese to English Machine Translation
Eric R. Bennett, HyoJung Han, Xinchen Yang et al.
Evaluating Evaluation Metrics – The Mirage of Hallucination Detection
Atharva Kulkarni, Yuan Zhang, Joel Ruben Antony Moniz et al.
Evaluating Evidence Attribution in Generated Fact Checking Explanations
Rui Xing, Timothy Baldwin, Jey Han Lau
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
Xuyang Wu, Yuan Wang, Hsin-Tai Wu et al.
Evaluating Financial Literacy of Large Language Models through Domain Specific Languages for Plain Text Accounting
Alexei Gustavo Figueroa Rosero, Paul Grundmann, Julius Freidank et al.
Evaluating Generalization Capability of Language Models across Abductive, Deductive and Inductive Logical Reasoning
Yu Sheng, Wanting Wen, Linjing Li et al.
Evaluating Health Question Answering Under Readability-Controlled Style Perturbations
Md Mushfiqur Rahman, Kevin Lybarger
Evaluating Human-LLM Representation Alignment: A Case Study on Affective Sentence Generation for Augmentative and Alternative Communication
Shadab Hafiz Choudhury, Asha Kumar, Lara J. Martin
Evaluating Human-LLM Representation Alignment: A Case Study on Affective Sentence Generation for Augmentative and Alternative Communication
Shadab Hafiz Choudhury, Asha Kumar, Lara J. Martin
Evaluating Human Perception and Bias in AI-Generated Humor
Narendra Nath Joshi
Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering
Youngsun Lim, Hojun Choi, Hyunjung Shim