Papers
Evaluating Self-Generated Documents for Enhancing Retrieval-Augmented Generation with Large Language Models
Jiatao Li, Xinyu Hu, Xunjian Yin et al.
Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective
Xiangru Zhu, Penglei Sun, Yaoxian Song et al.
Evaluating Sequence Labeling on the basis of Information Theory
Enrique Amigo, Elena Álvarez-Mellado, Julio Gonzalo et al.
Evaluating Shortcut Utilization in Deep Learning Disease Classification through Counterfactual Analysis
Vibujithan Vigneshwaran, Emma A.M. Stanley, Raissa Souza et al.
Evaluating Small Language Models for News Summarization: Implications and Factors Influencing Performance
Borui Xu, Yao Chen, Zeyi Wen et al.
Evaluating Spatiotemporal Consistency in Automatically Generated Sewing Instructions
Luisa Geiger, Mareike Hartmann, Michael Sullivan et al.
Evaluating Step-by-step Reasoning Traces: A Survey
Jinu Lee, Julia Hockenmaier
Evaluating Structural and Linguistic Quality in Urdu DRS Parsing and Generation through Bidirectional Evaluation
Muhammad Saad Amin, Luca Anselma, Alessandro Mazzei
Evaluating Structured Output Robustness of Small Language Models for Open Attribute-Value Extraction from Clinical Notes
Nikita Neveditsin, Pawan Lingras, Vijay Kumar Mago
Evaluating Taxonomy Free Character Role Labeling (TF-CRL) in News Stories using Large Language Models
David G Hobson, Derek Ruths, Andrew Piper
Evaluating Test-Time Scaling LLMs for Legal Reasoning: OpenAI o1, DeepSeek-R1, and Beyond
Yinghao Hu, Yaoyao Yu, Leilei Gan et al.
Evaluating Text Generation Quality Using Spectral Distances of Surprisal
Zhichen Liu, Yongyuan Li, Yang Xu et al.
Evaluating Text Style Transfer Evaluation: Are There Any Reliable Metrics?
Sourabrata Mukherjee, Atul Kr. Ojha, John P. McCrae et al.
Evaluating Textual and Visual Semantic Neighborhoods of Abstract and Concrete Concepts
Sven Naber, Diego Frassinelli, Sabine Schulte Im Walde
Evaluating the Capabilities of Large Language Models for Multi-label Emotion Understanding
Tadesse Destaw Belay, Israel Abebe Azime, Abinew Ali Ayele et al.
Evaluating the Consistency of LLM Evaluators
Noah Lee, Jiwoo Hong, James Thorne
Evaluating the Creativity of LLMs in Persian Literary Text Generation
Armin Tourajmehr, Mohammad Reza Modarres, Yadollah Yaghoobzadeh
Evaluating the Effectiveness and Scalability of LLM-Based Data Augmentation for Retrieval
Pranjal A Chitale, Bishal Santra, Yashoteja Prabhu et al.
Evaluating the Evaluation of Diversity in Commonsense Generation
Tianhui Zhang, Bei Peng, Danushka Bollegala
Evaluating the Evaluator: Measuring LLMs’ Adherence to Task Evaluation Instructions
Bhuvanashree Murugadoss, Christian Poelitz, Ian Drosos et al.
Evaluating the Evaluators: Are readability metrics good measures of readability?
Isabel Cachola, Daniel Khashabi, Mark Dredze
Evaluating the Long-Term Memory of Large Language Models
Zixi Jia, Qinghua Liu, Hexiao Li et al.
Evaluating Theory of (an uncertain) Mind: Predicting the Uncertain Beliefs of Others from Conversational Cues
Anthony Sicilia, Malihe Alikhani
Evaluating the Performance of Large Language Models via Debates
Behrad Moniri, Hamed Hassani, Edgar Dobriban