Papers
Evaluating LLMs’ Mathematical and Coding Competency through Ontology-guided Interventions
Pengfei Hong, Navonil Majumder, Deepanway Ghosal et al.
Evaluating LLMs’ Reasoning Over Ordered Procedural Steps
Adrita Anika, Md Messal Monem Miah
Evaluating LLMs’ Reasoning Over Ordered Procedural Steps
Adrita Anika, Md Messal Monem Miah
Evaluating LLMs with Multiple Problems at once
Zhengxiang Wang, Jordan Kodner, Owen Rambow
Evaluating Mathematical Reasoning Beyond Accuracy
Shijie Xia, Xuefeng Li, Yixin Liu et al.
Evaluating Model Alignment with Human Perception: A Study on Shitsukan in LLMs and LVLMs
Daiki Shiono, Ana Brassard, Yukiko Ishizuki et al.
Evaluating Model Perception of Color Illusions in Photorealistic Scenes
Lingjun Mao, Zineng Tang, Alane Suhr
Evaluating Morphological Compositional Generalization in Large Language Models
Mete Ismayilzada, Defne Circi, Jonne Sälevä et al.
Evaluating Multimodal Generative AI with Korean Educational Standards
Sanghee Park, Geewook Kim
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
Antonia Karamolegkou, Malvina Nikandrou, Georgios Pantazopoulos et al.
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
Linhao Yu, Xingguang Ji, Yahui Liu et al.
Evaluating NL2SQL via SQL2NL
Mohammadtaher Safarzadeh, Afshin Oroojlooy, Dan Roth
Evaluating Numeracy of Language Models as a Natural Language Inference Task
Rahmad Mahendra, Damiano Spina, Lawrence Cavedon et al.
Evaluating Open-Source ASR Systems: Performance Across Diverse Audio Conditions and Error Correction Methods
Saki Imai, Tahiya Chowdhury, Amanda J. Stent
Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity
Yupu Hao, Pengfei Cao, Zhuoran Jin et al.
Evaluating Pixel Language Models on Non-Standardized Languages
Alberto Muñoz-Ortiz, Verena Blaschke, Barbara Plank
Evaluating Pretrained Causal Language Models for Synonymy
Ioana Ivan, Carlos Ramisch, Alexis Nasr
Evaluating Prompt Relevance in Arabic Automatic Essay Scoring: Insights from Synthetic and Real-World Data
Chatrine Qwaider, Kirill Chirkunov, Bashar Alhafni et al.
Evaluating RAG Pipelines for Arabic Lexical Information Retrieval: A Comparative Study of Embedding and Generation Models
Raghad Al-Rasheed, Abdullah Al Muaddi, Hawra Aljasim et al.
Evaluating Readability Metrics for German Medical Text Simplification
Karen Scholz, Markus Wenzel
Evaluating Retrieval Augmented Generation to Communicate UK Climate Change Information
Arjun Biswas, Hatim Chahout, Tristan Pigram et al.
Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study
Guanyu Hou, Jiaming He, Yinhang Zhou et al.
Evaluating Robustness of LLMs to Numerical Variations in Mathematical Reasoning
Yuli Yang, Hiroaki Yamada, Takenobu Tokunaga
Evaluating Robustness of LLMs to Typographical Noise in Yorùbá QA
Paul Okewunmi, Favour James, Oluwadunsin Fajemila
Evaluating Sampling Strategies for Similarity-Based Short Answer Scoring: a Case Study in Thailand
Pachara Boonsarngsuk, Pacharapon Arpanantikul, Supakorn Hiranwipas et al.