Papers
33 papers found
Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
Yilun Zhao, Jinbiao Wei, Tingyu Song et al.
Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
Tingchen Fu, Yafu Li, Jiawei Gu et al.
SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space
Viktoriia Zinkovich, Anton Antonov, Andrei Spiridonov et al.
HateXScore: A Metric Suite for Evaluating Reasoning Quality in Hate Speech Explanations
Yujia Hu, Roy Ka-Wei Lee
Vinclat: Evaluating Reasoning, Cognition and Culture in One Game
Marc Pàmies, Javier Aula-Blasco, Aitor Gonzalez-Agirre et al.
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
Pengfei Zhou, Xiaopeng Peng, Fanrui Zhang et al.
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
Xuzhao Li, Xuchen Li, Shiyu Hu et al.
ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
Francesco Maria Molfese, Luca Moroni, Ciro Porcaro et al.
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
Jinu Lee, Kyoung-Woon On, Sophia Simeng Han et al.
ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
Jincheng Liu, Sijun He, Jingjing Wu et al.
CogEvolve: A Multimodal Benchmark for Evaluating Relational Reasoning in Semantic Extension
Jingjie Zeng, Huayang Li, Liang Yang et al.
Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
Boxuan Wang, Zhuoyun Li, Xinmiao Huang et al.
Role-Conditioned Refusals: Evaluating Access Control Reasoning in Large Language Models
Đorđe Klisura, Joseph Khoury, Ashish Kundu et al.
FinMathBench: A Formula-Driven Benchmark for Evaluating LLMs’ Math Reasoning Capabilities in Finance
Yi He, Ping Wang, Shiqiang Xiong et al.
Are they lovers or friends? Evaluating LLMs’ Social Reasoning in English and Korean Dialogues
Eunsu Kim, Junyeong Park, Juhyun Oh et al.
SMART: Evaluating LLMs’ Mathematical Reasoning via a Human Cognitive Process-Inspired Benchmark
Yujie Hou, Mei Wang, Yaoyao Zhong et al.
DIXITWORLD: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
Yunxiang MO, Tianshi Zheng, Qing Zong et al.
M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
Hongyu Wang, Jiayu Xu, Senwei Xie et al.
Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Benchmark
Mohammad Khodadad, Ali Shiraee Kasmaee, Mahdi Astaraki et al.
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
Jingyao Li, Jingyun Wang, Molin Tan et al.
Beyond Counting: Evaluating Abstract and Emotional Reasoning in Vision-Language Models
Yuan Zhou, Yan Zhang, Jianlong Chang et al.
Where Norms and References Collide: Evaluating LLMs on Normative Reasoning
Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits et al.
CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
Yuefei Chen, Vivek K. Singh, Jing Ma et al.
Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry
Han Zhang, Zihan Gu, Zhiyuan Wang et al.