Papers
8 papers found
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
Jingnan Zheng, Han Wang, An Zhang et al.
Value Imprint: A Technique for Auditing the Human Values Embedded in RLHF Datasets
Ike Obi, Rohan Pant, Srishti Shekhar Agrawal et al.
Value Kaleidoscope: Engaging AI with Pluralistic Human Values, Rights, and Duties
Taylor Sorensen, Liwei Jiang, Jena D. Hwang et al.
The Touché23-ValueEval Dataset for Identifying Human Values behind Arguments
Nailia Mirzakhmedova, Johannes Kiesel, Milad Alshomary et al.
VIVA: A Benchmark for Vision-Grounded Decision-Making with Human Values
Zhe Hu, Yixiao Ren, Jing Li et al.
Exploring Multilingual Concepts of Human Values in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?
Shaoyang Xu, Weilong Dong, Zishan Guo et al.
Learning Human-like Representations to Enable Learning Human Values
Andrea H. Wynn, Ilia Sucholutsky, Thomas L. Griffiths