conftrace_

Papers

54 papers found · 5 more still awaiting a processed abstract Show those too
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
Patrick Chao, Edoardo Debenedetti, Alexander Robey et al.
2024 NIPS
2024 NIPS
2024 NIPS
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
Anay Mehrotra, Manolis Zampetakis, Paul Kassianik et al.
2024 NIPS
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
Yichuan Mo, Yuji Wang, Zeming Wei et al.
2024 NIPS
A StrongREJECT for Empty Jailbreaks
Alexandra Souly, Qingyuan Lu, Dillon Bowen et al.
2024 NIPS
Many-shot Jailbreaking
Cem Anil, Esin Durmus, Nina Panickssery et al.
2024 NIPS
Visual Adversarial Examples Jailbreak Aligned Large Language Models
Xiangyu Qi, Kaixuan Huang, Ashwinee Panda et al.
2024 AAAI
Jailbreak Open-Sourced Large Language Models via Enforced Decoding
Hangfan Zhang, Zhimeng Guo, Huaisheng Zhu et al.
2024 ACL
2024 ACL
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
Fengqing Jiang, Zhangchen Xu, Luyao Niu et al.
2024 ACL