Papers
176,624 papers found
CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models
Danny Brahman, Mohammad Mahoor
CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models
Danny Brahman, Mohammad Mahoor
Code Execution as Grounded Supervision for LLM Reasoning
Dongwon Jung, Wenxuan Zhou, Muhao Chen
Code_Gen at BLP-2025 Task 1: Enhancing Bangla Hate Speech Detection with Transformers through Token-Aware Adversarial Contrastive Training and Layer-wise Learning Rate Decay
Shifat Islam, Abhishek Agarwala, Emon Ghosh
Code_Gen at BLP-2025 Task 1: Enhancing Bangla Hate Speech Detection with Transformers through Token-Aware Adversarial Contrastive Training and Layer-wise Learning Rate Decay
Shifat Islam, Abhishek Agarwala, Emon Ghosh
Code_Gen at BLP-2025 Task 2: BanglaCode: A Cross-lingual Benchmark for Code Generation with Translation and Assertion Strategies
Abhishek Agarwala, Shifat Islam, Emon Ghosh
Code_Gen at BLP-2025 Task 2: BanglaCode: A Cross-lingual Benchmark for Code Generation with Translation and Assertion Strategies
Abhishek Agarwala, Shifat Islam, Emon Ghosh
CodeGenWrangler: Data Wrangling task automation using Code-Generating Models
Ashlesha Akella, Abhijit Manatkar, Krishnasuri Narayanam et al.
CodeHalu: Investigating Code Hallucinations in LLMs via Execution-based Verification
Yuchen Tian, Weixiang Yan, Qian Yang et al.
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
Kaiwen Yan, Hongcheng Guo, Xuanqing Shi et al.
CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?
Yuwei Zhao, Ziyang Luo, Yuchen Tian et al.
Code Like Humans: A Multi-Agent Solution for Medical Coding
Andreas Geert Motzfeldt, Joakim Edin, Casper L. Christensen et al.
CODEMENV: Benchmarking Large Language Models on Code Migration
Keyuan Cheng, Xudong Shen, Yihao Yang et al.
CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages
Yilun Yang, Yekun Chai
CODEOFCONDUCT at Multilingual Counterspeech Generation: A Context-Aware Model for Robust Counterspeech Generation in Low-Resource Languages
Michael Bennie, Bushi Xiao, Chryseis Xinyi Liu et al.
Code-Optimise: Self-Generated Preference Data for Correctness and Efficiency
Leonidas Gee, Milan Gritta, Gerasimos Lampouras et al.
CodePRM: Execution Feedback-enhanced Process Reward Model for Code Generation
Qingyao Li, Xinyi Dai, Xiangyang Li et al.
CodeRAG-Bench: Can Retrieval Augment Code Generation?
Zora Zhiruo Wang, Akari Asai, Xinyan Velocity Yu et al.
CoderAgent: Simulating Student Behavior for Personalized Programming Learning with Large Language Models
Yi Zhan, Qi Liu, Weibo Gao et al.
CodeRAG: Finding Relevant and Necessary Knowledge for Retrieval-Augmented Repository-Level Code Completion
Sheng Zhang, Yifan Ding, Shuquan Lian et al.
CoDeR: Counterfactual Demand Reasoning for Sequential Recommendation
Shuai Tang, Sitao Lin, Jianghong Ma et al.
CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models
Hong Yi Lin, Chunhua Liu, Haoyu Gao et al.
CodeScientist: End-to-End Semi-Automated Scientific Discovery with Code-based Experimentation
Peter Jansen, Oyvind Tafjord, Marissa Radensky et al.
CodeSCM: Causal Analysis for Multi-Modal Code Generation
Mukur Gupta, Noopur Bhatt, Suman Jana
Code-SPA: Style Preference Alignment to Large Language Models for Effective and Robust Code Debugging
Tengfei Wen, Xuanang Chen, Ben He et al.