Papers
Data Laundering: Artificially Boosting Benchmark Results through Knowledge Distillation
Jonibek Mansurov, Akhmed Sakip, Alham Fikri Aji
DataMan: Data Manager for Pre-training Large Language Models
Ru Peng, Kexin Yang, Yawen Zeng et al.
Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance
Jiasheng Ye, Peiju Liu, Tianxiang Sun et al.
Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
Yuan Li, Zhengzhong Liu, Eric Xing
Data Monitoring for Large Scale Public Health Data
Ananya Joshi
Data or Language Supervision: What Makes CLIP Better than DINO?
Yiming Liu, Yuhui Zhang, Dhruba Ghosh et al.
Data Poisoning Attack Defense and Evolutionary Domain Adaptation for Federated Medical Image Segmentation
Min Hyuk Kim, Seok Bong Yoo
Data Poisoning for In-context Learning
Pengfei He, Han Xu, Yue Xing et al.
Data Pruning by Information Maximization
Haoru Tan, Sitong Wu, Wei Huang et al.
Data Quality Enhancement on the Basis of Diversity with Large Language Models for Text Classification: Uncovered, Difficult, and Noisy
Min Zeng, Caiquan Liu, Shiqi Zhang et al.
Data Quality Issues in Multilingual Speech Datasets: The Need for Sociolinguistic Awareness and Proactive Language Planning
Mingfei Lau, Qian Chen, Yeming Fang et al.
Data Reconstruction Attacks and Defenses: A Systematic Evaluation
Sheng Liu, Zihan Wang, Yuxiao Chen et al.
Data Retrieval with Importance Weights for Few-Shot Imitation Learning
Amber Xie, Rahul Chand, Dorsa Sadigh et al.
Data Scaling Laws in Imitation Learning for Robotic Manipulation
Fanqi Lin, Yingdong Hu, Pingyue Sheng et al.
Data-scarce Behavior Editing of Language Models
Joykirat Singh, Subhabrata Dutta, Tanmoy Chakraborty
Data Selection for ERMs
Steve Hanneke, Shay Moran, Alexander Shlimovich et al.
Data Selection via Optimal Control for Language Models
Yuxian Gu, Li Dong, Hongning Wang et al.
Dataset Augmentation by Mixing Visual Concepts
Md Abdullah Al Rahat Kutubi, Hemanth Venkateswara
Dataset Distillation as Data Compression: A Rate-Utility Perspective
Youneng Bao, Yiping Liu, Zhuo Chen et al.
Dataset Distillation via Knowledge Distillation: Towards Efficient Self-Supervised Pre-training of Deep Networks
Siddharth Joshi, Jiayi Ni, Baharan Mirzasoleiman
Dataset Distillation via the Wasserstein Metric
Haoyang Liu, Yijiang Li, Tiancheng Xing et al.
Dataset Distillation via Vision-Language Category Prototype
Yawen Zou, Guang Li, Duo Su et al.
Dataset Distillation with Neural Characteristic Function: A Minmax Perspective
Shaobo Wang, Yicun Yang, Zhiyuan Liu et al.
Dataset of News Articles with Provenance Metadata for Media Relevance Assessment
Tomas Peterka, Matyas Bohacek
Dataset Ownership Verification for Pre-trained Masked Models
Yuechen Xie, Jie Song, Yicheng Shan et al.