Papers
Data Monitoring for Large Scale Public Health Data
Ananya Joshi
Data or Language Supervision: What Makes CLIP Better than DINO?
Yiming Liu, Yuhui Zhang, Dhruba Ghosh et al.
Data Poisoning Attack Defense and Evolutionary Domain Adaptation for Federated Medical Image Segmentation
Min Hyuk Kim, Seok Bong Yoo
Data Poisoning for In-context Learning
Pengfei He, Han Xu, Yue Xing et al.
Data Pruning by Information Maximization
Haoru Tan, Sitong Wu, Wei Huang et al.
Data Quality Enhancement on the Basis of Diversity with Large Language Models for Text Classification: Uncovered, Difficult, and Noisy
Min Zeng, Caiquan Liu, Shiqi Zhang et al.
Data Quality Issues in Multilingual Speech Datasets: The Need for Sociolinguistic Awareness and Proactive Language Planning
Mingfei Lau, Qian Chen, Yeming Fang et al.
Data Scaling Laws in Imitation Learning for Robotic Manipulation
Fanqi Lin, Yingdong Hu, Pingyue Sheng et al.
Data-scarce Behavior Editing of Language Models
Joykirat Singh, Subhabrata Dutta, Tanmoy Chakraborty
Data Selection via Optimal Control for Language Models
Yuxian Gu, Li Dong, Hongning Wang et al.
Dataset Augmentation by Mixing Visual Concepts
Md Abdullah Al Rahat Kutubi, Hemanth Venkateswara
Dataset Distillation as Data Compression: A Rate-Utility Perspective
Youneng Bao, Yiping Liu, Zhuo Chen et al.
Dataset Distillation via Knowledge Distillation: Towards Efficient Self-Supervised Pre-training of Deep Networks
Siddharth Joshi, Jiayi Ni, Baharan Mirzasoleiman
Dataset Distillation via the Wasserstein Metric
Haoyang Liu, Yijiang Li, Tiancheng Xing et al.
Dataset Distillation via Vision-Language Category Prototype
Yawen Zou, Guang Li, Duo Su et al.
Dataset Distillation with Neural Characteristic Function: A Minmax Perspective
Shaobo Wang, Yicun Yang, Zhiyuan Liu et al.
Dataset of News Articles with Provenance Metadata for Media Relevance Assessment
Tomas Peterka, Matyas Bohacek
Dataset Ownership Verification for Pre-trained Masked Models
Yuechen Xie, Jie Song, Yicheng Shan et al.
Dataset Ownership Verification in Contrastive Pre-trained Models
Yuechen Xie, Jie Song, Mengqi Xue et al.
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
Ruizhe Chen, Tianze Luo, Zhiting Fan et al.
Datasets for Depression Modeling in Social Media: An Overview
Ana-Maria Bucur, Andreea Moldovan, Krutika Parvatikar et al.
Data Shapley in One Training Run
Jiachen T. Wang, Prateek Mittal, Dawn Song et al.
Data Synthesis with Diverse Styles for Face Recognition via 3DMM-Guided Diffusion
Yuxi Mi, Zhizhou Zhong, Yuge Huang et al.
Data Taggants: Dataset Ownership Verification Via Harmless Targeted Data Poisoning
Wassim Bouaziz, Nicolas Usunier, El-Mahdi El-Mhamdi
Data to Defense: The Role of Curation in Aligning Large Language Models Against Safety Compromise
Xiaoqun Liu, Jiacheng Liang, Luoxi Tang et al.