CuratorKIT : Data Curation and Synthetic Data Generation for LLM Post-Training
DGX agentarXiv:2606.21631v1 Announce Type: cross Abstract: Data curation is a critical part of post-training pipelines for large language models, yet existing tools often treat ingestion, deduplication, synthe