Adaption Labs 推出 Invent a Dataset:无需种子语料即可按任务描述生成训练数据
Adaption Labs 推出新工具,支持开发者仅通过任务行为描述直接生成用于模型训练的结构化数据集。
AI 深度解读
Adaption Labs 于 2026 年 9 月 4 日推出合成数据生成功能 Invent a Dataset,允许开发者仅基于任务目标描述构建结构化训练数据集,降低了模型微调对预存种子语料的依赖。
- 目标驱动的数据生成:用户无需预先准备种子样本、定义标签规范或标注指南,仅需输入目标行为描述并选择对应领域或子领域代码(如医疗诊断等),即可发起批量合成任务。
- 导出格式与工作流集成:生成结果支持导出为 JSONL、JSON、CSV 及 Parquet 格式,支持指令微调数据集(instruction_dataset)与偏好对齐数据集(preference_pairs)两种输出形态,可与下游模型微调流程衔接。
- 交付与调用约束:该能力已通过云端 Web 界面、Python SDK 与 REST API 开放,按用量消耗点数,当前未提供私有化本地部署版本。
- 影响/看点:该工具为缺乏冷启动私有数据的垂直任务微调提供了便捷路径,但合成数据的质量边界与领域知识保真度,仍需在下游实际模型训练与偏好对齐的收敛效果中进行定量检验。
- 资料依据:
- Adaption Labs 官方文档(2026-09-04):https://adaptionlabs.ai/blog/invent-a-dataset
- MarkTechPost(2026-09-04):https://www.marktechpost.com/2026/09/04/datasets-invent-api-training-data-without-labeling-adaptive-data-autoscientist/
本内容由 AI 生成,仅供参考,请注意甄别