企业级 AI 代理需要在特定环境中执行复杂任务,其表现往往受限于系统规则、数据状态及工作流程。尽管通用模型具备广泛能力,但在处理特定业务逻辑、工具组合或约束条件时仍可能出现失误。如何将这些弱点转化为有效的训练数据,是提升模型在企业场景下表现的关键。

ServiceNow CoreAI 团队推出了 AutoSynthData 框架,旨在自动合成针对企业代理的训练数据。该框架利用目标模型的失败案例与更强教师模型的成功轨迹,识别能力缺口并生成可验证的新任务。随着模型迭代,课程会自动聚焦于剩余的难点。本文以 EnterpriseOps Gym (Malay 等人, 2026) 为例,解析这一数据生成管道。
构建有效代理任务的三大要素
代理环境定义了模型操作的世界,包括可观察和修改的状态、可调用的 API 以及行为导致的状态转换。一个用于训练的任务由以下抽象结构组成:
task = (system specification, user prompt, verifier)
系统规格 (System Specification)
系统规范设定了代理操作的边界,包含指令、策略及初始状态(如数据库种子或知识文章)。规范必须与环境中的工具和状态兼容,且指令应明确,避免为了制造难度而添加无意义的限制。
面向代理人的提示 (User Prompt)
用户提示需满足三个属性:
- 可能性:在当前环境中至少存在一条符合规范的解决路径,排除依赖不可用工具或违反政策的情况。
- 现实主义:提示内容应贴近真实用户在工作流中可能提出的问题。
- 困难度:任务需暴露当前模型的弱点。已能稳定解决的任务缺乏新的训练信号价值。
验证器 (Verifier)
验证器用于判定轨迹是否成功完成任务,需具备:
- 一致性:与用户提示、系统规范及环境状态保持逻辑一致。
- 健全性:拒绝无法满足任务或违反约束的轨迹。
- 完全性:接受所有有效解决方案,而非仅匹配单一参考轨迹。
宽松的验证器可能奖励错误行为,而过严的验证器则可能惩罚有效解法,因此平衡至关重要。
AutoSynthData 工作流概述
给定环境和目标模型,AutoSynthData 生成由系统规范、用户提示和验证器组成的训练任务。流程如下:
首先,通过诊断任务评估目标模型,识别其难以完成的任务模式。随后,利用更强的教师模型界定可解决范围及成功标准。系统将能力缺口转化为新的可执行任务,并在环境中进行验证。最终,使用通过验证的样本进行后期训练(Post-training),并根据更新后模型的评估结果指导下一轮数据生成。
从失败模式到课程生成
在 EnterpriseOps Gym 实验中,团队对比了目标模型与教师模型的表现,提取关键信息形成“能力规范卡”:
- 测试的能力维度;
- 涉及的工具与工作流结构;
- 目标模型的失败点与教师模型的成功路径;
- 正确最终状态的属性要求;
- 在保持核心能力不变时可变化的变量。
生成器不直接接收原始评估任务,而是基于这些规范卡创建具有不同提示、状态和解决路径的新任务。
任务创建与扩展机制
识别能力缺口后,AutoSynthData 分两阶段构建数据集:
目标阶段 (Target Phase)
并行生成独立的核心训练样本。每个候选样本经过验证、执行、解决者评估及修复后方可被接受。此阶段产出围绕模型弱点的精选示例集。
乘法阶段 (Multiplication Phase)
基于已接受的目标样本生成变体,扩展数据集规模。每个变体拥有独立的请求、状态、实体配置及验证器,并需通过相同的检查。为避免误差累积,复制样本不能作为另一复制样本的种子。
架构上,共享控制器协调生成与质量控制,适配器处理环境执行、状态管理及确定性验证。
多层次质量审查体系
仅生成看似合理的请求不足以构成高质量训练数据。AutoSynthData 实施样本级与批量级的双重审查。
样本级验证与修复
候选样本需通过质量控制循环。理想状态下,目标模型在三次尝试中仅成功一次,而强解决者在三次中至少成功两次。
- 正向验证:在环境中执行参考轨迹,确认预期解决方案能通过验证器。
- 负向验证:故意修改结果部分,确认验证器能拒绝无效状态,防止奖励错误行为。
- 批评与修复:失败样本进入诊断环节,识别不一致状态、不可能的工作流或弱验证逻辑,指导针对性修复后重新验证。
批量级审查
元复查监控整体数据集分布,检查是否存在任务类型过度代表、能力维度缺失或低收益重复等问题。控制器根据反馈调整生成策略,确保覆盖度、多样性与学习信号的平衡。
移动训练前沿
随着模型能力提升,有用的训练分布随之变化。AutoSynthData 将数据生成视为寻找模型能力边界附近的任务:既足够困难以暴露弱点,又足够可行以供教师演示。后续实验计划将此机制延伸至强化学习(RL)领域。
EnterpriseOps Gym 实验结果
团队在 Hybrid 和 ITSM 两个域进行了测试,验证该方法在有状态企业环境中的有效性。
Hybrid 域实验
使用 Gemma-4-26B-A4B-it 作为目标模型,Qwen3.8-27B 作为教师模型。AutoSynthData 在约 18 小时内生成了 2,000 个合成训练样本。微调后的最佳检查点为第 5 个 epoch。
结果显示,平均 Pass@1 提升了 7.2 个百分点(相对提升 35%),验证器成功率从 63.01% 升至 68.55%,缩小了 Gemma 与参考模型间 59% 的性能差距。
ITSM 域实验
同样使用 Gemma-4-26B-A4B-it 为目标模型,但教师模型换为 DeepSeek-V4.1-Flash。由于使用了更大的教师模型且早期管道优化尚未完全应用,生成 1,994 个样本耗时 66 小时。
在 ITSM 域,合成 SFT 使平均 Pass@1 从 18.77% 提升至 27.18%,证明了该方法在不同企业域的可扩展性。

结语
AutoSynthData 通过闭环机制,利用模型失败定义生成目标,并通过环境验证确保任务质量。实验表明,这种动态调整的数据合成方法能有效提升企业代理在特定环境下的性能,并为持续改进提供了可扩展的路径。





