TRL v1.14 支持 LoRA 异步训练,配合 HF Jobs 实现训推分离
TRL v1.14 的 AsyncGRPOTrainer 新增 LoRA 适配器训练与同步能力。利用 Hugging Face Jobs 和存储桶挂载,实现了训练器与 vLLM 推理副本在独立机器上的异步运行,无需 NCCL。实测显示,相同配方下 500 步训练耗时从 3 小时 27 分钟压缩至 53 分钟。
共 1 篇相关文章
TRL v1.14 的 AsyncGRPOTrainer 新增 LoRA 适配器训练与同步能力。利用 Hugging Face Jobs 和存储桶挂载,实现了训练器与 vLLM 推理副本在独立机器上的异步运行,无需 NCCL。实测显示,相同配方下 500 步训练耗时从 3 小时 27 分钟压缩至 53 分钟。