不存在的模型,所以你自己做了
yuvraj sharma ysharma

Abubakar Abid abidlabs
上周,作者希望获得一个适用于 Qwen-Image 2.1 的轻量级提示词重写器。官方版本是一个 9B 参数的模型,需要约 20 GB 显存,且在生成段落前需处理数千个 token。在 Hugging Face Hub 上仅能找到该模型的压缩副本。于是,作者向 ML Intern 描述了需求,次日便得到了一个可在 CPU 上运行的 0.8B 版本。该模型输出有效结果的比例为 99.7%,token 消耗量仅为教师模型的四分之一。整个项目(包括让 9B 模型标注 8,797 个示例请求)的计算成本约为 16 美元。
在接下来的几天里,作者以同样的方式构建了五个模型。每个流程均始于 HuggingChat 中的一条消息,启动 ML-intern,最终在 Hub 上发布公共模型。在实际训练前进行小规模测试,随后在 Hugging Face 硬件上完成训练、评估和发布。
如何提示 ML 实习生
第一条消息是投入精力最多的部分。针对下文提到的 citrus 模型,初始提示词约有 450 字;到第 6 个项目时,已接近 2,000 字,因为每个项目都积累了可融入后续项目的经验。这七个提示词已完整发布在 GitHub 上的 yvrjsharma/ml-intern-prompts 仓库中。
提示结构通常始于一行想法及动机,随后列出具体组件:数据集、基础模型、训练脚本。任何已验证的信息都会标记为“经过验证的事实,不要重新推导”。例如,对于相机角度 LoRA,该部分列出了哪些训练器刚添加透明图像支持,以及哪些开放的 GitHub 问题使备用训练器存在风险。
提示中有两个关键要求。第一,在任何训练之前提供基线。例如,提示要求:“在训练之前,报告基础模型在相同指标上的零样本得分,以便观察收益。”没有这一步,无法判断训练后的模型是否优于初始状态。第二,附带检查项的烟雾测试。对于图像 LoRAs,要求先运行 50 个训练步骤,检查保存的权重是否真的改变,然后再支付完整运行的费用。
在提示结束时,列出预期成果并限制成本。定义模板卡内容,并包含指令:“总支出限制为 12 美元,超出前请询问。”由于 ML 实习生每项任务从零预算开始,并在执行付费工作前需要许可,这种支出限制被严格执行。根据项目规模,代理会建议选择合适的配置。
并非所有要素都需要在首次尝试中就位。机器人实习生制作的模型精度已超过 Qwen3.5-2B 模型的三倍。以下是使用 Ml-Intern 在短短几天内构建的六个案例。
1. 懂你领域的模型
通用视觉模型可以描述发黄的柑橘叶,但难以区分这是螨虫问题还是缺镁症,也无法给出生物和非生物防治方法。作者利用 Claude 将托管在 Hub 上 Project-AgML 组织的三个来源合并为一个训练数据集。生成的 citrus-disease-vlm-instruct 数据集包含 3,017 张标注图像,涵盖 21 种不同的害虫、疾病、营养缺乏和治疗方案。ML-intern 使用这些示例对 Qwen3.5-2B 进行了微调,并确保在训练前对基础模型进行了基准测试。
在 335 张测试照片中,基础模型仅有 14.9% 的时间给出正确诊断。在 A10G 显卡上经过两个 epoch 的训练后,微调模型的准确率提升至 52.8%。计算成本约为 1.90 美元。
2. 画你角色的模型
影像模型知道许多角色,但不包括拥抱脸品牌资产的平面风格形象。作者询问 ML 实习生关于 FLUX.2 Klein 基础 4B 模型的 LoRA 训练。
代理每 100 步保存一个检查点,并使用相同的提示进行测试,便于选择最佳模型。步骤 200 时,Huggy 完全出现在模型生成结果中。从第 500 步开始,Huggy 的风格开始溢出到与 Huggy 无关的提示中。训练好的 LoRA 也在 4 步蒸馏的 .Klein 模型上工作。计算成本约为 7.60 美元。
3. 掌握新技巧的模型
- 摄像机角度 LoRA 是 Qwen-Image 早期模型中最受欢迎的社区附加组件之一。用户可以提供物体图片,并要求模型从特定角度(如左侧 45 度)渲染。作者在 Qwen-Image 2.1 模型发布后的几天内检查发现,尚无人制作此功能。
一名机器学习实习生利用 Google Scanned Objects 数据集,对 1,030 个扫描的家庭物体在 24 个角度下进行了渲染,生成了 24,722 张透明图像,该 CPU 任务仅花费几美分。随后,确定了用于训练的 461 个物体和留作测试的 40 个物体,并准备了 1,844 组训练前后对比数据,均匀分布在 23 条相机指令中。
训练在一张 A100 上运行了 2,000 步,耗时约 90 分钟(成本约 3.75 美元)。整个项目历时约半天,共执行了 48 个作业任务,其中包括因缺少依赖包或路径错误而失败并由 ML-Intern 重新提交的任务。总计算成本约为 16 美元。
- 另一个想法是“Doodle-in LoRA”。添加一个物体的简短提示名称,LoRA 可以用该物体替换涂鸦,同时保持原来的照明和构图。
由于此前并不存在相关数据集,提示词描述了如何构建一个。具体做法是:从 Open Images 中的一张真实照片出发,使用 LaMa 图像修复模型移除其中一个物体,并在该物体原本所在的位置画上一条涂鸦。未经修改的原始照片即为目标图像。ML-intern 在 CPU 沙盒环境中编写并测试了用于构建数据对的脚本,随后将其作为 GPU 任务运行,在此过程中记录了每一张源照片的作者及许可证信息。最终构建了 6,042 个训练对和 160 个测试对,其中测试对里有 40 对来自 23 个完全未参与训练的物体类别。
在训练前,团队分别对基座模型及搭配 Viggle turbo LoRA 的模型进行了基准测试,并验证了批量运行编辑能生成完全一致的图像,从而降低了评估成本。训练在单张 A100 上运行了 2,000 步,耗时 1 小时 38 分钟(约 4 美元),通过对比保存的检查点在 48 组测试样本上的表现,最终选定了第 500 步。
在搭配 6 步的 Viggle 轮 LoRA 时,LoRA 的性能非常好。67.5% 的物体在被绘制的位置被检测到,每次编辑耗时 4.7 秒。23 个未见类的物体检测率与其他物体相当(65.0% 对 64.2%)。这项工程花了一天多时间,耗费了 59 个工作位。总计算成本约为 24 美元。
4. 适合您设备的模型
- 文章开头提到的 Pocket Rewriter 是第一个案例。ML-intern 首先使用一个小型指令模型,通过 Inference Providers 生成了 8,797 条简短的图像请求,遵循提示词中设定的混合类型:照片、海报、标志、信息图表等,其中约三分之一要求包含引号内的确切文本,且许多请求使用非英语语言。随后,9B 教师模型在一块 A100 上耗时 2 小时 37 分钟(约 6.50 美元)重写了所有这些请求。经过质量筛选后,选出了 1,840 个样本用于训练数据集。
训练 0.8B 和 2B 学生模型分别需要 12 分钟和 18 分钟的 A10G 时间(两者共计 0.75 美元)。0.8B 模型也可以作为一个 812 MB 的 GGUF 文件在 CPU 上运行。这项工程花了大约 11 个小时和 24 个工作任务。总计算成本约为 16 美元。
查看:口袋重写器 0.8B 学生 · 2B 学生 · 数据集 · 口袋工作室应用 · 在重写器竞技场中比较教师和学生
- Agate Preview 002 4-step 是第二个案例。Logolabs 的 Agate Preview 002 是一个 260M 参数的文本到图像模型,足够小以在浏览器中运行,但它需要 50 个步骤的指导,这意味着每张图像需要 100 次网络遍历。作者要求 ML 实习生将其蒸馏为 4 步。
经过两轮尝试。第一轮将 15.5 万张训练图像缓存为 latents,把 guidance 烘焙进模型,然后在 A100 上分阶段将步数从 16 降至 8 再降至 4。在相同的 4 步设置下,该 4 步学生模型在 GenEval 和 FID 指标上超越了教师模型,随后 ML-intern 将其导出为 ONNX 格式以供浏览器使用。这一轮耗时约 13 小时,花费 22 美元。
作者进行了第二次培训,要求 ML-Intern 提高四步学习的质量。然后用 16 步的教师制造了 24,000 个图像对,并对 4 步的学生进行了约一个小时的微调。在 50 个步骤中,GenEval 分数从 0.509 升至 0.536,而老师的分数为 0.563,但只需 4 个步骤(计算量的四分之一)。ML-intern 重新导出了浏览器版本。第二次运行大约需要 8 个小时。两次运行的总计算成本约为 37 美元。
在您的浏览器中运行 Agate · Agate 4-step LIVE
成本汇总
| Model | Base 模型 | Compute |
|---|---|---|
| 西红医生 (Citrus Doctor) | Qwen 3.5-2B | USD 1.90 |
| 拥抱洛拉 (Huggy LoRA) | FLUX.2 Klein 4B | USD 7.60 |
| 口袋重写器 (Pocket Rewriter 0.8B 和 2B) | Qwen 3.5-0.8B 和 2B | USD 16.05 |
| 视点轨道 LoRA (Viewpoint Orbit LoRA) | Qwen Image 2.1 | USD 16 |
| 涂中的洛拉 (Doodle-in LoRA) | Qwen Image 2.1 | USD 24.30 |
| 石四步 (Agate 4-step, 两个运行) | Agate Preview 002 | USD 37 |
| Total | 大约 USD 103 |
以上数据为每个会话报告的 GPU 和 CPU 工作费用。
操作指南
在“拥抱聊天”(HuggingChat)中开启 ML-intern 模式并粘贴一个提示。如果需要起点,作者的示例提示可免费复制。从你希望存在的模型和你拥有的数据集开始,或者描述一个你能想到的模型。给它一个小的预算,要求一个基线和烟雾测试。





