法国H公司发布Holo 4等GUI计算机使用模型

法国H公司发布Holo 4等GUI计算机使用模型,旨在突破AI代理在桌面环境中的操作局限。该模型基于Qwen架构微调,支持RTX 3090等低配硬件本地运行,并已在Hugging Face开放权重下载。

法国人工智能模型开发者 H 于周一发布了两款专为处理图形用户界面(GUI)设计的计算机使用模型,旨在解决 AI 代理在桌面环境导航中的局限性。长期以来,计算机交互主要分为命令行接口(CLI)、应用程序编程接口(API)和 GUI 三类。虽然 AI 代理能轻松适配前两者,但在浏览 Windows 或 Linux 桌面时,往往难以兼顾功能与形式,导致操作效率低下。

24GB显存即可运行Holo 4

H 推出的 Holo 4 模型基于阿里巴巴的 Qwen 3.8 27B 和 Qwen 3.6 35B-A3B 架构构建,通过监督训练和强化学习进行微调。该模型具备指向、点击、滚动和打字等基础操作能力,声称在优化 CLI、API 和 GUI 场景后,其多功能性超越了纯计算机使用模型。此外,H 还更新了基于 Nvidia Nemotron 3 的 Holotron 模型,赋予其类似的能力。

在演示案例中,Holo 4 27B 展示了利用 FreeCAD 宏函数编程设计埃菲尔铁塔 3D 模型的能力,而非通过手动构建立方体等原始几何体完成;另一项演示则显示该模型能通过挤出形状重新创建公司标志,体现了其在复杂任务中的灵活性。

尽管 H 宣称 Holo 4 性能优于 OpenAI 等大型前沿模型,但其成本优势并不明显。数据显示,虽然得分更高,但在许多任务中 Holo 4 的单次执行成本反而高于竞争对手。这可能是因为 Holo 4 使用了更多的“思考”代币以接近 GPT-6 Luna 的最终结果,而后者在 OSWorld 2.0 基准测试中表现稍逊但成本更低。

得益于开放权重和较小的模型尺寸,研究人员和企业可在相对低配的硬件上运行这些模型。例如,配备 24GB 显存的 Nvidia RTX 3090 显卡即可支持以 4 位精度运行 Holo 4。H 已在 Hugging Face 平台提供 BF16、FP8、NVFP4 权重以及适用于 Llama.cpp、LM Studio 和 Ollama 的 GGUF 版本。此外,该公司计划发布 DSpark 草稿权重,利用投机解码技术——即通过小模型预测大模型输出来加速推理过程。

H 同时开发了开源的 HAI-Agents 套件,已托管于 GitHub,理论上可与第三方计算机使用工具协同工作。目前,计算机使用模型的开发已成为行业热点,AWS 在去年的 Re:Invent 会议上宣布了自己的相关模式,OpenAI、Google 和 Anthropic 三大实验室也在积极投入这一领域。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读