

H Company 近日发布了新一代代理模型系列 Holo4。该系列包含两种规格:27B 稠密模型和 35B-A3B 混合专家(MoE)模型,两者均已上线 H Models API。与此同时,团队还推出了最新版本的 Holotron 3 后续产品——Holotron4 Nano。
Holo4 旨在支持通过多种界面与软件交互,包括图形用户界面(GUI)、代码、MCP 协议及 API。尽管在学术基准测试中表现优异,其开发重点在于满足真实的商业工作流程需求。训练过程结合了监督微调与强化学习,涵盖大量环境与任务,其中包括由内部“代理任务工厂”生成的数据。
- Holo 模型:Holo4-27B、Holo4-35B-A3B、Holotron4 Nano
- 整体收藏格式 (FP16, FP8, GGUF): Holo4
- 轨迹数据:Viewer 数据集
- H Models API: Quick Start
- 完整技术博客:hcompany.ai/newsroom/holo4
多接口统一建模
传统代理模型往往局限于单一交互模式:以 GUI 为中心的模型缺乏屏幕信息时无法工作,而依赖工具调用的模型在面对无 API 应用时则显得无能为力。然而,实际业务任务常需结合多种交互方式。Holo4 能够根据任务需求灵活选择点击输入、编写运行代码或调用 MCP/API 工具。
该模型可在桌面、Web、Android、代码沙箱及商业 API 环境中运行,且在各平台间保持模型一致性与命名统一,无需为不同平台切换专用模型。

基于 Qwen 架构改进的 Holo4 模型在长程工作流中展现出竞争力。在 OSWorld 2.0 基准测试中,Holo4 27B 得分为 61.7%,接近 Opus 5.5 的 81.8%;Holo4 35B-A3B 得分为 30.9%。值得注意的是,Holo4 以更少的参数和更低的成本实现了上述性能。所有公开基准测试的成绩轨迹均可在 trajectories.hcompany.ai 回放,或从 Hugging Face 下载。
低成本下的前沿性能
在桌面控制(OSWorld 2.0)和 API 使用(AutomationBench)等高难度学术基准上,Holo4 在与前沿模型竞争的同时,显著降低了单任务执行成本。


专业软件中的实际应用
得益于在代理任务工厂构建的环境中进行训练,Holo4 在处理复杂专业软件任务时表现出色。以下案例对比了 Holo4 27B 与其基础模型 Qwen3.8 27B 在相同提示词下的表现。
3D 建模 · 埃菲尔铁塔
在 FreeCAD 中构建埃菲尔铁塔的 3D 模型,尺寸为 1 毫米至 1 米,以原点为中心,并与 X 和 Y 轴对齐。这座塔是方形的计划在每一个高度,从来没有圆形。它的半宽,从中央轴测到角落,在地面上为 62.5 毫米,在 57 高度为 32.5 毫米,在 115 高度为 17.5 毫米,在 276 高度为 9.35 毫米。在这些高度之间,半幅沿着一个光滑的曲线,gent 的接近地面和轻轻地更高,从来没有直线。四个相同的脚,每个象限一个,每一个正方形柱子的外角遵循这个轮。每条腿在地面上的直径为 14 毫米,在高度 276 时 ta 缩至 4 毫米。腿从地面分开到第一个平台,它们在上升时汇聚。没有什么能填补它们之间的空间:这座塔是开放的,你可以从各个方面直接看到它。三个平台,每一个都以轴为中心的坚固方形板块:直径 72 毫米,高度厚 4 毫米;横 40 毫米,高 3 毫米的厚度 115; 长度:横 22 毫米,高 3 毫米。一个高 276 至 324 的。杆,正方形,底部 8 毫米,尖端缩小至 2 毫米。每个零件必须是封闭的固体,体积不等于零,任何零件不得填补脚间的空间。
Holo4 27B:84 次调用,消耗约 130 万代币
Qwen3.8 27B:60 次调用,消耗约 1 亿代币
3D 建模 · H 标志
在 FreeCAD 中构建一个 H 公司标志的 3D 模型:一个固体填充的磁盘旁边是一个块状的无。凸大写字母 H,两者挤出到相同的厚度,两种形状的高度相似,并分开,所以它们不会重叠,磁盘的中心与 H 的中间水平。颜色两个形状的黑色。
Holo4 27B:94 次调用,消耗约 150 万代币
Qwen3.8 27B:118 次调用,消耗约 190 万代币
游戏设计 · Pac-Man
在 Godot 中建立一个 Pac-Man 风格的游戏,并让它运行。一个矩形迷宫的墙壁铺设在一个网格,与颗粒填补每一个开放的走廊。一个球员在走廊上不停地移动,吃掉它经过的每颗颗粒,并为此得分。三个幽灵穿过同一个走廊追逐玩家。如果幽灵抓住玩家,玩家会失去一个生命,一切都会恢复到原来的位置。在屏幕上描绘得分和生命。没有人会玩这个。玩家用一个简单的启发式驱动自己:在每个交叉点上,它朝着最近的颗粒方向前进,除非一个幽灵靠近,在这种情况下它会远离幽灵。游戏必须无人监督,无限期运行,没有键盘输入。当它起作用时,开始游戏,让它继续。
Holo4 27B:68 次调用,消耗约 240 万代币,生成 268 行代码
Qwen3.8 27B:197 次调用,消耗约 114 万代币,生成 327 行代码
技术实现细节
代理任务工厂
H Company 内部的代理管道仅依据文档即可构建互动环境和可验证任务。目前,该系统已在 Web 应用、MCP 服务器和桌面环境中生成了约 10,000 个任务,其中包括通过 GUI 和 MCP 暴露相同状态的混合环境。

训练流程

Harness 优化
在训练期间,团队重构了执行循环(Loop Band),用于管理模型动作及数百步内的上下文。代理商标记任务失败原因,工程师据此审查修复方案。关键改进在于为代理提供了可靠的内存机制,使其能够跟踪长达数百步的操作历史。

注:Opus 5 (70.2%) 和 GPT-5.6 Sol (66.2%) 的参考分数来自 OpenAI 发射图中的 v2026.08.08 离线设置,采用最大努力部分奖励计算,与成本-性能图表保持一致。其他参考分数源自模型卡和官方排名表,因任务释放版本、子集及工具差异可能存在偏差。
Holotron4 Nano
作为 NVIDIA Nemotron 联盟成员,H Company 将其后训练堆栈应用于 Nemotron 3 Nano Omni 模型,推出了 Holotron4 Nano。这是 Holotron3 的后续产品,旨在将通用基础模型转化为跨界面和环境通用的代理模型。
经过适配,Holotron4 Nano 在 GUI 工作流程以及涉及 MCP、API 或编码沙箱的环境中,相比基础模型有显著提升。

收益体现为相对于 Nemotron 3 Nano Omni 的绝对百分点提升。该方法论表明,通用模型可被高效转化为代理专家,且不依赖于特定模型尺寸。
可用性与格式
Holo4 的两种尺寸模型现已在 H Models API 上线,支持 BF16、FP8、NVFP4 及 4 位 GGUF 格式。未来几天内,团队还将发布优化的 DSpark 抽象检查点,以进一步提升推理速度。





