H Company 开源 Holo4 计算机操作智能体:27B 上 OSWorld 85.2%,每任务 8 美分
H Company 于 2026-09-28 发布开源权重计算机操作智能体 Holo4:27B 版 OSWorld 85.2%、每任务 0.08 美元,35B-A3B 版 Apache 2.0 可商用。长流程 OSWorld 2.0 上 61.7%,附授权差异提醒。
2026-09-30 · H Company 官方 Newsroom(Holo4: powering generalist computer-use agents)
发布 2026-09-30核实 2026-09-30要点
- H Company 于 2026-09-28 发布 Holo4,一组开源权重的计算机操作(computer-use)智能体模型,同时提供自家的 H Models API。同期还发布了 Holotron4 Nano(把同一套后训练配方用在 NVIDIA Nemotron 3 Nano Omni 上)。
- 两个尺寸:Holo4 27B(dense,基于 Qwen3.8 dense)与 Holo4 35B-A3B(MoE,35B 总参 / 约 3B 激活,基于 Qwen3.6-35B-A3B)。官方模型卡标注最大上下文 262,144 token。
- 授权分叉,这是本条最该先看的一点:27B 权重为
CC BY-NC 4.0(非商用),35B-A3B 权重为Apache 2.0(可商用)。想自部署跑商业场景,只能选后者;27B 的商用要走 H 自己的 API。 - OSWorld(短任务):27B 85.2%、每任务约 $0.08;35B-A3B 80.8%、约 $0.05。作为对照,官方表列 Qwen3.8 27B 为 84.3% / $0.22。
- OSWorld 2.0(长流程):27B 61.7%、每任务约 $1.22;35B-A3B 30.9%、约 $0.61。官方表列 Claude Opus 5.5 为 81.8% / $8.48——差距仍然明显,但成本差了一个数量级以上。
- API 定价(每百万 token):27B 输入 $0.40 / 缓存 $0.04 / 输出 $3.00;35B-A3B 输入 $0.30 / 缓存 $0.03 / 输出 $2.00。
- 权重格式:BF16、FP8、NVFP4 与 4-bit GGUF,均可在 Hugging Face 下载;配合开源的
hai-agentsharness(把截图与工具结果喂给模型,再执行它要求的点击、输入、代码与工具调用)。 - 官方开源了每条基准轨迹(Hugging Face 数据集 + 可回放 viewer),这是目前开源 CUA 模型里比较少见的做法。
背景与分析
它解决的不是「更聪明」,而是「接口不统一」
官方把问题讲得很具体:
- 只会点 GUI 的模型,在没有屏幕的环境里没法用;
- 只会调工具的模型,遇到没有 API 的应用就卡住;
- 真实的业务任务往往两者都要——比如「从后台 GUI 导出一份报表,再调 API 把数据写进另一个系统」。
Holo4 的定位是一个模型通吃桌面、Web、Android、代码沙箱与业务 API,不需要按平台换模型。对有大量遗留内部系统(老 CRM、供应商门户、没有 API 的后台)的团队,这个定位比基准分数更值钱。
授权分叉:别只看「开源权重」四个字
这是本条最需要读者记住的一点,也是很多「开源模型」报道会漏掉的:
| 模型 | 权重授权 | 能否自部署商用 | 说明 |
|---|---|---|---|
| Holo4 27B | CC BY-NC 4.0 | 分数更高、每任务更便宜,但商用必须走 H 的 API | |
| Holo4 35B-A3B | Apache 2.0 | 分数较低但可自由自部署商用 |
AI 之家 观点:这是一种很典型的「开源但不放开」策略——把难服务、成本高的 MoE 版放出去,把便宜又好用的 dense 版拴在自己的 API 上。对使用方来说不是坏事,但采购时必须按仓库逐个确认授权,不能凭「Holo4 是开源权重」这一句话就做技术选型。顺带一提,这类「同一家族不同授权」的做法近两年越来越多,写进架构决策记录里的应该是具体的模型卡 URL,不是家族名。
基准怎么读:61.7% 不等于「61.7% 的任务做完了」
OSWorld 2.0 用的是部分得分(partial reward)——一个没跑完的流程也能拿到部分分。所以 61.7% 不能被读成「端到端成功率 61.7%」。官方表同时给了 27B 的 41.5% 成功率,这个数字才更接近「真做完了」。
另外三点口径提醒:
- 跨源数字不可直接横比:官方明确说明 Holo4 的分数来自自家 harness,而对照的前沿模型分数来自各自的模型卡、官方榜单与厂商图表,harness 与 effort 档位都不同。
- AutomationBench 有数据污染提示:官方自述公开集 v1.0.6 的 600 个任务里,480 个落在训练数据所取自的 split 里;在 120 个 held-out 任务上,27B 为 49.3%、MoE 为 31.7%。
- 成本是「每任务模型成本」,不含工程成本:$1.22/任务 看着便宜,但你还要算 GPU、harness 运维、失败重试与人工复核。
训练配方里最值得抄的一段
官方披露的做法里,有一条对做 Agent 的团队特别有参考价值:
- 用内部的 Agentic Task Factory 从文档(真实网站截图、开源软件)自动生成可验证任务,至今约 1 万条(Web 应用约 4000、MCP 服务约 3000、桌面环境约 3000),其中还有同一状态同时暴露 GUI 与 MCP 的混合环境;
- SFT 用了 1270 亿 token,约四分之三是成功的智能体轨迹(桌面 45%、Web 14%、MCP/API 12%、移动端 3%);
- 之后做长程任务的异步在线 RL,训出两个专用 LoRA 专家(一个管桌面/Web,一个管终端/MCP/API),再等权合并回 SFT 模型,不再训练;
- 同时重建了 harness,加入跨数百步的持久记忆与桌面机器的直接 shell 访问。
「分域训 LoRA 再合并」这一步尤其实用——它绕开了「一个模型要同时擅长 GUI 和 terminal 导致互相干扰」的老问题,而且成本远低于全参训练。
对开发者的影响
- 先按授权选,再按分数选。 要自部署商用 → 35B-A3B(Apache 2.0);能接受调 API → 27B 更划算。
- 拿 OSWorld 2.0 的成功率(41.5%),不是部分得分(61.7%) 去估你的业务吞吐。
- 长流程任务先小范围试点。 官方自述「只落后最强的闭源模型」,但 61.7% vs Opus 5.5 的 81.8% 是实打实的差距,先在你自己的任务队列上量完成率。
- GUI 回退要有开关。 能用 API 就别用 GUI;Holo4 的多接口能力是优势,但 GUI 路径的可观测性天然更差。
- 轨迹数据是额外红利。 官方开放了全部基准轨迹,做 CUA 评测的团队可以拿它当公开参照集。
待核实
- Holo4 在 Hugging Face 上的确切仓库路径与模型卡措辞:本文依据官方 Newsroom 与二手报道的转述,未逐字核对模型卡。
- DSpark drafter checkpoint 的发布时间:官方称「未来数日」,无确定日期。
- H Models API 的中国大陆可用性与计费:官方未说明区域限制。
- Holotron4 Nano 的独立授权条款:官方页面未在同处列出。
来源
- H Company 官方 Newsroom(Holo4: powering generalist computer-use agents):https://hcompany.ai/newsroom/holo4