模型与智能体

Holo4 发布:让同一个 AI 在界面、代码与 API 之间完成工作

Easycha 编辑部
#Holo4#计算机操作#智能体
EASYCHA 原创技术拼贴封面:笔记本电脑、鼠标和手机连接界面、代码、API 三张纸质卡片,标题为一个 AI,多种操作。
EASYCHA · AI 生成的编辑插图;设备画面与连接关系为概念示意,不代表 Holo4 产品截图或实测结果。
事件日期:2026 年 9 月 28 日 让 AI 操作软件,常见的两条路线是看屏幕点击,或通过工具接口调用功能。H Company 昨天发布的 Holo4 系列尝试把这些能力放进同一个模型:既能操作图形界面,也能编写和执行代码,调用 MCP 工具与 API,覆盖桌面、网页、Android 和代码沙箱等环境。 官方发布了什么 根据公司官网与其在 Hugging Face 的团队文章,Holo4 提供 27B 稠密模型和 35B-A3B 混合专家模型,两种规格均已接入 H Models API,并公开模型权重。团队同时介绍了基于 Nemotron 3 Nano Omni 进行后训练的 Holotron4 Nano。这里的多种操作方式是模型能力范围;要实际执行任务,还需要与之配套的工具和运行环境。 原文给出的演示包括在 FreeCAD 中建立三维模型,以及在 Godot 中制作并运行游戏。对开发者而言,这些例子的看点是连续工作:理解要求、选择操作方式、执行步骤、查看结果,然后继续推进,而不只是生成一段看起来正确的说明。演示属于发布方展示,本文未独立复现。 为什么需要在接口之间切换 一项业务任务往往横跨不同软件。有些数据可以通过 API 读取,有些文件适合用代码处理,还有些老系统只能在界面上提交。Easycha 分析认为,多接口智能体的价值,在于减少这些环节之间人工搬运信息的次数。例如先读取工单、整理附件,再把结果填入系统,是一种可能的应用方向,但不是本文已经验证的 Holo4 使用案例。 官方还介绍了 Agentic Task Factory:从文档、网站截图或开源软件出发构建交互环境与可验证任务,累计生成约一万个任务,覆盖网页、MCP 和桌面。部分环境让图形界面与 MCP 访问同一份状态,这为训练模型选择不同操作路径提供了条件。 模型之外,执行循环同样重要 发布方表示,他们也重建了负责执行动作和管理上下文的运行框架,重点包括在数百步操作中保留记忆,以及让 shell 运行在桌面所在的机器上。这个细节值得关注:如果文件在一个环境里、操作发生在另一个环境里,或长任务中丢失关键状态,单次回答能力再强,也可能无法完成工作。 Easycha 分析:接入这类模型时,应把工具定义、截图获取、文件可见性、状态记录与失败恢复一起设计。只替换模型名称,不能保证现有自动化流程立刻获得相同能力。 怎样读懂官方成绩 官网列出 Holo4 27B 在 OSWorld 2.0 上的平均部分得分为 61.7%,任务成功率为 41.5%,两者不是同一指标;该项结果来自发布方运行框架中的单次运行。部分步骤做对可以贡献得分,却不一定满足完整任务的验收条件。 原文也明确,不同参考模型的运行框架、任务子集和推理投入存在差异。AutomationBench 表格中的第三方公开集得分与私有集成本来源也不完全一致。因此,这些材料可以帮助挑选试用对象,但不宜直接拼成严格同条件的性价比排名,更不能当作自身业务的成功率承诺。 Easycha 建议:从可验收的小流程开始 先选择一个输入固定、结果容易检查的流程,用测试账号和有限工具权限运行,记录最终状态是否正确、总耗时、调用费用及人工接管次数。涉及提交或修改数据时,再检查失败重试会不会重复执行同一个动作。 相比仅观察模型能否点击正确按钮,更有意义的问题是:整件事是否完成、结果能否检查、出错后是否容易恢复。Holo4 的这次发布提供了新的多接口模型选择,真正的落地效果仍应由具体流程来验证。以上为官方资料整理与 Easycha 编辑分析,不包含新增性能实测。

来源与延伸阅读