Hark 推出 Handoff,以在整个网络上自动化多步骤任务

Hark 正进入测试版,并正在审查其平台的申请,而 Handoff 推出时,公司报告称其在基准测试中具有领先优势,但没有独立验证,且账户保障尚未解决。

By · Published

Primary source: VentureBeat

Why it matters

Handoff is the first test of whether Brett Adcock can turn Hark's $700 million Series A into a useful product before its planned hardware arrives.

Illustration of Hark's Handoff represented by a hand passing a glowing Handoff app icon between two browser windows

Hark 创始人 Brett Adcock (@brettadcock) 于 2026 年 8 月 5 日宣布了 Handoff,为 Hark 带来了首个公开产品:一个获取虚拟计算机、打开网站并尝试为用户完成多步骤任务的代理。

研究预览,最初由 VentureBeat 报道,是 Adcock 在 Hark 于 2026 年 5 月以 $6 billion 估值完成 $700 million 的 A 轮融资后计划构建内容的首次具体展示。Hark 的网站 表示公司正在进入测试版并审查申请,而 VentureBeat 报道称,软件平台的访问计划在 8 月晚些时候开放。

VentureBeat 的发布报道称 Handoff 可以在 LinkedIn 上识别并向候选人发送消息。在 Hark 的发布视频中,Adcock 表示他在“所有的招聘工作端到端”都使用该代理。

Adcock 通过招聘进入初创公司领域。Archer Aviation 的代理声明 表示他在佛罗里达大学获得工商管理学位,并在共同创办在线招聘市场 Vettery 之前从事投资银行和对冲基金工作。Adecco 于 2018 年收购 Vettery,这为 Adcock 随后在 Archer Aviation 投注电动飞机和在 Figure AI 投注类人机器人的举措奠定了基础。

这些经历使得招聘成为 Handoff 的自然试验场。这是 Adcock 熟悉的工作流程,充满重复性的浏览和消息发送,也包含可能暴露出自治软件局限性的敏感决策。

在硬件之前的产品

对于每个请求,Hark Handoff 会创建一个配备浏览器、文件系统和终端的专用虚拟计算机。它通过点击、滚动和输入在网站上操作,而不是等待每项服务提供 API。用户可以连接现有账户,允许代理使用已保存的地址、偏好、付款方式和账户历史记录。

VentureBeat 报道称 Hark 展示了 Handoff 点餐、预订航班和给求职候选人发信息的演示。该报道还引用了酒店预订、在线调研和购物等 Hark 表示代理可以执行的任务。

这一范围对 Adcock 的押注至关重要。Hark 表示,对近 300 万分钟的屏幕活动分析发现,人们 74.9% 的时间花在浏览器中,而每千个网站中不到一个提供公共 API。这些数据由 Hark 提供,但基本的产品决策很直接:一个有用的通用代理必须能操作人们已经使用的网站。

Handoff 也缩小了 Hark 的初始野心。Adcock 曾将 Hark 描述为一个垂直整合的个人智能公司,涵盖模型、软件和定制设备。5 月的融资公告 表示 Hark 在 Parkway Venture Capital 的带领下以 $6 billion 的投后估值筹集了 $700 million。Nvidia、AMD Ventures、Intel Capital、Qualcomm Ventures、Salesforce Ventures、ARK Invest、Brookfield、Greycroft、Prime Movers Lab、Align Ventures 和 Tamarack Global 等参与了此次融资。

RuntimeWire 报道该轮何时完成 时写道,融资规模给 Hark 带来了异常的压力,要求其将关于个人 AI 和原生硬件的广泛承诺转化为用户可以评估的东西。Handoff 是 Adcock 的第一个回应。它是软件,在浏览器中运行,并能在 Hark 发货设备之前接触到用户。

基准领先有其界限

Hark 表示 Handoff 在 Online-Mind2Web 上得分 为 97.7,该基准测试将代理与实时网站对比。Hark 把这一结果与 OpenAI 的 GPT 5.4(92.8)、Anthropic 的 Claude Opus 4.8(84.1)和 Google 的 Gemini 2.5 Pro(69)进行了比较。

这一说法在很大程度上仍需 Hark 证实。公开的 Online-Mind2Web 排行榜并未独立验证 Hark 的 97.7 分,且 Hark 的比较排除了无法获得等效公开结果的更新前沿模型。

Hark 并未在其披露的每项测试中领先。VentureBeat 报道称,在 WebTailBench v2 上,Handoff 得分为 68.6,而 GPT 5.5 得分为 72.3。Hark 在自己的测试框架中运行了该基准和一次内部评估,使用内部模型评判器来计算通过率。

速度数据同样需要相应的背景。Hark 报告每轮对话的模型延迟为 0.8 秒,且 token 费用为每百万输入 tokens $0.18、每百万输出 tokens $2.37。Hark 在自有测试框架中生成了这些竞争者的测量结果,并将竞争模型设置为其最高推理级别。

成本说法可能成为 Handoff 最有力的开场。一个在浏览器中循环执行数十个操作的代理成本可能很快上升,因此更低的推理成本可能与狭义的基准领先一样重要。这一优势取决于 Hark 是否能在普通用户工作负载下交付其所报道的性能。

Hark 仍依赖未具名的基础模型

Hark 表示该预览模型通过监督微调随后进行强化学习来开发。Hark 承认目前仅完成了训练后阶段(post-training),计划在今年晚些时候进行预训练(pre-training)。

这一顺序意味着最初的 Handoff 模型建立在 Hark 未进行预训练的基础模型之上。Hark 尚未指明该模型,也未详述 Handoff 背后专有与开放训练数据的混合构成。此省略之处很重要,因为 Hark 更广泛的论点依赖于将模型、软件和硬件作为一个系统来控制。

即便在第一天没有拥有每一层,Handoff 仍可以成为有用的产品。从训练后阶段开始使 Hark 能在其更大的模型项目仍在组装时测试代理架构、训练流水线和用户体验。它也为 Adcock 在将 Hark 的资金投入预训练之前收集真实任务数据提供了一种方式。

账户访问提高了风险

使 Handoff 有用的同一架构也带来了最尖锐的产品风险。能够登录航空、购物和招聘账户的代理可以看到地址、付款信息、消息和文件。一次错误可能会造成购买、发送消息或暴露私人数据,而不仅仅是产生一个糟糕的聊天机器人回答。

Hark 表示安全和隐私是优先事项,但技术预览尚未具体说明其虚拟计算机的访问控制、文件和凭证的保留时长,或谁可以查看会话。这些细节将决定 Handoff 是保持为一项面向消费者的便捷功能,还是成为公司信任其处理运营性工作的软件。

Adcock 现在已用一个产品来支撑 Hark 那笔异常巨大的融资和估值。Handoff 展示了从他的招聘经验通向更广泛个人代理的可信路径,其虚拟计算机设计为模型提供了一个实用的方式来访问那些从未为 AI 构建的网站。下一个考验将在 Hark 自己的演示和评测框架之外发生:当用户将真实账户交给代理并期望它安全完成任务时。

Reader comments

Conversation for this story loads after sign-in.