Oumi、Larridin 和 Runware 构建工具以削减企业人工智能账单
创业者正在为那些在追踪其回报之前就采用了昂贵的前沿模型的买家构建测量、路由和基础设施产品。
By Ryan Merket · Published
Primary source: Business Insider
Why it matters
Enterprise AI adoption has moved from experimentation to cost control. The founders that own measurement and routing could influence which models companies buy and how much work reaches frontier labs.
Manos Koukoumidis 发现了一个商业机会,源自企业 AI 购买者自己制造的问题:他们快速采用了强大的模型,却发现便利伴随着一笔无上限的账单。
Koukoumidis,Oumi 的联合创始人兼 CEO,在 Business Insider 在 2026 年 8 月 2 日发表的一篇报道 中将常规使用昂贵的前沿模型来处理狭窄任务描述为“广泛非理性且低效”。他的处方是为公司提供针对特定工作调整的小模型,而不是将每个请求都发送到 OpenAI、Anthropic 或 Google 的通用系统。
这一论点基于 Koukoumidis 在既有技术栈内部的经验。他此前负责 Google Cloud 的生成式 AI 工作,根据 Oumi 在 2025 年 1 月的发布公告。Koukoumidis 拥有 Princeton 的博士学位,并在其论文中认为 AI 需要一个类似 Linux 的开放开发平台。Oumi 现在提供用于在本地机器、云提供商和商业 API 之间构建、微调、评估和部署模型的工具。
Oumi 在 2024 年完成了由 Venrock 和 Obvious Ventures 领投的 1000 万美元种子轮融资,Plug and Play 和 Ascend 也参与其间。那笔融资以及 Oumi 在 2025 年 1 月的公开发布已成既定历史。目前的发展是围绕 Koukoumidis 的诊断形成的市场。顾问、测量平台、模型路由器和推理提供商都在争取成为那一层,告诉企业哪些 AI 值得为其买单。
账单在试验之后到来
早期的企业 AI 项目以采纳为奖励。员工获得了聊天机器人和编码助手的访问权限,产品团队增加了模型 API,管理层将使用情况视为 AI 战略开始落地的证据。成本归因和经验证的生产力提升往往是后来的事情。
FinOps Foundation 在 2026 年的报告 发现,98% 的受访者在管理 AI 支出,高于 2025 年的 63%。受访者将对 token、模型请求和 GPU 使用的细粒度跟踪排名为他们最希望拥有但缺失的工具能力。他们还将成本分配和确定 AI 的商业价值视为持续存在的问题。
这一差距为诸如 Adaptovate 的顾问创造了空间。Michael Murphy,一位曾在 Deloitte 负责转型项目的 Adaptovate 合伙人,告诉 Business Insider 工作从有关组织结构、人才和运营模型的决策开始。Adaptovate 的任务范围从帮助食品制造商在其供应链中引入 AI,到帮助一家拥有 3 万名员工的专业服务机构围绕生成式 AI 产品重塑团队。
当 AI 采纳变成组织重塑而不是一次软件购买时,顾问受益。他们面临的挑战是证明新的运营模型在扣除实施成本、培训和底层模型账单后仍能产生可衡量的收益。
Larridin 希望衡量回报
Larridin founders Russ Fradin and Jim Larrison 从数字测量领域切入这一问题,后来又帮助创建了 Dynamic Signal。他们与联合创始人兼 CTO Ameya Kanitkar 一起建立了 Larridin,Kanitkar 曾在 LinkedIn、Coinbase 和 Groupon 等公司任职,具备工程与数据方面的管理经验。
他们的产品,Larridin Scout,监测员工使用哪些 AI 应用、使用频率以及员工如何评估由此带来的生产力提升。Larridin 表示 Scout 能识别 300 多种 AI 工具,并每 15 分钟刷新一次使用数据。Scout 还将被动活动检测与员工调查结合起来,这为管理层提供了采用情况视图,同时将部分生产力计算依赖于自我报告的结果。
Kanitkar 告诉 Business Insider,Larridin 起步缓慢,因为早期购买者对支出不那么在意。他说,自 2026 年初以来,随着企业承诺的增加,其使用势头每个季度翻倍。那个增长率是 Larridin 自身的运营衡量指标。
Larridin 在 2025 年推出了 Scout,并从 Andreessen Horowitz、Bloomberg Beta、GV 等投资者那里筹集了 1700 万美元的种子资金。Larridin 的创始人押注 AI 支出将需要类似于商业网络之后出现的分析基础设施的测量层。这个类比是有用的,尽管 AI 归因更难:一次点击可以被直接计数,而模型节省的时间或改进的工作取决于工作流、员工行为以及管理层选择的基准。
构建者针对单位成本出击
其他创始人则在费用到达财务仪表板之前进行攻击。
Flaviu Radulescu,Runware 的创始人兼 CEO,花了 20 多年构建数据与计算基础设施,包括为 Booking.com、Vodafone 和 Transport for London 构建的系统。他于 2023 年创立 Runware,并设计了围绕 GPU 的定制推理集群,涵盖存储、冷却和其他硬件组件。
Runware 联合创始人 Ioana Hreninciuc 带来了来自 Homa Games、Huuuge Games 和 GameAnalytics 的产品与运营背景。Business Insider 将 Runware 归为尝试在基础设施层降低 AI 成本的构建者之一。
Runware 销售一个统一的 API,用于在图像、视频、音频和语言模型之间切换和路由工作。Runware 在 2025 年 12 月 11 日宣布完成一轮 5000 万美元的 A 轮融资,由 Dawn Capital 领投,Comcast Ventures、Speedinvest、Insight Partners 和 a16z Speedrun 参与。Runware 表示,其基础设施当时已为超过 20 万名开发者处理了 100 多亿次生成。这些数据以及 Runware 关于价格与性能改善的主张来自 Runware 自身。
Junchen Jiang 在 Tensormesh 追求一个更窄的技术切入点。Jiang 是 University of Chicago 的计算机科学教授,他共同创建了 LMCache,这是一个用于保留模型在处理提示时生成的中间数据的开源项目。Tensormesh 将该研究商业化,以便重复的上下文可以被重用,而不是在每次请求时重新计算。
2026 年 5 月,Tensormesh宣布获得来自 AMD Ventures、CoreWeave、NVentures、Valley Capital Partners 和 Laude Ventures 的 2000 万美元新融资,将其公布的总额带到 2450 万美元。Tensormesh 声称其缓存可以将延迟和 GPU 支出减少多达 10 倍,而其自身披露则表示结果因工作负载、硬件和基础设施配置而异。该轮融资为 Tensormesh 带来了一个不寻常的投资者阵容:几位支持者销售或融资 Tensormesh 试图提高利用率的计算设备。
Conifer 从最便宜的模型开始
在该类别的最早端,Michael Jeffords 和 Charles Muehlberger 正在建设 Conifer,这是一家位于旧金山、由三人组成的公司,属于 Y Combinator 2026 年夏季批次。
Jeffords 之前从事临床研究和用于检测神经系统疾病迹象的机器学习系统方面的工作。Muehlberger 是一位来自 Princeton 的工程研究人员,其工作包括边缘设备上的多模态推理和物理神经网络。他们的产品将来自用户自身硬件的每个查询先路由到一个高效的云模型,最终在任务需要时再转到前沿模型。
Conifer 告诉 Business Insider,在 Demo Day 之前已经筹集了 130 万美元,约占其目标的 20%。
创始人的路由层级体现了该类别背后的核心押注。前沿模型在难度较大的工作中仍然有用,而更小、更本地化的系统可以承担日常请求。能够在推理开始前识别两者差异的买家,有机会在不简单地施加使用限制的情况下降低成本。
持久的企业需要证明其在明确基准下的节省,并在模型价格下降时留住客户。测量提供商必须将活动与业务结果连接起来。路由器需要足够的工作负载数据以准确选择模型。基础设施提供商必须在芯片、开源模型和既有 API 改善的情况下保持其成本优势。
企业买家曾把最大程度的模型访问视为最安全的 AI 策略。Koukoumidis、Kanitkar、Hreninciuc、Jiang、Jeffords 和 Muehlberger 正在为下一阶段构建:届时每一个 token、每一次 GPU 周期和每一份企业许可证都必须证明其值得计入账单。