Telnyx 将 Moonshot 的 2.8 万亿参数 Kimi K3 添加到其推理 API

David Casem 认为 Telnyx 能将一款前沿规模的开放权重模型与代理所需的网络、语音和消息基础设施相结合。

By · Published

Primary source: Telnyx

Why it matters

Kimi K3 became available from multiple inference providers within days of its weights release. Telnyx's advantage will depend on integrating inference with voice and network infrastructure, since access to the model is already widespread.

Illustration of Telnyx linking Moonshot's 2.8 trillion-parameter Kimi K3 to a vast network of AI agents flowing like a natural phenomenon.

Telnyx 在一篇 7月28日的发布说明 中表示,Moonshot AI 的 Kimi K3 已可通过 Telnyx Inference API 使用。Telnyx 由联合创始人兼首席执行官 David Casem 领导。

该发布推进了 Casem 一直在从一个不同寻常的起点构建的战略。Casem 是一位自学成才的工程师,曾在 Swarthmore College 学习经济学,他于 2009 年创立了 Telnyx,并用开源软件和 FCC 许可证构建了首个电话系统。此后几年,Telnyx 将运营商基础设施、电话号码和通信网络变成了 API。Casem 正在把同样的剧本应用到 AI 推理:拥有昂贵的基础设施,隐藏其运营复杂性,并向开发者按使用量收费。

Kimi K3 来自 Moonshot AI,该公司成立于 2023 年初,由 Yang Zhilin 领导。Yang 在 Carnegie Mellon University 获得计算机科学博士,并合著了具有影响力的 Transformer-XLXLNet 论文。这段研究历史在此处很重要:Moonshot AI 已将其产品身份建立在长上下文模型之上,而 K3 将该论点扩展到一百万 token 的上下文窗口。

Telnyx 在 7 月 28 日的说明中称 K3 已通过其托管 API 可用。Moonshot AI 的 Kimi K3 资料 描述了 2.8 万亿的总参数量、1040 亿的活跃参数以及 mixture-of-experts 架构,而官方在 Kimi K3 在 Hugging Face 的页面 将 K3 定位为开放权重发布。

无需集群的前沿级推理

Kimi K3 的头条参数量夸大了每个 token 实际运行的模型规模,因为一次只有 1040 亿参数处于激活状态。但总参数规模仍然带来了苛刻的服务问题。

Telnyx 正通过一个 兼容 OpenAI 的推理 API 出售对这套机器的访问。开发者选择 moonshotai/Kimi-K3,通过熟悉的 chat-completions 界面提交请求,并将 GPU 配置留给 Telnyx 处理。Telnyx 还在其 Inference 文档 中为实现细节提供指引。Telnyx 的 发布说明 表示该 API 支持 function calling、动态工具加载、受 JSON-schema 约束的输出以及自动提示缓存。推理强度可设置为 low、high 或 max。

该模型接受文本、图像和视频输入,其上下文窗口可达 1,048,576 token。这些规格使 Kimi K3 对需要保留大量工作上下文的长代码仓库、文档集合和 agent 会话具有相关性。但它们并不能保证在整个窗口范围内都能得到有用的结果。

Telnyx 收费 为:每百万缓存的输入 token 收费 $0.27、每百万未缓存的输入 token 收费 $2.70,以及每百万输出 token 收费 $13.50。对于反复发送相同系统指令、工具定义或仓库上下文的 agent,提示缓存可能会显著改变账单。输出仍然是请求中成本较高的一端,这促使开发者控制响应长度和 agent 循环。

Telnyx 表示 Kimi K3 在编码、推理和 agent 工作方面可与专有的前沿模型竞争。但这仍是供应商的基准声称,而不是证明 K3 在给定生产工作流中能匹配封闭模型的依据,因此各团队应在将流量迁移前在自己的工作负载上测试延迟、工具使用和输出质量。

Casem 的基础设施押注

Kimi K3 在 7 月推出后很快就进入了托管推理服务市场。Fireworks AI 也发布了他们自己的 Kimi K3 托管方案,推理提供商可以打包模型、优化服务栈,并在价格、速度、数据控制和可靠性上展开竞争。

Telnyx 的差异化在于围绕模型的基础设施。Telnyx 在推理之外还运营通信 API、电话号码、语音转文本、文本转语音、消息和语音代理工具。一个构建基于电话的 agent 的开发者可以使用 Telnyx 来处理通话、转录、模型请求和生成语音,而无需将多个供应商的服务拼接在一起。

Telnyx 在一篇 关于 AI 连接性的 Telnyx 文章 中阐明了这一立场,其更广泛的主张是从运营商网络到 AI 推理控制整个栈。这对于实时应用(例如语音代理)可能很重要,尽管 Telnyx 在发布说明中并未公布 K3 的延迟或吞吐量测量数据。

Casem 得到了一个前沿规模的模型,可以将推理流量拉入 Telnyx 更广泛的栈。双方都在贡献资本密集型的工作:Moonshot AI 训练了模型,而 Telnyx 运营将其变为生产端点所需的网络和 GPU。

术语 "open-source" 在此需要更精确的说明。Moonshot AI 已在一份 自定义的 Kimi K3 许可证 下发布 K3。某些年收入超过 2000 万美元的模型即服务企业在商业使用前必须与 Moonshot 签署单独协议。自定义条款使得对 K3 来说更精确的描述是开放权重(open-weight)。

Telnyx 的这一步显示了前沿模型变成基础设施库存的速度。Moonshot AI 将 Kimi K3 构建为开放权重模型,而托管提供商正着手使其通过标准 API 可调用。Casem 的赌注是:最终胜出的端点将是连接到 agent 其余运行栈的那个端点,从推理到承载对话的电话网络。

Reader comments

Conversation for this story loads after sign-in.