SpaceXAI 以 60% 的价格溢价发售 Grok Voice Think Fast 2.0

该语音到语音模型每分钟收费 $0.08,并将于8月5日成为默认的 Grok 语音 API 端点。

By · Published

Primary source: SpaceXAI on X

Why it matters

SpaceXAI is pairing a higher-priced model with automatic migration and a no-code builder, pushing Grok into revenue-generating support and sales calls.

SpaceXAI ships Grok Voice Think Fast 2.0 at a 60% price premium

Elon Musk (@elonmusk)'s SpaceXAI released Grok Voice Think Fast 2.0 on July 29th, pitching a faster and more accurate speech-to-speech model for developers building customer support, sales and other real-time voice agents.

SpaceXAI made the release available through the API and Voice Agent Builder, according to 一则 X 帖子 and a more detailed 产品公告. The model costs $0.08 per minute of audio, up 60% from the $0.05 rate for Think Fast 1.0. Text input adds $0.004 per request.

Musk 于 2023 年 3 月启动了 xAI 的运营并领导该公司,直到 SpaceX 在 2026 年 2 月 2 日 收购 xAI。一份 6 月的 SpaceX 招股说明书 将 Musk 列为 SpaceX 的 CEO、首席技术官和董事长。该说明书还回顾了他通过 Zip2 和 PayPal 的历程,并提及他在 University of Pennsylvania 的物理与商业学位。Grok 目前位于 SpaceX 的一个部门中,该部门整合了 AI 模型、消费和企业软件、X 平台以及计算基础设施。

此举显示 SpaceXAI 正将 Grok Voice 推向商业呼叫处理领域。SpaceXAI 在 7 月 1 日推出了 Voice Agent Builder 测试版,为开发者和运营者提供了一个可视化界面,用于配置带有电话号码、知识检索、工具、guardrails、录音和转录功能的代理。客户可以通过 SIP 连接现有号码,或使用 WebSockets 将代理接入到他们自己的应用中。

升级与迁移截止日期

SpaceXAI 表示 Think Fast 2.0 在生成语音的同时进行推理,使其能够在处理请求的过程中就开始回答。SpaceXAI 还表示,该模型在中位数情况下使用的推理 tokens 仅为 Think Fast 1.0 的 40%,这应当让工具调用在回复过程中更早执行。

此次发布对现有客户带来了迁移决定。8 月 5 日,grok-voice-latest 别名将自动从 Think Fast 1.0 切换到 Think Fast 2.0。希望保留更便宜模型的开发者必须在该切换之前将 grok-voice-think-fast-1.0 固定。

这种默认迁移为 SpaceXAI 提供了一条将现有使用量迁移到更高价模型的直接路径。在持续大规模使用下,差异是实质性的:一小时音频费用在文本输入费用之前从 $3 上升到 $4.80。SpaceXAI 要求客户为更好的任务完成率、转录质量和对话时机接受这项增长。

SpaceXAI 宣称 Think Fast 2.0 在 Artificial Analysis Speech-to-Speech Index 上取得了 82.9% 的得分,而 Think Fast 1.0 为 75.7%,OpenAI 的 GPT-Realtime-2.1 High 为 79.1%。其宣称到首个音频的时间从 1.25 秒降至 0.70 秒,同时在以客户服务为重点的 tau-voice 基准上的得分从 52.1% 上升到 56.5%。

Artificial Analysis 排行榜 证实了这些数据,同时将它们置于更广泛的比较中。Alibaba Cloud 的 Qwen Audio 3.0 Realtime Plus 在总体指数中以 84.1% 位列第一,领先于 Grok 的 82.9%。根据同一排行榜,Deepslate Opal 和 Google 的 Gemini 2.5 Flash Native Audio Dialog 在生成首个音频的速度上也更快。Grok 的最强项是代理性能:其 56.5% 的 tau-voice 得分在 Artificial Analysis 列出的模型中位居前列。

SpaceXAI 另称,一项对 24 种语言、数千条短语的内部评估显示,Think Fast 2.0 在转录错误率上比 Deepgram Nova 3 和 ElevenLabs Scribe v2 低约 1.5 到 2 倍。它表示在背景噪声和电话压缩情况下,这一优势扩大到约 10 倍。这些转录数据来自 SpaceXAI 自身的评估,而非独立排行榜。

全栈语音产品

SpaceXAI 正在销售一个集成的语音到语音解决方案,而不是将语音识别、语言和语音生成服务分开组装。其 Voice Agent Builder 将该模型与处理电话呼叫、检索内部文档、调用外部工具、转接来电以及回顾已完成对话所需的基础设施捆绑在一起。

这使 SpaceXAI 直接与 OpenAI 的实时模型和 ElevenLabs Agents 以及来自 Google 和 Deepgram 的语音基础设施展开竞争。采购标准已经超越了代理能否进行令人信服的演示对话。将代理部署到呼叫中心的开发者必须衡量延迟、中断处理、在差音质下的转录、工具执行成功率以及每分钟的成本。

SpaceXAI 在 Musk 的其他业务中有一个现成的试验场。SpaceXAI 表示它在 Starlink 的客户电话线上测试了 Think Fast 2.0,并记录到了更高的销售转化率和支持问题的遏制率。此次发布将该内部部署转变为开发者产品,将 SpaceX 的分发和计算资源与为生产呼叫量定价的模型相结合。

Reader comments

Conversation for this story loads after sign-in.