Mistral 推出 Agentic Search,旨在让企业级 AI 能持续执行搜索
Arthur Mensch 的 Mistral 表示,其检索循环在公司进行的测试中将 FinanceBench 的准确率从 26.7% 提升到 86%。
By RuntimeWire Staff · Published
Primary source: Mistral AI
Why it matters
Enterprise agents fail when they cannot locate and verify private information. Mistral is turning retrieval into a core product as it builds beyond foundation models.

Arthur Mensch 的 Mistral AI 在 8 月 20 日推出了 Agentic Search,为企业 AI 系统提供了一个多步骤的检索循环,用于搜索、打开并阅读长文档,而不是仅从首次收到的一批文本片段中给出答案。
Mensch(前 Google DeepMind 研究员)于 2023 年与曾在 Meta AI 工作的 Guillaume Lample 和 Timothee Lacroix 一起创立了 Mistral。三位研究人员以高效模型、开放工具和客户可控性为核心构建了 Mistral。Agentic Search 将这一论点扩展到检索层——在该层中,访问私人信息往往与生成最终答案的模型同等重要。
该产品可通过 Mistral Search Toolkit 使用,也可通过 Studio 与 Vibe 内的 Libraries 获得。Mistral 表示,客户可以在云端或本地部署这些工具,并将其连接到现有的搜索索引——这对无法将合同、备案文件或运营记录交付给第三方服务的组织而言是一个重要要求。
能够持续查找的模型
传统的检索增强生成(retrieval-augmented generation,或 RAG)通常只对索引进行一次搜索,将一组固定的片段传给语言模型并请求答案。这种方式适用于直接查找。但当相关数据位于脚注、位于第 147 页的表格中或位于第一份文档引用的第二份文档时,它便变得脆弱。
Agentic Search 通过五个工具让模型决定下一步检查什么:search、open、navigate、read 和 grep。模型可以细化查询、打开有希望的文档、跳转到特定页面并在该文件内搜索,然后再作出回应。Mistral 表示,这些工具无需针对特定模型进行微调。
Mistral 用这样一个例子来说明差异:询问 1953 年美国每月国防支出总和。一次搜索只检索到了包含部分年度数据的公报。通过 agentic 循环再次搜索,找到了包含全部 12 个月的 1954 年 2 月 Treasury Bulletin,读取了相关页面并计算出总额为 $44,463 million。
该示例体现了该方法的实用优势。初始索引仍然缩小了语料库范围;随后模型调查可能的来源,而不是把首次搜索结果当作全部可用记录。
底层的 Search Toolkit 于 5 月 28 日进入公开预览。它处理文档提取、分块、嵌入、索引、检索和评估,支持包括 PDF、office 文件、电子表格、电子邮件和纯文本在内的多种格式。Agentic Search 将该基础设施转化为模型在推理期间可调用的一组动作。
基准案例
Mistral 在 FinanceBench 和 OfficeQA Pro 上,用 Mistral Medium 3.5 与 Z.ai 的 GLM-5.2 对系统进行了测试。Mistral 表示,测试使用了 Search Toolkit 的默认分块和排序,未进行针对用例的专门调优。
在 FinanceBench 上,Mistral 报告称 GLM-5.2 的准确率从一次性 RAG 的 26.7% 提升至迭代搜索与文档导航下的 86%。搜索循环贡献了 52.6 个百分点的增长,而 open、navigate、read 与 grep 工具又增加了 6.7 个百分点。Mistral Medium 3.5 通过迭代搜索获得了 47.3 个百分点的提升,导航又带来了 8.7 个百分点的提升。
FinanceBench 在约 53,900 页的 368 份 SEC 文件上评估财务问答能力。Mistral 使用了其 150 个问题的公开评估集,并用经过与人工标签校准的 LLM 评审器对答案进行评分。
在 Mistral 的测试中,导航工具还降低了重复搜索的成本。与仅搜索的 agentic 循环相比,Mistral Medium 3.5 的令牌使用量下降了 23.9%,GLM-5.2 下降了 33.7%。FinanceBench 的 p90 延迟从 255 秒降至 154 秒,平均延迟从 108 秒降至 71 秒。
在 OfficeQA Pro 上,Mistral 表示 GLM-5.2 从一次性检索下的 6.3% 提升到使用完整工具集后的 51.9%。该基准包含 133 个问题,覆盖约 89,000 页的 696 份历史 U.S. Treasury Bulletins。其问题要求系统检索并推理经过扫描的表格和多份文档,使得正确的文档选择仅仅是任务的开始。
这些提升是 Mistral 的自评结果,而非独立复现的结论。测试一个 Mistral 模型和一个第三方模型提供了有用的交叉验证,尽管两个模型并不能确立 Mistral 所宣称的系统与模型无关这一更广泛主张。OfficeQA Pro 的研究本身发现,提供文档语料库的前沿 agents 平均得分为 34.1%,这表明即便是能力较强的模型获得了底层文件,检索与文档解析仍是主要失败点。
Mensch 向企业栈上游推进
Agentic Search 使 Mistral 进入了一个已有专门厂商占据的市场。Glean 在企业应用中销售具权限感知的工作场所搜索,而 Contextual AI 为专用企业 agents 提供主动的、多步骤检索,包括私人部署选项。
Mistral 的主张基于可移植性、开放组件和与客户现有索引的兼容性。这与 Mensch 旨在让欧洲组织对其数据运行系统拥有更大控制权的长期主张相契合。Mistral 的创始人将开放性、高效性和用户控制视为这家巴黎 AI 开发商的成立论点核心。
此次发布也延续了 Mistral 在基础模型之外的快速扩展。RuntimeWire 在八月初曾报道,Mistral 交付了一个带运行时策略控制的紧凑型守护模型,并且 Mensch 正在围绕长期算力承诺建立一个 欧洲算力联盟。Search 在 Mistral 的模型与企业工作流之间增加了另一个层级。
这一层级可以决定 agent 是否有用。当检索系统把错误页面送给模型时,再强的模型也无法产出已核验的答案。Mensch 下注于 Mistral 能够出售寻找证据、应用策略并在客户基础设施内运行的整体机器,而不是将这些工作留给一堆外部供应商。
Agentic Search 为 Mistral 在该层级提供了一个可信的切入点。基准结果显示,让模型调查文档相比单次检索通道可以带来显著收益。企业部署将检验这些收益能否在格式不一致、访问控制严格且缺乏便利基准答案的私有语料库中维持。