EdotEnv 推出基于市场的强化学习环境以训练金融智能体
这家 YC Summer 2026 的初创公司押注,变化的市场格局可以比静态基准更好地训练长期智能体。
By Ryan Merket · Published
Primary source: EdotEnv
Why it matters
Agent performance increasingly depends on training environments, and EdotEnv is betting financial markets can supply harder, continuously changing experience than static datasets.

EdotEnv,这家与 Jay Azhang (@jay_azhang) 和 Matthew Siper 公开关联的 Y Combinator 2026 年夏季公司,正在为基于金融市场数据构建的强化学习环境开放注册。该产品面向训练代理以进行量化研究、使用专业工具并做出其后果在数日内逐步显现的决策的研究人员。截至 8 月 4 日,EdotEnv 的网站 将潜在用户引导至一份等候名单,而非一个面向所有人的可用产品。(edotenv.com)
EdotEnv 背后的研究路径源自 Azhang 在 Nof1 的工作,Nof1 是一家专注于金融市场的人工智能研究实验室。Azhang 在他个人网站上表示,他曾管理过一个资产从 300 万美元增长到 2000 万美元的基金。Siper 是 NYU's Game Innovation Lab 的机器学习博士候选人,他早期的研究包括强化学习和计算机游戏设计。他们的背景可以解释 EdotEnv 的核心选择:将金融市场视为不断改写自身规则的对抗性博弈。(jayazhang.com)
EdotEnv 表示其软件可以以编程方式在由真实市场数据组装的环境中生成量化研究任务。代理可以使用提供的工具,在 Bash 中创建额外工具并开发交易策略。期望的训练信号来自延迟奖励、不完整的信息和不断变化的条件,而不是一组固定且有已知答案的问题。(edotenv.com)
市场即课程
EdotEnv 的论点是静态的合成基准最终会变得可预测。市场不断变化,因为有利可图的策略会吸引竞争,交易优势会衰减,新的市场制度会使先前成功的行为变得昂贵。EdotEnv 希望把这种非平稳性转化为可再生的训练任务来源。
其主页展示了从 T+00 到 T+96 小时的决策视野。代理首先在信息不完全的情况下做出承诺。随之而来的是敞口和机会成本的累积、目标的改变,代理必须识别何时其原始策略已经失效。这个为期四天的示例是概念性的,但它展示了 EdotEnv 想要衡量的能力类型:代理能否在其早期选择改变了其操作的状态之后修订计划。(edotenv.com)
Siper 在 LinkedIn 上提供了关于原型的更多细节。他写道,系统必须考虑前瞻性偏差、未来信息泄露、幸存者偏差、市场冲击、逆向选择、部分成交、执行不确定性和组合约束。他还描述了在单张 Nvidia T4 GPU 上以错开起始时间运行 1,000 个并行回放环境并使用训练截止后的数据,以及使用 Claude 作为教师来生成历史轨迹。那些是 Siper 对原型的陈述,而非已发布的 EdotEnv 基准结果,但它们表明该项目超越了把价格图表喂入语言模型的范畴。(linkedin.com)
该工作延伸了 Azhang 和 Siper 已经共同开展的研究。2026 年 2 月,他们共同撰写了 Continuous Program Search,研究了交易程序如何在连续隐空间中进化。该论文支持团队对自适应搜索的兴趣,尽管它并不验证 EdotEnv 的独立产品主张。(arxiv.org)
基准背后的商业模式
EdotEnv 正在为 AI 实验室和金融代理研究人员呈现一个基础设施型商业,而不是向投资者出售交易的服务。这样的定位使 Azhang 和他的合作者可以对环境、评估和训练层进行货币化,而客户则承担构建代理本身的成本和风险。
时机上也符合投资者对强化学习环境作为独立软件类别日益增长的兴趣。Deeptune,一家更广泛的训练环境公司,于 2026 年 3 月 19 日宣布由 Andreessen Horowitz 领投的 4,300 万美元 A 轮融资。Deeptune 构建的是数字工作模拟而非专注于市场,但其融资显示出投资者对环境作为有能力模型与可靠代理之间瓶颈的下注规模。(deeptune.com)
EdotEnv 展示了 Y Combinator 的支持。YC 表示其为被接受公司提供的标准条款是 50 万美元,分为通过事后估值 SAFE 提供用于换取 7% 的 12.5 万美元和通过无上限最惠国 SAFE 提供的 37.5 万美元。EdotEnv 并未在其公开的产品页面上附上融资细节,因此 YC 的已公布条款为加速器关系提供了背景,而非对 EdotEnv 募资数额的确认说明。(ycombinator.com)
金融代理研究领域已经有大量开源框架和实时评估项目。TradingAgents 协调了用于分析、研究、交易和风险管理的专门 LLM 角色。Agent Market Arena 在实时加密货币和股票市场中评估了若干代理架构,其研究人员报告称代理设计带来的行为差异比底层模型选择更广泛。EdotEnv 的机会在于成为这些代理下方的受控训练与回放层,研究人员可以在将策略暴露给真实资金之前反复生成经验。(github.com)
EdotEnv 要通过的考验
真实的市场数据并不会自动产生可信的训练环境。历史交易系统在未来信息泄露进入输入、失败的证券从数据集中消失或模拟订单获得在实时市场中无法获得的成交时,可能看起来很有能力。Siper 自身列出的需求显示该团队理解这些失败模式。EdotEnv 的价值将取决于实现如何持续地防止这些问题。
底层模型在较少动态的金融工作上也仍然薄弱。一个基于专家撰写的、来自近期 SEC 披露文件研究问题的基准测试报告显示,表现最好的模型 OpenAI o3 的准确率为 46.8%。另有研究提出,收益率和准确率分数可能掩盖捏造的事实、过时的数据以及在对抗性提示下的失败。因此,一个在模拟中盈利的轨迹可能并不能很好地衡量一个代理是否安全可靠。(arxiv.org)
EdotEnv 最强的想法是,随着代理的改进,环境本身应变得更难。要证明这一点,需要可复现的评估规则、干净的基于时间的数据划分以及模拟市场中行动成本的仿真,包括订单改变被测机会的方式。Azhang 和 Siper 选择了一个在弱假设下会被迅速惩罚的领域。如果 EdotEnv 能将这些惩罚转化为有用的训练信号,其市场回放系统可能会为金融代理提供静态基准无法提供的东西:在第一次答案之后还会累积的后果。