Loka 和 Arcee 详细介绍了为 AWS 部署构建的开放生物医学模型

7月30日的公告集中于一款最初于2月份发布的 LoRA 适配器,目前仍在等待官方 DrugProt 测试集的评估。

By · Published

Primary source: X

Why it matters

The project shows how a small research group can combine open weights, reinforcement learning and cloud deployment to build a specialized scientific model, while exposing the evaluation and licensing gaps that remain before regulated use.

Illustration of Loka and Arcee's open biomedical model and LoRA adapter processing biomedical data as it is deployed to AWS cloud servers.

Bojan Jakimovski (@Shekswess),Loka 的机器学习与应用研究负责人,在 7 月 30 日 X 上的一条线程中说,Loka 正在与 Arcee AIAmazon Web ServicesPrime Intellect 合作,针对科学研究开发开放模型。

该声明核心的工作是 Trinity-Mini-DrugProt-Think,这是一个生物医学关系抽取适配器,Jakimovski 和 Petar Kalinovski (@theVladChad) 于 2026 年 2 月首次记录。时机很重要:7 月 30 日的帖子将这种关系呈现为新的合作,而其底层模型、实验和 AWS 部署指南大约已公开五个月。

Jakimovski 在简历中列有 Ss. Cyril and Methodius University 的专用计算机系统 MSc 学位,此外还在 BrainsterNext 任教并担任 AWS Ambassador。他的研究聚焦于后训练(post-training)、小型语言模型和分布式计算。这一背景塑造了该项目:Jakimovski 和 Kalinovski 并非从头训练一个生物医学基础模型,而是改造了现有的稀疏专家混合(sparse mixture-of-experts)模型,并发布了重现实验所需的训练工件。

该模型的功能

Trinity-Mini-DrugProt-Think 是 Arcee 的 Trinity Mini 的一个 LoRA 适配器,该模型总参数为 260 亿,每个 token 激活约 30 亿。该适配器对 PubMed 摘要中发现的 13 类药物-蛋白质关系进行分类,包括抑制剂(inhibitors)、激活剂(activators)、激动剂(agonists)、拮抗剂(antagonists)和底物(substrates)。在返回分类结果之前,它会生成一个结构化的推理轨迹。

研究人员使用了 Group Relative Policy Optimization(简称 GRPO),这是一种强化学习方法,它会奖励那些可以针对定义好的答案进行检验的输出。Prime Intellect 通过其 prime-rl 框架提供了托管的训练基础设施,而训练环境使用了 Maziyar Panahi 对 DrugProt 数据集的 OpenMed 封装。

公共仓库 包含实验配置、导出的指标以及将基础模型和适配器部署到 AWS SageMaker 实时端点的脚本。AWS 的作用主要集中在部署和托管。训练运行则通过 Prime Intellect 的基础设施完成。

这种分工使该项目成为围绕专用开放模型兴起的技术栈的一个紧凑示例:Arcee 提供基础权重,Prime Intellect 负责强化学习基础设施,Loka 构建领域适配器,AWS 提供受控的生产环境。

实验及其局限

Jakimovski 和 Kalinovski 在 LoRA 缩放、学习率、批量大小、token 预算、温度和 rollout 次数等方面共运行了 12 个实验。他们的技术报告 指出,控制适配器更新规模的 LoRA alpha 设置是研究中最关键的变量。

在一次 sweep 中,alpha 为 64 在 100 步后达到约 0.75 的准确度奖励,而 alpha 为 16 时约为 0.41。更激进的 alpha=128 在其保留集评估得分恶化之前产生了更强的训练结果,研究人员在第 70 步停止了该次运行。学习率为 1e-5 的运行在训练过程中也崩溃了,而 5e-6 的运行在第 82 步达到约 0.83,但随后表现出不稳定性。研究人员选择 3e-6 作为更安全的默认值。

这些数字是实验奖励,而非经过独立验证的生物医学基准。模型卡说明 Trinity-Mini-DrugProt-Think 是在从训练拆分中抽取的保留数据上评估的,并未在官方的 DrugProt 测试集上进行测试。报告还表示,该适配器可能无法推广到特定的 13 类分类任务之外。

许可也需要类似的精确处理。Loka 在 Apache 2.0 下发布了适配器,而底层的 Trinity Mini 模型 列出了 Arcee 单独的 OpenMDW-1.1 许可。部署组合系统的开发者必须兼顾这两层许可要求。

从实验到部署

Loka 的 2 月 23 日的 SageMaker 指南 将实验转化为可部署的服务。脚本加载不可变的 Trinity Mini 基础模型,附加较小的适配器,并通过实时端点暴露结果。操作员可以在不合并整个模型副本的情况下替换或回滚适配器。

该架构面向需要将推理保留在其自身 AWS 账户内的医疗和生命科学团队。它赋予这些团队对容器、访问策略、日志和加密的控制,同时也使他们对 GPU 大小、端点成本和冷启动延迟负责。

重新引发的关注也紧随 Arcee 在 7 月 22 日对 Genesis-Science-1 的公布——这是一个与 U.S. Department of Energy 及其国家实验室合作开发的、处于万亿级参数量级的独立模型。Arcee 联合创始人兼 CEO Mark McQuade 已将模型实验室的侧重点从面向企业的后训练工具转向其自身的开放权重基础模型。较小的 DrugProt 项目为 Arcee 提供了一个实用范例,展示外部研究人员如何将这些权重专门化用于狭窄的科学任务。

对 Jakimovski 而言,直接产出更为具体:一个可检查的适配器、其实验历史以及一条部署路径。其科学价值将取决于训练分布之外的评估。其工程价值已经在仓库中可见,其他研究人员可以重新运行消融实验、替换生物医学数据集或将相同的训练模式应用到另一个领域。

Reader comments

Conversation for this story loads after sign-in.