Loka y Arcee detallan un modelo biomédico abierto construido para su despliegue en AWS

El anuncio del 30 de julio se centra en un LoRA adapter publicado por primera vez en febrero y que aún espera una evaluación oficial del conjunto de pruebas DrugProt.

By · Published

Primary source: X

Why it matters

The project shows how a small research group can combine open weights, reinforcement learning and cloud deployment to build a specialized scientific model, while exposing the evaluation and licensing gaps that remain before regulated use.

Illustration of Loka and Arcee's open biomedical model and LoRA adapter processing biomedical data as it is deployed to AWS cloud servers.

Bojan Jakimovski (@Shekswess), el líder de aprendizaje automático e investigación aplicada de Loka, dijo en un hilo del 30 de julio en X que Loka está colaborando con Arcee AI, Amazon Web Services y Prime Intellect en modelos abiertos para la investigación científica.

El trabajo en el centro de ese anuncio es Trinity-Mini-DrugProt-Think, un adaptador de extracción de relaciones biomédicas que Jakimovski y Petar Kalinovski (@theVladChad) documentaron por primera vez en febrero de 2026. El momento importa: la publicación del 30 de julio presenta la relación como una nueva colaboración, mientras que el modelo subyacente, los experimentos y la guía de despliegue en AWS han estado públicos durante aproximadamente cinco meses.

Jakimovski, que declara una MSc en sistemas informáticos dedicados de la Ss. Cyril and Methodius University, también enseña en BrainsterNext y actúa como AWS Ambassador. Su investigación se centra en el post-entrenamiento, modelos de lenguaje pequeños y computación distribuida. Ese trasfondo dio forma al proyecto: en lugar de entrenar un modelo fundacional biomédico desde cero, Jakimovski y Kalinovski adaptaron un modelo existente de mezcla de expertos dispersa y publicaron los artefactos de entrenamiento necesarios para reproducir el trabajo.

Qué hace el modelo

Trinity-Mini-DrugProt-Think es un adaptador LoRA para Trinity Mini de Arcee, un modelo con 26 mil millones de parámetros en total y 3 mil millones activados por cada token. El adaptador clasifica 13 categorías de relaciones droga-proteína que se encuentran en resúmenes de PubMed, incluyendo inhibidores, activadores, agonistas, antagonistas y sustratos. Genera una traza de razonamiento estructurada antes de devolver una clasificación.

Los investigadores usaron Group Relative Policy Optimization, o GRPO, un método de aprendizaje por refuerzo que recompensa salidas que pueden verificarse contra una respuesta definida. Prime Intellect suministró la infraestructura hospedada de entrenamiento a través de su prime-rl framework, mientras que el entorno de entrenamiento utilizó el empaquetado OpenMed de Maziyar Panahi del conjunto de datos DrugProt.

El repositorio público contiene configuraciones de experimentos, métricas exportadas y scripts para desplegar el modelo base y el adaptador a un endpoint en tiempo real de AWS SageMaker. El papel de AWS se concentra en el despliegue y el hospedaje. Las ejecuciones de entrenamiento se realizaron mediante la infraestructura de Prime Intellect.

Esa división del trabajo convierte al proyecto en un ejemplo compacto del stack que está surgiendo alrededor de modelos abiertos especializados: Arcee suministra los pesos base, Prime Intellect maneja la infraestructura de aprendizaje por refuerzo, Loka construye el adaptador del dominio y AWS provee un entorno de producción controlado.

Los experimentos y sus límites

Jakimovski y Kalinovski realizaron 12 experimentos abarcando la escalabilidad de LoRA, tasas de aprendizaje, tamaños de batch, presupuestos de tokens, temperaturas y conteos de rollout. Su informe técnico identifica el ajuste alpha de LoRA, que controla el tamaño de las actualizaciones del adaptador, como la variable más trascendental del estudio.

Un alpha de 64 alcanzó una recompensa de precisión de aproximadamente 0.75 después de 100 pasos en una pasada, en comparación con alrededor de 0.41 en alpha 16. Un alpha más agresivo de 128 produjo resultados de entrenamiento más fuertes antes de que su puntuación de evaluación en datos retenidos se deteriorara, lo que llevó a los investigadores a detener esa ejecución en el paso 70. Una tasa de aprendizaje de 1e-5 también colapsó durante el entrenamiento, mientras que una ejecución con 5e-6 alcanzó aproximadamente 0.83 en el paso 82 pero luego mostró inestabilidad. Los investigadores seleccionaron 3e-6 como el valor predeterminado más seguro.

Esas cifras son recompensas experimentales más que un benchmark biomédico validado de forma independiente. La ficha del modelo indica que Trinity-Mini-DrugProt-Think fue evaluado en datos retenidos extraídos de la partición de entrenamiento y no ha sido probado contra el conjunto de prueba oficial de DrugProt. El informe también advierte que el adaptador puede fallar al generalizar fuera de la tarea específica de clasificación de 13 clases.

La licencia requiere una precisión similar. Loka liberó el adaptador bajo Apache 2.0, mientras que el modelo Trinity Mini subyacente enumera la licencia separada OpenMDW-1.1 de Arcee. Los desarrolladores que desplieguen el sistema combinado deben tener en cuenta ambas capas.

De experimento a despliegue

La guía del 23 de febrero sobre SageMaker de Loka convierte el experimento en un servicio desplegable. Los scripts cargan el modelo base Trinity Mini inmutable, acoplan el adaptador más pequeño y exponen el resultado a través de un endpoint en tiempo real. Los operadores pueden reemplazar o revertir el adaptador sin fusionar una nueva copia del modelo completo.

Esa arquitectura está dirigida a equipos de salud y ciencias de la vida que necesitan que la inferencia permanezca dentro de sus propias cuentas de AWS. Les da control sobre contenedores, políticas de acceso, registros y cifrado, mientras los deja responsables del dimensionamiento de GPUs, los costos de endpoints y los retrasos por arranque en frío.

La renovada atención también sigue al anuncio del 22 de julio de Arcee sobre Genesis-Science-1, un modelo separado de la clase de trillones de parámetros que se está desarrollando con el U.S. Department of Energy y sus laboratorios nacionales. El cofundador y CEO Mark McQuade ha reorientado el laboratorio de modelos desde herramientas empresariales de post-entrenamiento hacia sus propios modelos fundacionales de pesos abiertos. El proyecto más pequeño DrugProt le da a Arcee un ejemplo operativo de cómo investigadores externos pueden especializar esos pesos para una tarea científica estrecha.

Para Jakimovski, la salida inmediata es más acotada: un adaptador inspeccionable, su historial de experimentos y una vía de despliegue. Su valor científico dependerá de una evaluación más allá de la distribución de entrenamiento. Su valor de ingeniería ya es visible en el repositorio, donde otros investigadores pueden volver a ejecutar las ablaciones, reemplazar el conjunto de datos biomédico o llevar el mismo patrón de entrenamiento a otro dominio.

Reader comments

Conversation for this story loads after sign-in.