Arc Institute abre el Virtual Cell Challenge 2026 con predicciones zero-shot de células
La competencia del 20 de agosto pondrá a prueba las predicciones de silenciamiento génico en varias líneas celulares utilizando datos experimentales recién generados.
By Ryan Merket · Published
Primary source: Arc Institute on X
Why it matters
Arc is turning virtual-cell performance into a recurring, experimentally grounded benchmark. The zero-shot, multi-cell-line task targets the generalization needed before these models can guide experiments across unfamiliar biology.

Arc Institute abrió la preinscripción para su Virtual Cell Challenge 2026 en un hilo de tres publicaciones en X, planteando una tarea más difícil que medirá si los modelos de IA pueden predecir las respuestas al silenciamiento génico en múltiples líneas celulares sin ejemplos específicos de la tarea.
La organización de investigación de Palo Alto fue fundada en 2021 por Silvana Konermann (@SKonermann), Patrick Hsu (@pdhsu) y Patrick Collison después de que los tres trabajaran juntos en Fast Grants. Konermann, profesora de bioquímica en Stanford que obtuvo su doctorado en neurociencias en MIT, estudia genómica funcional y la enfermedad de Alzheimer. Hsu, profesor de patología en Stanford e investigador temprano en CRISPR, dirige un laboratorio que combina ingeniería del genoma con aprendizaje automático.
El concurso completo se lanzará el 20 de agosto. Arc está alentando a los posibles competidores a formar equipos durante el periodo de preinscripción.
Una prueba de generalización más difícil
El desafío 2026 pide a los participantes que predigan, de forma zero-shot (sin ejemplos específicos de la tarea), cómo los silenciamientos de genes especificados cambiarán el comportamiento de varias líneas celulares. Arc evaluará esas predicciones comparándolas con nuevos datos experimentales de perturbaciones generados a partir de las mismas líneas celulares.
Los experimentos de silenciamiento génico reducen la actividad de genes seleccionados, lo que permite a los investigadores medir los cambios resultantes en la expresión de ARN y el estado celular. Un modelo de célula virtual intenta predecir esos cambios por medios computacionales. Predicciones precisas podrían, eventualmente, ayudar a los investigadores a elegir qué intervenciones genéticas o candidatos a fármacos probar en el laboratorio, reduciendo un vasto espacio de búsqueda experimental.
El formato multi-línea celular y zero-shot incrementa la dificultad respecto al concurso inaugural de Arc en 2025. Ese certamen se centró en un único contexto H1 de células madre embrionarias humanas y usó un diseño few-shot: Arc publicó un subconjunto de entrenamiento del tipo celular objetivo antes de evaluar los modelos en perturbaciones no vistas. El conjunto de datos de 2025 abarcó alrededor de 300,000 células y 300 perturbaciones genéticas, según la descripción del diseño experimental de Arc.
Arc dijo que el primer desafío atrajo a más de 5,000 inscritos de 114 países. Más de 1,200 equipos enviaron resultados, mientras que más de 300 presentaron envíos finales. El equipo BM_xTVC de BioMap Research ganó el primer lugar y $100,000 con un sistema híbrido que combinaba deep learning, embeddings de proteínas, conjuntos de datos públicos de perturbaciones y características estadísticas.
Los resultados de 2025 también pusieron de manifiesto las limitaciones del campo. Arc encontró que los modelos de predicción de perturbaciones no superaban de forma consistente a las líneas base ingenuas en cada métrica de evaluación. Varios de los mejores trabajos combinaron modelos neuronales con métodos estadísticos clásicos, en lugar de depender exclusivamente del deep learning de extremo a extremo. Avanzar hacia líneas celulares desconocidas pone a prueba directamente si esos enfoques aprendieron biología transferible o patrones ligados a un contexto experimental concreto.
Arc está construyendo la prueba y un modelo para competir en ella
El concurso forma parte de la más amplia Virtual Cell Initiative de Arc, que combina generación de datos biológicos a gran escala, investigación en aprendizaje automático y validación experimental. Arc describe el certamen anual como dotado con un premio mayor de $100,000 y como un esfuerzo por establecer puntos de referencia comunes para modelos que predicen cambios en la expresión génica tras perturbaciones genéticas o químicas.
Arc también desarrolla sistemas de célula virtual por su cuenta. En junio de 2025, Arc lanzó STATE, un modelo entrenado con datos observacionales de casi 170 millones de células y datos de perturbaciones de más de 100 millones de células en 70 contextos celulares. Arc continuó en enero de 2026 con Stack, un modelo de código abierto diseñado para predecir respuestas celulares en nuevos contextos mediante in-context learning.
Ese doble papel hace que el diseño del benchmark sea consecuente. Arc está produciendo datos experimentales, estableciendo criterios de evaluación, administrando el concurso y construyendo modelos en la misma categoría. Una competencia abierta da a equipos externos un conjunto de datos y un marco de puntuación compartidos, a la vez que proporciona a Arc evidencia sobre qué arquitecturas y estrategias de entrenamiento se generalizan más allá de sus propios sistemas.
El desafío toma su formato de CASP, la veterana competencia de predicción de estructuras proteicas que ayudó a establecer pruebas comparables para la biología computacional. La versión 2026 de Arc aplica ese modelo a la predicción de respuestas celulares, donde la evaluación sigue fragmentada entre conjuntos de datos, tipos de células, perturbaciones y métodos de puntuación.
NVIDIA, 10x Genomics y Ultima Genomics regresan como patrocinadores. Su participación también refleja la infraestructura detrás del certamen: cómputo en GPU para entrenar modelos, herramientas de análisis de célula única para medir la expresión génica y sistemas de secuenciación para producir los resultados experimentales usados como verdad de referencia.
La preinscripción se abrió el 4 de agosto. El lanzamiento del 20 de agosto dará inicio al siguiente intento por determinar si los modelos de célula virtual pueden trasladar lo que aprenden de experimentos existentes a contextos celulares que nunca han visto.