Palomar abre un registro de pruebas en Lean para la acumulación matemática de la IA
El proyecto registra instantáneas fijas de GitHub, verifica mecánicamente las pruebas en Lean y usa un LLM para comparar los enunciados formales con las descripciones informales.
By RuntimeWire Staff · Published
Primary source: Terence Tao
Why it matters
Palomar gives Lean proofs fixed, commit-level records and separates mechanical verification from semantic LLM review. Its narrow scope provides researchers with an audit trail while explicitly stopping short of peer review.

Palomar abrió para envíos el 18 de agosto, dando a los matemáticos un registro público donde las pruebas formales escritas en Lean pueden vincularse a un código fuente fijado, verificarse mecánicamente e inspeccionarse después de que el anuncio inicial haya pasado.
Terence Tao, el matemático de UCLA y medallista Fields 2006, anunció la apertura en una entrada de blog. Tao es uno de los cuatro mantenedores técnicos iniciales de Palomar, junto a Matthew Ballard, Nestor Guillen y Jaume de Dios Pont. El proyecto fue incubado por la Lean Focused Research Organization y el Institute for Computer-Aided Reasoning in Mathematics (ICARM).
Tao enmarcó el proyecto como una respuesta a una proliferación de pruebas generadas por IA, incluidas algunas formalizadas en Lean. Escribió que revisar esos repositorios sigue siendo difícil para lectores sin experiencia en Lean: la prueba debe pasar la verificación de tipos, evitar axiomas no autorizados y declarar formalmente el mismo resultado descrito en el lenguaje matemático ordinario.
La respuesta de Palomar es un registro que documenta lo que demuestra una instantánea fija del repositorio. Tao lo describió como una "aproximación cero" de un servidor de preprints para pruebas en Lean. La comparación fija la expectativa correcta. Palomar crea un artefacto indexable y una pista de auditoría. No funge como árbitro de las matemáticas.
El papel de Tao da visibilidad al esfuerzo, aunque la estructura operativa de Palomar es distribuida. Ballard es un geómetra algebraico de la University of South Carolina. Guillen trabaja en ecuaciones en derivadas parciales, cálculo de variaciones y computación científica. De Dios Pont, quien completó su doctorado en UCLA bajo la dirección de Tao en 2023, es fellow docente en el NYU Center for Data Science que trabaja en IA para las matemáticas junto con análisis armónico y teoría espectral. La junta asesoría científica ampliada incluye a Jeremy Avigad, Bryna Kra, Kim Morrison, Ravi Vakil y Akshay Venkatesh.
Qué verifica realmente Palomar
La publicación de lanzamiento de Tao describe a Palomar como un registro de instantáneas externas de repositorios de GitHub representadas por commits específicos. Cada envío incluye un breve archivo Challenge.lean que enuncia el resultado reclamado, un módulo Solution.lean que contiene la prueba, y un archivo formalization.yaml con una descripción informal, metadatos y divulgaciones.
La verificación mecánica usa Comparator, una herramienta de Lean que separa la declaración anunciada de su prueba y comprueba si la solución establece el resultado en el archivo de desafío. La documentación de Lean dice que Comparator admite el emparejamiento de enunciados de teoremas y puede usar el kernel de Lean y el verificador Nanoda implementado de forma independiente. Los materiales disponibles no establecen que Palomar requiera todas las opciones de validación de Comparator.
Esa separación aborda un modo de fallo sutil. Un repositorio puede contener una prueba válida mientras su enunciado formal difiere del teorema descrito fuera del código. Mantener el enunciado del desafío separado de la solución da a los lectores una superficie menor para inspeccionar.
La segunda verificación de Palomar es no determinista. Según el anuncio de Tao, un gran modelo de lenguaje evalúa si la descripción informal en formalization.yaml parece coincidir con el resultado formal y si el repositorio cumple con los estándares mínimos del registro.
La política publicada de Palomar describe una revisión de registro automatizada, mientras que los materiales suministrados no establecen si los mantenedores realizan una moderación humana separada. Tao también recomienda revisión humana durante la presentación y dice que las verificaciones de Palomar están lejos de equivaler a una revisión por pares en cuanto a novedad, interés y exactitud.
El registro, por lo tanto, combina la comprobación mecánica de pruebas con una evaluación basada en modelos del puente semántico entre el código Lean y el lenguaje matemático ordinario. La documentación del proyecto advierte que la revisión por modelo de lenguaje puede pasar por alto discrepancias. Los lectores aún deben examinar si las definiciones y el enunciado formal capturan el teorema que se está discutiendo.
Verificación sin aval
Palomar traza límites firmes alrededor de sus afirmaciones. La inscripción no certifica novedad, importancia, calidad del código ni la corrección de una prueba informal. No implica que un revisor experto haya evaluado el trabajo, y no convierte un repositorio de GitHub en una publicación en revista.
La afirmación útil es estrecha: una prueba a partir de una instantánea especificada del repositorio pasó las verificaciones mecánicas y automatizadas documentadas por Palomar. El archivo de desafío, la solución y la explicación acompañante dan entonces a otros investigadores material que pueden inspeccionar y cuestionar.
Esa distinción importa conforme se extiende la formalización asistida por IA. Un verificador de pruebas puede determinar si el código establece un enunciado formal bajo sus suposiciones codificadas. Una afirmación matemática pública también depende de si ese enunciado, sus definiciones y su descripción informal se refieren al mismo resultado.
Tao y los mantenedores de Palomar están construyendo infraestructura para esa segunda capa mientras mantienen deliberadamente limitadas las afirmaciones del registro. Palomar actualmente admite Lean, y las presentaciones pueden ser generadas por humanos, por IA o producidas mediante una mezcla de ambas.
Palomar no zanjará disputas sobre matemáticas generadas por máquinas. Ofrece a esas disputas instantáneas fijas de repositorios y afirmaciones explícitas para examinar, lo cual es infraestructura útil en un campo que ya lidia con una proliferación de pruebas automatizadas.