Noticias IA
AI News AgentInvestigaciónAllenAI4 min de lectura

Theorizer usa IA para convertir papers en teorías

Theorizer analiza hasta 100 papers por consulta y propone teorías con leyes, límites y evidencias rastreables. Sus resultados son más precisos y predictivos cuando se apoyan en literatura, aunque siguen siendo hipótesis que necesitan validación científica.

Theorizer es un sistema de IA que analiza decenas de artículos científicos y los convierte en teorías estructuradas, con leyes, límites y evidencias rastreables. La herramienta, presentada por el Allen Institute for AI, busca ayudar a los investigadores a entender un campo en minutos en lugar de meses.

No se limita a resumir papers. Intenta detectar patrones que se repiten en varios estudios y expresarlos como afirmaciones que puedan ponerse a prueba.

De miles de resultados a posibles leyes

En ciencia, los experimentos generan resultados concretos, pero las teorías los conectan. Las leyes de Kepler, por ejemplo, resumieron siglos de observaciones sobre el movimiento de los planetas en unas pocas reglas.

Theorizer intenta hacer algo parecido con la literatura científica. Ante una petición como "crea teorías sobre la memoria en los modelos de lenguaje", el sistema busca investigaciones relevantes, extrae sus resultados y propone regularidades comunes.

Cada teoría se organiza en tres piezas:

  • Ley: una relación cualitativa o cuantitativa, como que una variable aumenta cuando lo hace otra.
  • Alcance: las condiciones en las que esa ley debería cumplirse, incluidos límites y excepciones.
  • Evidencia: resultados concretos extraídos de papers, con referencias a las investigaciones que los respaldan.

En la práctica, cada teoría suele contener una o dos leyes. La herramienta también le asigna un nombre y una descripción para situarla dentro del campo estudiado.

Cómo funciona Theorizer

El proceso tiene tres etapas. Primero, el sistema transforma la consulta del usuario en una búsqueda bibliográfica y reúne hasta 100 papers relevantes. Para ello combina PaperFinder, Semantic Scholar y una herramienta que convierte los PDF en texto, incluso cuando necesitan reconocimiento óptico de caracteres.

Si faltan documentos, revisa las referencias de los papers encontrados y añade los que parecen más útiles. El resultado es un corpus de investigación que sirve como base para construir las teorías.

Después, Theorizer crea una plantilla de extracción adaptada a la pregunta. En una consulta sobre memoria en modelos de lenguaje, por ejemplo, puede registrar el tipo de tarea, el mecanismo de memoria utilizado y la diferencia de rendimiento con y sin memoria.

Por último, otro modelo combina esos datos, genera teorías y las revisa. También estima si una ley es novedosa y descarta las que se parecen demasiado a afirmaciones ya conocidas.

Las teorías respaldadas por papers funcionan mejor

El equipo comparó dos métodos: uno basado solo en lo que el modelo ya sabía y otro que incorporaba evidencia recuperada de la literatura. El segundo fue más caro, aproximadamente ** siete veces más**, pero produjo teorías más específicas, mejor respaldadas y más plausibles.

Para comprobar si las leyes podían anticipar resultados posteriores, el equipo generó predicciones y las contrastó con investigaciones publicadas después. El análisis incluyó 2.983 leyes, 4.554 papers y 16.713 evaluaciones entre una ley y un artículo.

En la generación centrada en la precisión, ambos métodos lograron una precisión alta, de alrededor del 0,88 al 0,90. Esto significa que la mayoría de las predicciones que pudieron comprobarse estaban respaldadas por estudios posteriores.

La diferencia apareció en la cobertura: las teorías apoyadas en literatura alcanzaron un recall de 0,51, frente a 0,45 del método basado solo en el conocimiento del modelo. El recall mide cuántas afirmaciones encuentran evidencia posterior que permita evaluarlas.

La ventaja fue mayor cuando el objetivo era buscar ideas nuevas. En ese caso, la precisión pasó de 0,34 a 0,61 y el recall de 0,04 a 0,16 al añadir la literatura.

No es un descubridor automático de verdades

Theorizer todavía produce hipótesis, no conclusiones científicas. Sus resultados pueden ser incompletos o engañosos, y el propio sistema solo consigue encontrar investigaciones que pongan a prueba aproximadamente el 51% de las teorías generadas en el escenario centrado en la precisión.

También hay otros límites importantes:

  • La literatura científica tiende a publicar más resultados positivos que negativos.
  • El sistema depende de que los papers estén disponibles en acceso abierto.
  • Una consulta tarda aproximadamente entre 15 y 30 minutos, aunque varias partes pueden ejecutarse en paralelo.
  • Actualmente funciona mejor en áreas con mucha documentación digital, como la inteligencia artificial y el procesamiento del lenguaje natural.

La herramienta se publica con código, interfaz, API y los prompts utilizados en el proceso. También incluye un conjunto de datos de aproximadamente 3.000 teorías, creado a partir de 13.744 papers y 100 consultas sobre temas de IA y lenguaje.

Para ti, el cambio no es que una IA vaya a reemplazar al investigador que valida una teoría. Es que puede convertirse en una primera capa de orientación: localizar patrones, señalar conexiones entre estudios y proponer qué merece una comprobación más rigurosa. El siguiente paso será medir si esas sugerencias resisten experimentos nuevos y si ayudan a descubrir relaciones que los investigadores todavía no habían formulado.