Ai2 presenta DR Tulu, un agente de IA para investigar
Ai2 publica DR Tulu, un agente de IA abierto que planifica búsquedas, consulta páginas y artículos científicos y redacta informes con citas. Su versión de 8.000 millones de parámetros supera a varios modelos abiertos más grandes y compite con agentes propietarios en distintas pruebas, con un coste de API mucho menor bajo la configuración de la evaluación.

Ai2 ha presentado DR Tulu, un agente de IA abierto que busca información, consulta distintas fuentes y redacta informes con citas. Su versión de 8.000 millones de parámetros, DR Tulu-8B, supera en varias pruebas a sistemas abiertos más grandes y compite con agentes propietarios como los de OpenAI, Google y Perplexity.
La propuesta no es un chatbot que responde al primer intento. Ante una pregunta compleja, el modelo decide qué necesita saber, busca información, revisa páginas o artículos científicos, detecta lagunas y ajusta la estrategia antes de redactar una respuesta final.
Qué hace diferente a DR Tulu
La mayoría de los sistemas de IA se entrenan con respuestas que tienen una solución clara, como un problema matemático o una pregunta cuya respuesta puede compararse con un dato conocido. Ese método funciona peor cuando hay que preparar un informe sobre un tema abierto y reunir pruebas de muchas fuentes.
Para resolverlo, Ai2 combina dos etapas:
- Ajuste supervisado: el modelo aprende a planificar búsquedas, usar herramientas y citar fuentes a partir de ejemplos generados y filtrados.
- Aprendizaje por refuerzo con rúbricas evolutivas: el sistema recibe recompensas según criterios de calidad que cambian y se adaptan a cada pregunta.
Una rúbrica es una lista de condiciones para evaluar una respuesta. En este caso, no es una plantilla fija. Se genera con ayuda de búsquedas específicas para cada consulta y puede premiar nueva evidencia útil o penalizar problemas como copiar texto sin sintetizarlo, rellenar el informe con contenido irrelevante o añadir citas que no respaldan realmente las afirmaciones.
Eso busca evitar un defecto común en estos sistemas: aprender a parecer rigurosos sin serlo. Un informe puede sonar convincente y estar lleno de referencias, pero no conectar bien las pruebas ni responder a lo que se preguntó.
Cómo investiga el modelo
Durante la ejecución, DR Tulu alterna entre tres acciones:
- Pensar y planificar el siguiente paso.
- Usar una herramienta de búsqueda o navegación.
- Redactar la respuesta final con enlaces a las fuentes que respaldan sus afirmaciones.
La configuración de Ai2 incluye tres herramientas: búsqueda web, lectura del contenido completo de una página y búsqueda de artículos científicos. El sistema puede hacer pocas consultas para una pregunta sencilla o muchas más cuando el tema exige comparar fuentes y explorar varias líneas de investigación.
La infraestructura utiliza el Model Context Protocol (MCP), un estándar que permite conectar herramientas externas de forma modular. En la práctica, una organización podría sustituir las búsquedas generales por sus propias bases de datos, buscadores internos o sistemas de recuperación de documentos sin volver a entrenar el modelo.
Resultados y coste
Ai2 evaluó DR Tulu-8B en siete pruebas, cuatro de ellas centradas en informes largos y síntesis de varias fuentes. En ScholarQA-CSv2, obtuvo una puntuación de 86,7, frente a 42,5 de WebExplorer-8B y 32,9 de WebThinker-32B-DPO. En ResearchQA alcanzó 71,1, y en DeepResearch Bench, 41,8.
Según Ai2, también superó en ScholarQA-CSv2 a los agentes propietarios comparados, incluidos OpenAI Deep Research, con 79,6, y Perplexity Deep Research, con 67,3. En otras pruebas se mantuvo cerca de varios sistemas comerciales, aunque los resultados dependen de la tarea, las herramientas disponibles y la configuración de cada evaluación.
El modelo también destacó por ser más compacto. Sus informes fueron aproximadamente tres veces más cortos que los de OpenAI Deep Research y usaron cerca de la mitad de citas, con una puntuación similar en una de las pruebas. La lectura de Ai2 es que el entrenamiento favorece una síntesis más concentrada, no simplemente respuestas más largas.
El coste comunicado requiere contexto: solo cuenta las llamadas a APIs externas y supone que el hardware y el alojamiento ya están pagados. Con esa condición, una consulta típica costaría aproximadamente 0,00008 dólares y el máximo configurado de diez búsquedas elevaría el coste a unos 0,0075 dólares. Ai2 compara esas cifras con unos 1,80 dólares por consulta de OpenAI Deep Research en ScholarQA-CSv2.
Qué cambia para ti
El modelo y el código se publican con una licencia permisiva, junto con los datos seleccionados, el sistema de entrenamiento, la implementación de RLER, el modelo DR Tulu-8B y la biblioteca dr-agent-lib.
Eso permite que universidades, empresas y desarrolladores puedan:
- Ejecutarlo con su propia infraestructura.
- Conectarlo a fuentes privadas o especializadas.
- Revisar qué buscó y qué evidencia utilizó.
- Adaptarlo a investigación científica, análisis documental o consultas internas.
No significa que la IA pueda investigar sin supervisión. En salud, por ejemplo, DR Tulu-8B obtuvo 43,7 en HealthBench, por delante de otros modelos abiertos, pero todavía con un margen importante de mejora. Ai2 también probó el sistema con preguntas sobre variantes genéticas y tratamientos, donde mostró una mejor síntesis de evidencias que varios competidores, aunque GPT-5 con búsqueda de OpenAI logró la puntuación general más alta.
La importancia de DR Tulu está menos en que un modelo pequeño reemplace a todos los agentes comerciales y más en que hace público el proceso completo: datos, herramientas, entrenamiento, evaluación y costes. El siguiente punto a vigilar será si otros equipos consiguen reproducir sus resultados y si las rúbricas evolutivas siguen detectando errores cuando el sistema se usa en dominios nuevos y con fuentes menos controladas.