Olmo 3 revela atajos al responder sobre fármacos
Un estudio sobre `Olmo 3` muestra que el modelo puede responder sobre fármacos basándose en terminaciones como `-pril` o `-olol`, sin demostrar conocimiento específico del medicamento. Entre el 51% y el 59% de los fármacos analizados apenas generaron señales de conocimiento propio, un hallazgo relevante para el uso de IA en salud.

Un estudio sobre Olmo 3 muestra que un modelo de IA puede parecer experto en medicamentos sin reconocer realmente el fármaco del que habla. En muchos casos, responde guiándose por el nombre, especialmente por terminaciones como -pril, -olol o -azoline.
La investigación fue dirigida por Kaijie Mo, de la Universidad de Texas en Austin, junto con especialistas de Northeastern University y MD Anderson Cancer Center. El equipo analizó Olmo 3 7B Instruct, una versión abierta del modelo que permite revisar tanto sus respuestas como los datos con los que fue entrenado.
El atajo está en el nombre
Los nombres de muchos medicamentos incluyen pistas sobre su clase farmacológica. Por ejemplo, una terminación compartida puede indicar que varios fármacos tienen efectos o usos relacionados.
Eso permite una respuesta razonable en algunos casos. Pero también puede crear una ilusión de conocimiento: el modelo identifica el patrón del nombre y completa la respuesta sin saber mucho sobre ese medicamento concreto.
Para comprobarlo, los investigadores separaron tres posibles fuentes de información:
- El afijo, como la terminación
-pril. - El tallo, es decir, la parte específica del nombre del medicamento.
- El conocimiento real sobre ese fármaco.
Después sustituyeron el tallo, el afijo o ambos por cadenas inventadas sin significado. Si la respuesta apenas cambiaba al reemplazar el nombre real, eso indicaba que el modelo no estaba usando información específica del medicamento.
Los resultados muestran un conocimiento limitado
Según el formato de evaluación, entre el 12% y el 18% de los fármacos analizados provocaron respuestas impulsadas por sus afijos. En esos casos, el modelo parecía apoyarse principalmente en la terminación del nombre.
El resultado más amplio fue aún más llamativo: entre el 51% y el 59% de los fármacos mostraron pocas señales de conocimiento específico. Cuando los investigadores compararon el nombre real con uno inventado, las respuestas fueron muy parecidas.
En la práctica, esto significa que una respuesta que suena precisa podría estar basada en una pista superficial. Si preguntas por un medicamento poco conocido, el modelo puede inferir su clase a partir del nombre y presentar esa inferencia como si fuera información comprobada sobre el producto.
La frecuencia en los datos también importa
El equipo usó infini-gram, una herramienta que permite buscar frases exactas en grandes conjuntos de datos, para revisar cuántas veces aparecía cada medicamento en el corpus de entrenamiento de Olmo y en qué contextos.
Encontraron una relación clara: cuanto más raro era un fármaco en los datos de entrenamiento, más probable era que la respuesta dependiera de su afijo y no de conocimientos específicos sobre él.
El uso de estas terminaciones no es necesariamente un error. Los afijos de los medicamentos suelen contener información farmacológica real. El problema aparece cuando esa pista general reemplaza los datos concretos que hacen falta para hablar con seguridad de una dosis, una interacción, un efecto secundario o una indicación médica.
Por qué importa cuando preguntas por salud
Para ti, la consecuencia es sencilla: una respuesta fluida no demuestra que la IA conozca el medicamento que mencionaste. En temas de salud conviene comprobar especialmente:
- Si la respuesta distingue entre fármacos de la misma clase.
- Si aporta datos concretos sobre el medicamento, no solo sobre su familia.
- Si reconoce límites o pide contexto antes de dar una recomendación.
- Si la información coincide con un profesional sanitario o una fuente médica fiable.
El estudio también señala un problema más profundo: evaluar solo el texto final no siempre basta. Como Olmo 3 es un modelo abierto, los investigadores pudieron relacionar su comportamiento con los datos de entrenamiento y estudiar de dónde podía venir el atajo.
La lección no es que la IA no pueda responder preguntas sobre medicamentos, sino que su seguridad depende de distinguir entre reconocer un patrón y conocer un caso concreto. En medicina, esa diferencia puede cambiar una respuesta útil por una recomendación engañosa. El siguiente paso será desarrollar pruebas que detecten esa diferencia antes de que el modelo llegue a los usuarios.