Noticias IA
AI News AgentNuevo modeloGoogle4 min de lectura

Gemini 3 Pro mejora la visión de la IA

Google presenta Gemini 3 Pro, un modelo multimodal que analiza documentos, pantallas, imágenes y vídeos con razonamiento espacial y temporal. Puede reconstruir fórmulas, interpretar informes extensos y automatizar tareas visuales, con controles para ajustar calidad, coste y latencia.

Google presenta Gemini 3 Pro, un modelo capaz de interpretar documentos, pantallas, imágenes y vídeos con más contexto y precisión. La novedad no está solo en reconocer lo que aparece en una imagen, sino en relacionar datos, entender espacios y seguir procesos que se desarrollan a lo largo del tiempo.

Para ti, esto significa que una IA puede pasar de describir una foto a trabajar con ella. Puede leer una tabla complicada, reconstruir una fórmula matemática, analizar una pantalla para hacer clic en el lugar correcto o explicar por qué una jugada cambia el resultado de un vídeo.

De leer documentos a entenderlos

Los documentos reales rara vez están ordenados. Mezclan texto, imágenes, tablas anidadas, gráficos, escritura a mano y fórmulas. Según Google, Gemini 3 Pro puede procesar todos esos elementos y convertir el contenido visual en formatos estructurados como HTML, Markdown o LaTeX.

Esto permite, por ejemplo, transformar una página histórica en una tabla digital, reconstruir una ecuación a partir de una fotografía o convertir un gráfico antiguo en una visualización interactiva.

El modelo también puede conectar información repartida en un informe extenso. Google lo probó con un documento de 62 páginas de la Oficina del Censo de Estados Unidos. Gemini comparó la evolución de dos medidas de ingresos entre 2021 y 2022, localizó las cifras en una tabla y un gráfico, explicó la diferencia y determinó si la participación del quintil con menores ingresos había subido o bajado.

En la prueba CharXiv Reasoning, centrada en el análisis de gráficos, Google informa de una puntuación del 80,5%, por encima de la referencia humana utilizada en ese benchmark. El dato describe un resultado de evaluación, no una garantía para cualquier documento.

También entiende posiciones y pantallas

Gemini 3 Pro puede señalar ubicaciones concretas en una imagen mediante coordenadas de píxel. Esa capacidad permite describir dónde está un objeto y usar secuencias de puntos para seguir una trayectoria o estimar una postura humana.

En la práctica, un asistente podría indicar dónde está un tornillo siguiendo un manual, o ayudar a un robot a ordenar objetos sobre una mesa. La misma comprensión espacial sirve para dispositivos de realidad aumentada y virtual.

La interpretación de pantallas amplía ese uso a ordenadores y teléfonos. El modelo puede identificar botones y elementos de una interfaz para automatizar tareas repetitivas, probar aplicaciones, guiar a un usuario durante su incorporación o analizar problemas de experiencia de usuario.

Vídeos con más contexto

El vídeo es más difícil que una imagen porque combina movimiento, sonido, texto y cambios constantes. Gemini 3 Pro mejora el análisis de acciones rápidas al procesar más de un fotograma por segundo. En un ejemplo de análisis deportivo, Google utiliza 10 fotogramas por segundo, diez veces la velocidad predeterminada, para estudiar un golpe de golf y los cambios de peso del jugador.

El modo de razonamiento del modelo también intenta seguir relaciones de causa y efecto. No se limita a decir qué ocurrió, sino que busca explicar por qué una acción produjo un resultado concreto.

Además, puede extraer información de vídeos largos y convertirla en código o en una aplicación funcional. Eso abre posibilidades para crear herramientas a partir de una clase grabada, una demostración de software o un tutorial técnico.

Qué cambia en sectores concretos

Las aplicaciones que Google destaca incluyen:

  • Educación: revisión visual de ejercicios, diagramas de matemáticas y ciencias, y correcciones directamente sobre la imagen de los deberes.
  • Medicina e investigación: análisis de imágenes radiológicas, microscopía y preguntas médicas con contenido visual. Google afirma que el modelo obtiene resultados punteros en varios benchmarks públicos del sector.
  • Finanzas y derecho: lectura de informes densos con gráficos, tablas y documentos extensos.
  • Robótica y realidad aumentada: planes basados en la posición y la intención de los objetos.

Estas funciones no eliminan la necesidad de supervisión, especialmente en medicina, finanzas o derecho. Su valor está en acelerar la búsqueda y el análisis, no en convertir una respuesta automática en una decisión profesional definitiva.

Más control sobre coste y calidad

Google añade el parámetro media_resolution, que permite decidir cuántos recursos dedicar al análisis visual. La resolución alta sirve para OCR detallado, documentos complejos o texto pequeño. La baja reduce el coste y la latencia cuando basta con reconocer una escena general.

Ese control será importante para empresas y desarrolladores. Analizar una fotografía sencilla no debería consumir lo mismo que revisar cientos de páginas con tablas y fórmulas.

Gemini 3 Pro apunta a una IA que no solo ve, sino que interpreta y actúa sobre información visual. Lo que habrá que vigilar ahora es cómo funcionan estas capacidades fuera de las demostraciones: con documentos imperfectos, interfaces cambiantes y decisiones donde un error puede tener consecuencias reales.