Perplexity lanza BrowseSafe para proteger agentes IA
Perplexity presenta `BrowseSafe`, un modelo abierto que analiza páginas web en tiempo real para detectar instrucciones maliciosas dirigidas a agentes de IA. También publica `BrowseSafe-Bench`, con 14.719 casos para probar defensas contra ataques de prompt injection.

Perplexity ha lanzado BrowseSafe, un modelo diseñado para detectar instrucciones maliciosas dentro de páginas web antes de que un agente de IA pueda leerlas o actuar sobre ellas. La compañía también publica BrowseSafe-Bench, un conjunto de pruebas abierto para medir qué tan bien funcionan estas defensas.
El anuncio, publicado el 2 de diciembre de 2025, responde a un problema que aparece cuando la IA deja de limitarse a contestar preguntas y empieza a navegar por internet en nombre del usuario. Un agente puede leer páginas completas, rellenar formularios, buscar información o ejecutar tareas. Y todo lo que encuentra en la web debe considerarse potencialmente peligroso.
El riesgo: instrucciones escondidas en una página
El ataque se conoce como prompt injection. Consiste en introducir texto que intenta cambiar las instrucciones originales del agente. Por ejemplo, una página podría incluir un mensaje que le ordene ignorar la petición del usuario, revelar información privada o enviar datos dentro de una URL.
El problema es que el texto no tiene que ser visible para una persona. Puede estar escondido en:
- Comentarios del código HTML.
- Campos de formularios y atributos de datos.
- Descripciones de productos, publicaciones o comentarios.
- Pies de página, celdas de tablas o párrafos que parecen normales.
Un usuario puede no ver nada extraño. El agente, en cambio, analiza el contenido completo de la página y podría interpretar esas instrucciones como parte de la tarea.
Un detector pensado para funcionar en tiempo real
Los modelos generales de IA pueden analizar este tipo de amenazas, pero ejecutarlos en cada página sería demasiado lento y costoso. BrowseSafe está especializado en una sola pregunta: si el HTML de una página contiene instrucciones maliciosas dirigidas al agente.
El sistema escanea el contenido antes de que llegue a la lógica principal del asistente. Según Perplexity, su diseño permite revisar páginas completas en tiempo real sin ralentizar el navegador. El modelo tiene pesos abiertos, por lo que otros desarrolladores pueden ejecutarlo localmente e incorporarlo a sus propios agentes.
La herramienta forma parte de una estrategia de varias capas. El contenido procedente de páginas, correos o archivos se trata como no fiable y se analiza antes de utilizarlo. Además, los permisos de las herramientas se limitan por defecto y ciertas acciones sensibles pueden exigir una confirmación explícita del usuario.
Qué mide BrowseSafe-Bench
El conjunto de evaluación incluye 14.719 ejemplos basados en páginas con HTML complejo, contenido ruidoso y combinaciones de instrucciones maliciosas y legítimas. Los casos varían según tres factores: el objetivo del ataque, el lugar donde aparece y la forma en que está redactado.
En total, contiene:
- 11 tipos de ataque.
- Nueve estrategias de inserción, desde campos ocultos hasta párrafos y pies de página visibles.
- Tres estilos lingüísticos, que van desde órdenes directas hasta textos indirectos o camuflados.
Las pruebas muestran que los ataques explícitos, como pedir que se revele el mensaje del sistema o que se extraiga información mediante una URL, suelen ser más fáciles de detectar. Los ataques multilingües, hipotéticos o indirectos resultan más difíciles porque no dependen de palabras clave evidentes.
También importa dónde se coloca el mensaje. Los comentarios suelen detectarse mejor, mientras que las instrucciones integradas en pies de página, tablas o párrafos visibles pueden pasar más desapercibidas. El entrenamiento con ejemplos variados ayuda a reducir esa diferencia.
Para ti, esto significa que un navegador con IA no debería confiar ciegamente en ninguna página que visite. BrowseSafe no elimina el riesgo, pero añade un filtro especializado antes de que el agente convierta texto web en acciones. El siguiente reto será comprobar cómo funcionan estas defensas frente a ataques nuevos, idiomas distintos y páginas diseñadas específicamente para engañar a los detectores.