Seguridad

Agentes autónomos buscan errores y vulnerabilidades – InformatiqueNews

Claude Security Code, OpenAI Codex Security, GitHub Taskflow Agent, Google Big Sleep, Terra Portal, Remediator Agent… Las IA buscan errores y vulnerabilidades que los probadores humanos no han logrado encontrar a pesar de los años… ¡Y funciona!

Durante mucho tiempo, la idea de una IA capaz de descubrir por sí sola fallos graves en software complejo fue principalmente una demostración de laboratorio. Pero en los últimos meses ha empezado a tomar una forma mucho más concreta.

La señal más llamativa vino deantrópico : a finales de febrero, la joven startup de IA lanzó su Código de seguridad Claude en “vista previa de la investigación”. Durante su anuncio, el editor afirmó que su herramienta ya había descubierto más de 500 vulnerabilidades graves en bases de código abierto en producción y que, por lo tanto, hasta ahora habían escapado a los ojos humanos.

El editor lo volvió a hacer esta semana: en el marco del trabajo realizado con Mozilla, Claude Opus 4.6 descubrió en dos semanas 22 vulnerabilidades en Firefox, de las cuales 14 clasificadas como de gravedad alta por el editor. Anthropic afirma además haber enviado un total de 112 informes únicos después de analizar casi 6.000 archivos C++, y la mayoría de las correcciones se incorporaron en Firefox 148.0. Además de los 22 CVE oficiales, la colaboración descubrió alrededor de 90 errores adicionales (errores lógicos, fallos) que las herramientas de prueba automatizadas tradicionales, como el fuzzing, no habían detectado.

Chez Googleeste es el agente gran sueñoresultante de una colaboración entre DeepMind y Project Zero, que encarna esta nueva frontera. Lanzado a finales de 2024 con el nombre de Project Naptime, Big Sleep alcanzó un hito simbólico en julio de 2025 al identificar una vulnerabilidad crítica en SQLite (CVE-2025-6965, puntuación CVSS de 7,2), un defecto de corrupción de memoria conocido sólo por los actores maliciosos que se preparaban para explotarlo. El equipo de Google Threat Intelligence Group había detectado indicios de una explotación inminente sin poder localizar la falla en sí; Big Sleep, impulsado por estos indicadores, aisló la vulnerabilidad y permitió repararla antes de cualquier ataque. Desde entonces, el Big Sleep se ha acelerado: en agosto de 2025, Google anunció el descubrimiento de 20 fallos en importantes proyectos de código abierto, incluidos FFmpeg e ImageMagick. En noviembre de 2025, Apple le dio crédito a la herramienta por haber descubierto cinco vulnerabilidades en el componente WebKit de Safari, incluidos desbordamientos de búfer y daños en la memoria. Google ahora está implementando Big Sleep al servicio de proteger proyectos de código abierto ampliamente utilizados, posicionando explícitamente la IA como una ventaja estructural para los defensores.

OpenAI lanza hijo Codex Security

OpenAI no se queda fuera. Esta semana, el editor lanzó Seguridad del Códiceun agente de seguridad de aplicaciones de acceso temprano para suscriptores de ChatGPT Pro, Enterprise, Business y Edu. La herramienta, que sucede al proyecto interno Aardvark presentado en octubre de 2025, escaneó más de 1,2 millones de confirmaciones en repositorios externos durante su fase beta, identificando 792 defectos críticos y 10,561 fallas de alta gravedad. Se han reportado vulnerabilidades en proyectos líderes: OpenSSH, GnuTLS, GOGS, PHP, Chromium, libssh, entre otros. Hasta la fecha, se han atribuido 14 CVE a los hallazgos del Agente.

La diferenciación reivindicada por OpenAI tiene que ver con la profundidad contextual. Codex Security analiza un repositorio para comprender su arquitectura de seguridad, genera un modelo de amenaza editable y específico del proyecto y luego busca vulnerabilidades priorizándolas en función de su impacto potencial real. Los resultados se validan en entornos aislados antes de informarse, lo que reduce significativamente el ruido de los falsos positivos, un problema endémico de las herramientas SAST y DAST tradicionales. Según OpenAI, las alertas irrelevantes cayeron un 84% en algunos repositoriosgravedades sobreestimadas en más del 90% y falsos positivos en más del 50%. La empresa también lanzó un programa “ Códice para OSS » ofreciendo acceso gratuito a los mantenedores de proyectos de código abierto.

Laboratorio de seguridad de GitHub: un marco abierto

Del lado de Microsoft, es a través de Laboratorio de seguridad de GitHub que surja un enfoque complementario. Esta semana, el equipo de seguridad publicó un marco de código abierto llamado Agente de flujo de tareasdiseñado para automatizar auditorías de seguridad de código utilizando LLM.
A diferencia de las herramientas patentadas de Google y OpenAI, este enfoque se basa en la comunidad: cualquier investigador de seguridad puede crear, compartir y adaptar “flujos de tareas”, archivos YAML que describen secuencias de tareas de análisis.

Los resultados ya son convincentes. En apenas unos días, el marco ya ha identificado más de 80 vulnerabilidades en 40 repositorios de código abierto, de los cuales una veintena ya se han hecho públicas. Entre los hallazgos más notables: una falla en Rocket.Chat que le permite iniciar sesión como cualquier usuario debido a que falta una palabra clave «await» en el código TypeScript, un sutil error de lógica asincrónica que el LLM identificó al escanear varios archivos de código.
La IA también descubrió vulnerabilidades de autorización en la aplicación de comercio electrónico Spree, lo que permite a usuarios no autenticados acceder a direcciones de pedidos y números de teléfono de invitados. Estos errores de lógica empresarial, que pasaron desapercibidos durante años, ilustran la capacidad de los LLM para detectar fallas que los escáneres tradicionales no pueden detectar.

Pentesting reinventado por IA agente

Más allá del análisis estático, una nueva generación de startups está aplicando IA agente a las pruebas de penetración continuas. Seguridad Terrauna startup con sede en Nueva York y Tel Aviv que ha recaudado 38 millones de dólares en total (incluida una Serie A de 30 millones de dólares a finales de 2025 liderada por Felicis), presentó esta semana su Portal Terrauna aplicación de escritorio que sirve como capa de tiempo de ejecución para pentesters. La premisa: enjambres de agentes autónomos de IA realizan reconocimiento, mapeo de superficies de ataque, generación de hipótesis y validación de vulnerabilidades, mientras expertos humanos mantienen la supervisión en puntos de decisión críticos.

Terra afirma reducir el ciclo de descubrimiento-remediación de tres meses en promedio a unas pocas horas, al tiempo que cumple con el umbral de 15 días de CISA para la remediación de vulnerabilidades críticas. La plataforma, la primera en obtener la competencia AWS Security para la validación de seguridad autónoma, integra dos tipos de agentes: “agentes de IA ambiental” que gestionan de forma autónoma las tareas de reconocimiento y análisis, y “agentes de IA Copilot” que apoyan a los pentesters humanos en las fases de explotación controlada. Este modelo híbrido permite que un solo pentester supervise un volumen de pruebas que antes requería un equipo completo.

De la detección a la remediación automatizada

La detección es sólo la mitad del problema. Seguridad Fénixun editor especializado en gestión de la postura de seguridad de aplicaciones (ASPM), lleva la lógica un paso más allá con agentes de IA capaces no sólo de priorizar las vulnerabilidades, sino también de proponer y aplicar correcciones directamente en el código. Su Agente RemediadorIntegrado de forma nativa en GitHub, crea automáticamente solicitudes de extracción contextualizadas teniendo en cuenta el análisis de accesibilidad, la deduplicación contextual y el impacto empresarial.

Los resultados mostrados por los primeros clientes dan una idea de la magnitud del cambio: ClearBank afirma una reducción del 98% en el ruido de las vulnerabilidades de los contenedores, Bazaarvoice eliminó todas sus vulnerabilidades críticas en dos semanas. Phoenix Security fue nombrada líder de ASPM en el informe Latio 2026. Este cambio del paradigma de “buscar e informar” al paradigma de “analizar y arreglar” es probablemente la evolución más transformadora para los equipos de DevSecOps.

La convergencia de estas iniciativas está dando forma a un nuevo panorama de ciberseguridad defensiva. Para los administradores de seguridad surgen varias lecciones. En primer lugar, la IA es particularmente eficaz en errores lógicos complejos (omisiones de autenticación, fugas de datos, errores de gestión asincrónica) que históricamente escapan a los escáneres tradicionales y de fuzzing. En segundo lugar, la brecha entre la capacidad de detección y la capacidad de explotación sigue siendo significativa: la experiencia de Anthropic, donde 4.000 dólares invertidos con fines de ataque produjeron sólo dos hazañas bastante primitivas, sugiere que los atacantes no convertirán inmediatamente estas herramientas en armas automatizadas. Finalmente, la dimensión comunitaria encarnada por GitHub Taskflow Agent muestra que la democratización de estas herramientas podría, en última instancia, transformar la búsqueda de vulnerabilidades en un esfuerzo más colectivo y continuo. ¿Podríamos finalmente tener el comienzo de una solución a la proliferación de vulnerabilidades en nuestros sistemas de información y la consiguiente presión creciente sobre los CISO?

____________________________

Lea también:

Ciberseguridad: Tenable evoluciona su gestión de vulnerabilidades con IA generativa

Claude Code, Cowork, pánico bursátil: la semana turbulenta de Anthropic

IA agente y ciberseguridad: cuando la autonomía se convierte a la vez en una amenaza y una defensa…

Cinco áreas para construir una ciberseguridad resiliente en la era de la IA…

Adelantarse a los ciberadversarios integrando la IA en la seguridad

[

Related posts
Seguridad

Contraseñas en la era de la IA: 7 reflejos para revisar

¿Qué pasaría si el 7 de mayo de 2026 fuera el último “día de la contraseña”? Frente a la…
Read more
Seguridad

por qué “el menor privilegio” sigue fuera de nuestro alcance

El principio de privilegio mínimo se ha vuelto obvio en el gobierno de TI. En todos lados. Incluso…
Read more
Seguridad

Todo sobre el riesgo de fuga de datos del navegador

El nuevo riesgo cibernético ya no implica necesariamente un archivo adjunto con trampa explosiva…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *