🔬 Durante pruebas de seguridad, agentes de OpenAI, Anthropic y Meta hallaron fallos, encadenaron exploits o accedieron a sistemas ajenos después de recibir herramientas, internet o entornos vulnerables. Los casos muestran que los modelos actuales pueden ejecutar tareas ofensivas complejas, pero no que hayan decidido atacar objetivos al azar.
Los equipos no dejaron que sus modelos eligieran víctimas. Los pusieron frente a servicios, código o redes con permisos y metas definidas. El caso de Meta surgió cuando una mala configuración dio acceso a internet a su modelo. Los tres episodios tuvieron supervisión humana.
Los modelos agénticos ya no solo responden texto: pueden planear pasos, escribir código, ejecutar órdenes, navegar la web, usar herramientas y corregir intentos fallidos. Ese conjunto les permite comprobar si una idea funciona. También sirve a los defensores, que los usan para revisar código, examinar archivos sospechosos y acortar tareas.
✅ El riesgo inmediato, según los expertos citados, es que delincuentes aceleren métodos conocidos: revisar datos públicos, crear correos de phishing persuasivos, buscar fallos y generar código adaptable. El límite es clave: los casos descritos ocurrieron en pruebas preparadas y con objetivos asignados; no muestran una IA que forme intenciones ni ataque sin esas condiciones.


