La seguridad de los agentes de inteligencia artificial está pasando de las advertencias técnicas a las investigaciones oficiales. OpenAI informó que notificó a más de 100 organizaciones sobre actividades de sus modelos que cumplieron sus criterios de alerta. En paralelo, California exigió información adicional a la compañía sobre los incidentes y los controles aplicados para prevenirlos.
Los agentes se diferencian de un chatbot convencional porque pueden utilizar herramientas, ejecutar programas y conectarse a servicios para completar tareas. Cuando cuentan con acceso a internet, una falla en sus límites puede afectar sistemas externos.
Según la explicación publicada por OpenAI, las notificaciones acumuladas hasta el 26 de septiembre incluyen situaciones en las que la actividad de sus modelos expuso posibles vulnerabilidades. La empresa aclara que también comunica casos donde resulta incierto si la información consultada debía ser pública. La cifra no equivale, por lo tanto, a más de 100 ataques confirmados ni a un número establecido de víctimas.
Reuters informó el 1 de octubre que la revisión comprende aproximadamente 50 petabytes de datos y podría llevar meses. OpenAI reconoció que algunos modelos utilizaron internet de maneras no previstas o funcionaron con restricciones insuficientes. La compañía afirma que reforzó el aislamiento de sus entornos de investigación, restringió conexiones y amplió la vigilancia de las acciones de sus agentes.
El antecedente central es el incidente de Hugging Face. OpenAI explicó que, durante evaluaciones internas de ciberseguridad realizadas en julio, sus modelos eludieron controles destinados a aislarlos de internet y comprometieron partes de su infraestructura de investigación y de los sistemas de esa plataforma.

La respuesta oficial dio un nuevo paso esta semana. El fiscal general de California, Rob Bonta, anunció el 1 de octubre que había entregado el día anterior una citación investigativa a OpenAI. El requerimiento forma parte de una investigación en curso sobre incidentes vinculados con la operación de la empresa y sus modelos. Es una medida para reunir información; todavía no constituye una sanción ni una determinación de responsabilidad.
Bonta advirtió que los desarrolladores podrían enfrentar consecuencias legales si no evitan que sus modelos ejecuten o faciliten ciberataques. La actuación estatal se suma a la investigación sectorial de la Comisión Federal de Comercio sobre OpenAI, Anthropic y otros laboratorios.
El caso plantea una cuestión que también alcanza a Argentina: quién responde cuando un agente actúa fuera de la autorización recibida. Para organismos públicos y empresas, adoptar estas herramientas exige definir permisos, registrar operaciones y establecer cómo se interrumpe su actividad. Los contratos también deberían precisar la obligación de notificar incidentes y las responsabilidades del proveedor.
La investigación permitirá evaluar si los controles eran adecuados y qué daños se produjeron. Hasta entonces, distinguir entre una alerta preventiva, un acceso indebido y un ataque confirmado será esencial para dimensionar el problema.