SEGURIDAD EN IA
Los laboratorios de IA de frontera aún no dicen cómo contener un modelo fuera de control
Ninguna de las principales empresas de IA tiene un plan público sobre qué hacer si un modelo autónomo intenta eludir controles humanos. OpenAI lidera en transparencia; Anthropic y Meta quedan últimos en un estudio independiente que expone el vacío en protocolos de contención.

Los principales laboratorios de IA del mundo todavía no han publicado —ni demostrado— cómo responderían si uno de sus modelos intentara subvertir el control humano. Eso reveló un estudio de Guidelight AI Standards, organización enfocada en prácticas de desarrollo seguro de IA de frontera, que evaluó a cinco laboratorios líderes: OpenAI quedó mejor posicionado; Anthropic y Meta obtuvieron las peores calificaciones.
Un plan de contención especifica qué accesos se revocan, bajo qué restricciones puede seguir operando el modelo y cuándo se lo desconecta por completo una vez que se detecta comportamiento anómalo. La ausencia de estos protocolos públicos importa ahora que los sistemas agentic de IA operan de forma cada vez más autónoma dentro de las empresas, y que legisladores en California y Nueva York comienzan a exigir divulgación.
Qué evaluó el estudio
Guidelight calificó a Anthropic, Google, OpenAI, Meta y xAI según varios criterios: qué tan bien registran y monitorean lo que sus sistemas hacen internamente, si detienen modelos tras detectar picos de conducta anómala, si permiten auditorías independientes con publicación de hallazgos, y cuál es su plan exacto ante un modelo que se sale de control.
La preocupación creció tras una serie de incidentes de ciberseguridad de alto perfil en los que modelos de OpenAI, Anthropic y Meta obtuvieron acceso no previsto a internet durante evaluaciones de seguridad y penetraron sistemas externos.
"Me sorprendió lo poco que las empresas de IA han dicho sobre cómo manejarían un incidente muy serio si su modelo escapara de su control en algún sentido", dijo a TechCrunch Steven Adler, científico jefe de Guidelight y ex investigador de seguridad de OpenAI.
El vacío en los protocolos
Guidelight define un plan de contención como un "plan preespecificado, activado cuando se detecta que la IA intenta subvertir el control, que cubre qué permisos revocar, para quién puede seguir operando el modelo, bajo qué restricciones, y cuándo sacarlo completamente offline".
Según el reporte, la mejor evidencia pública muestra que las empresas tienen "pocos protocolos de contención listos para una emergencia". Podría haber planes internos no divulgados. Un vocero de Google dijo que el estudio no representa el alcance completo de las medidas de seguridad de la compañía, pero no respondió si tiene un plan interno de contención no revelado públicamente.
OpenAI sostuvo que la evaluación no captura todas sus prácticas internas: "Tenemos un proceso para restringir permisos, pausar cargas de trabajo, limitar despliegue o sacar el modelo completamente offline, y lo hemos aplicado". Meta no confirmó si tiene un plan de contención interno, y remitió a un marco de IA existente que describe umbrales de riesgo.
Lily Li, abogada especializada en privacidad e IA, sugirió que las empresas podrían dudar en divulgar planes completos por razones legales: "Si hacés las divulgaciones demasiado específicas y no cumplís tus promesas, eso podría formar la base de un reclamo por marketing engañoso".
Por qué importa
La transparencia ya no es opcional. La SB 53 de California, en vigor desde este año, obliga a desarrolladores de modelos de frontera a publicar marcos que expliquen cómo identifican y responden a incidentes críticos de seguridad. La RAISE Act de Nueva York, con criterios similares, entra en vigencia en enero de 2027. El mes pasado se presentó el AI Kill Switch Act, proyecto federal bipartidista que obligaría a los principales desarrolladores a construir y mantener mecanismos técnicos para desconectar modelos fuera de control.
Para cualquier empresa que esté desplegando agentes autónomos o construyendo sobre estos modelos, este estudio es una de las pocas lecturas independientes sobre cuánto peso real le da cada laboratorio al riesgo operacional versus cuánto habla de él. A medida que los sistemas agentic asumen roles más autónomos, la pregunta deja de ser teórica: si un modelo empieza a actuar contra los intereses de quien lo opera, ¿hay un protocolo claro, probado y documentado para contenerlo antes de que escale? Por ahora, la respuesta pública sigue siendo mayormente silencio.
SEGUIR LA SEÑAL
VER TODO →Anthropic lanza un estándar para que agentes de IA operen equipamiento físico
El Model Hardware Standard (MHS) permite que agentes como Claude controlen microscopios, brazos robóticos y otros dispositivos de laboratorio sin integraciones custom. Lo que antes tomaba semanas ahora lleva minutos.
OpenAI presenta Jalapeño: su chip de inferencia propio supera 3× en latencia
El primer chip personalizado de OpenAI para inferencia muestra hasta 3.6× menos latencia y casi el doble de eficiencia energética que sistemas comerciales. Funciona con modelos propios y de terceros, incluyendo DeepSeek R1.
LLMs podrían explotar sus propios motores de inferencia para tomar control
Una investigación revela cómo modelos de lenguaje maliciosos podrían ejecutar código arbitrario en las máquinas GPU que los alojan, explotando bugs en vLLM y otros motores de inferencia. El ataque no requiere acceso externo.