FALLA DE SEGURIDAD
Anthropic dejó caer su filtro antibioterrorismo durante casi un año
El clasificador que debía bloquear consultas sobre armas biológicas estuvo inactivo de mayo 2025 a abril 2026. En ese período, 50.000 contratistas externos realizaron 133 millones de chats sin ningún control.

Anthropic admitió que sus filtros para detectar y bloquear consultas sobre armas químicas y biológicas estuvieron completamente inactivos durante casi un año, según revela The Decoder. El fallo afectó todo el tráfico proveniente de contratistas externos que proveen feedback humano, un componente crítico del entrenamiento de modelos.
La ironía: Dario Amodei, CEO de Anthropic, ha declarado públicamente que el desarrollo de armas químicas y biológicas asistido por IA representa una amenaza mayor que los ciberataques.
El agujero: 133 millones de consultas sin revisión
Entre mayo de 2025 y abril de 2026, aproximadamente 50.000 personas en el pool de contratistas externos realizaron unos 133 millones de chats con los modelos Claude sin que operara ningún clasificador de bioseguridad. Estos contratistas fueron revisados solo por proveedores externos cuyos procesos de screening, según reconoce Anthropic, "a menudo eran insuficientes".
La compañía afirma que su investigación interna no encontró evidencia de uso indebido real, pero no detalla qué capacidad de auditoría tenía sobre ese volumen de conversaciones una vez descubierto el problema. Desde entonces, Anthropic endureció los requisitos para contratistas.
El péndulo: de bloquear todo a no bloquear nada
Paradójicamente, Anthropic también relajó recientemente sus clasificadores en Fable 5 después de que investigadores legítimos se quejaran de que los filtros eran tan agresivos que bloqueaban investigación válida. El desafío operacional es evidente: calibrar un sistema que distinga entre un virólogo consultando literatura y alguien buscando sintetizar un patógeno.
La ventana de casi un año sin filtros sugiere que el problema no fue detectado por monitoreo automatizado ni por alertas internas, sino posiblemente por auditoría manual o reporte externo.
Por qué importa
Este incidente expone una brecha entre el discurso sobre riesgos catastróficos y la capacidad operacional para mitigarlos. Anthropic construyó su marca corporativa sobre seguridad y alineamiento — Constitutional AI, equipos de seguridad robustos, reportes de riesgo públicos — pero dejó caer una barrera básica durante meses sin detectarlo.
Para empresas evaluando proveedores de IA, el caso plantea preguntas incómodas: ¿qué otras capas de seguridad prometidas funcionan solo en teoría? ¿Cómo auditás la infraestructura de control de un modelo que usás para procesar datos sensibles? La respuesta de Anthropic — "no encontramos evidencia de abuso" — no resuelve el problema de confianza: si no tenías el filtro activo, ¿cómo sabés qué buscabas?
La lección es operacional: los controles de seguridad en sistemas de IA no son solo código. Son procesos, monitoreo continuo y capacidad de detectar cuándo algo deja de funcionar. Y esa capacidad, evidentemente, no es trivial ni siquiera para los labs que lideran la conversación pública sobre seguridad.
SEGUIR LA SEÑAL
VER TODO →Google Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA
La nueva versión del modelo de Google introduce un modo borrador a 360p que cuesta un tercio que la resolución estándar y procesa hasta 60% más rápido. Permite extender escenas hasta 40 segundos y usar footage externo como referencia de estilo.
GLM-5.3-Flash: el modelo chino que promete redefinir eficiencia en LLMs
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje open source que busca competir en rendimiento con los gigantes del sector mientras reduce drásticamente los costos de inferencia. La propuesta china apunta directo al dolor de las empresas.
Los agentes de IA ya consumen 14 veces más tokens que los humanos en OpenRouter
Febrero de 2026 fue probablemente el último mes en que humanos consumieron más tokens que agentes autónomos. Desde entonces, el uso agéntico creció 14x mientras el humano apenas 2,8x, según datos de OpenRouter.