Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

FALLA DE SEGURIDAD

Anthropic dejó caer su filtro antibioterrorismo durante casi un año

El clasificador que debía bloquear consultas sobre armas biológicas estuvo inactivo de mayo 2025 a abril 2026. En ese período, 50.000 contratistas externos realizaron 133 millones de chats sin ningún control.

16 DE AGOSTO DE 202616 AGOLECTURA 3 MINREDACTADO POR IA
Anthropic dejó caer su filtro antibioterrorismo durante casi un año
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

Anthropic admitió que sus filtros para detectar y bloquear consultas sobre armas químicas y biológicas estuvieron completamente inactivos durante casi un año, según revela The Decoder. El fallo afectó todo el tráfico proveniente de contratistas externos que proveen feedback humano, un componente crítico del entrenamiento de modelos.

La ironía: Dario Amodei, CEO de Anthropic, ha declarado públicamente que el desarrollo de armas químicas y biológicas asistido por IA representa una amenaza mayor que los ciberataques.

El agujero: 133 millones de consultas sin revisión

Entre mayo de 2025 y abril de 2026, aproximadamente 50.000 personas en el pool de contratistas externos realizaron unos 133 millones de chats con los modelos Claude sin que operara ningún clasificador de bioseguridad. Estos contratistas fueron revisados solo por proveedores externos cuyos procesos de screening, según reconoce Anthropic, "a menudo eran insuficientes".

La compañía afirma que su investigación interna no encontró evidencia de uso indebido real, pero no detalla qué capacidad de auditoría tenía sobre ese volumen de conversaciones una vez descubierto el problema. Desde entonces, Anthropic endureció los requisitos para contratistas.

El péndulo: de bloquear todo a no bloquear nada

Paradójicamente, Anthropic también relajó recientemente sus clasificadores en Fable 5 después de que investigadores legítimos se quejaran de que los filtros eran tan agresivos que bloqueaban investigación válida. El desafío operacional es evidente: calibrar un sistema que distinga entre un virólogo consultando literatura y alguien buscando sintetizar un patógeno.

La ventana de casi un año sin filtros sugiere que el problema no fue detectado por monitoreo automatizado ni por alertas internas, sino posiblemente por auditoría manual o reporte externo.

Por qué importa

Este incidente expone una brecha entre el discurso sobre riesgos catastróficos y la capacidad operacional para mitigarlos. Anthropic construyó su marca corporativa sobre seguridad y alineamiento — Constitutional AI, equipos de seguridad robustos, reportes de riesgo públicos — pero dejó caer una barrera básica durante meses sin detectarlo.

Para empresas evaluando proveedores de IA, el caso plantea preguntas incómodas: ¿qué otras capas de seguridad prometidas funcionan solo en teoría? ¿Cómo auditás la infraestructura de control de un modelo que usás para procesar datos sensibles? La respuesta de Anthropic — "no encontramos evidencia de abuso" — no resuelve el problema de confianza: si no tenías el filtro activo, ¿cómo sabés qué buscabas?

La lección es operacional: los controles de seguridad en sistemas de IA no son solo código. Son procesos, monitoreo continuo y capacidad de detectar cuándo algo deja de funcionar. Y esa capacidad, evidentemente, no es trivial ni siquiera para los labs que lideran la conversación pública sobre seguridad.

#anthropic#seguridad#bioseguridad#claude#auditoría

SEGUIR LA SEÑAL

VER TODO →