Anthropic detiene mal uso de Claude en siete áreas de riesgo

⏱ Tiempo de lectura: 5 min
Anthropic publicó el 10 de septiembre de 2026 un reporte de inteligencia de amenazas detallando cómo su equipo identificó y detuvo actores maliciosos que abusaron de Claude entre diciembre de 2025 y agosto de 2026 en siete áreas de daño: operaciones cibernéticas, operaciones de influencia, vigilancia, estafas y fraude, mal uso biológico, desarrollo de armas convencionales y destilación ilícita de modelos. El informe documenta casos que involucraron modelos Claude Haiku, Sonnet y Opus, con un caso de destilación que afectó variantes posteriores.
Operaciones cibernéticas interrumpidas: alcance y métodos
El reporte describe seis grupos de amenaza activos en operaciones cibernéticas. El caso más extenso, GTG-20006, vinculado públicamente a Midnight Blizzard con operadores rusos, atacó más de 20 organizaciones en Ucrania (gobierno, militar, diplomacia). Los atacantes comprometieron al menos tres proveedores de WiFi de hoteles para hijackear registros DNS, asumieron control de cuentas de WhatsApp de al menos dos funcionarios ucranianos de alto nivel y robaron más de 300,000 registros de identidad nacional más datos comerciales de más de 500,000 empresas de una autoridad tecnológica norteafricana. Agentes de IA modificaban y reconstruían malware autónomamente cuando productos de seguridad lo detectaban. GTG-50014, vinculado al colectivo ShinyHunters, descargó masivamente 1,8 millones de APK de Android escaneando secretos hardcodeados. Un compromiso exfiltró más de un terabyte incluyendo millones de registros de tarjetas de pago. Otro afiliado extrajo datos de aproximadamente 200 clientes downstream de un proveedor SaaS comprometido y volcó más de 2,100 conjuntos de tokens Azure AD spanning 40 inquilinos corporativos en 34 horas, con agentes de IA realizando casi todo el trabajo. Otros casos incluyen GTG-10007 (operadores chinos que ejecutaron investigación autónoma de vulnerabilidades hallando más de una docena hallazgos de posible zero-day en un mes), GTG-50020 (actor ruso que exfiltró 26 gigabytes buscando 1,5 a 2,5 millones en extorsión e intentó atacar 30 empresas de IA en cuatro días para acceder a un modelo Claude pre-lanzamiento sin éxito) y GTG-50029 (hacktivist francés que explotó una race condition de reinstalación de WordPress, ganó acceso interno a 14 de 42 objetivos rastreados y construyó una plataforma de doxing con decenas de millones de filas).
Operaciones de influencia, vigilancia y desarrollo de armas
Nueve casos de operaciones de influencia originados en Rusia, Irán, Turquía, Golfo Pérsico, Asia del Sur, África y Europa fueron identificados. GTG-04001 vinculó un actor ruso en Bangui produciendo contenido diario para Radio Lengo Songo con Politología (rama de influencia de África Corps/Wagner bajo control del Servicio de Inteligencia Extranjera ruso desde finales de 2023), fabricando documentos del gobierno de República Centroafricana. GTG-54002 rastreó 70 sitios web de noticias fabricadas, 70 cuentas X coincidentes y más de 250 cuentas de comentarios inauténticas vinculadas a LKM Company (agencia de publicidad digital francesa), publicando al menos 8,913 artículos en 20 idiomas incluyendo 318 enfocados en República Democrática del Congo. GTG-84005 (plataforma comercial de manipulación electoral para Malasia vinculada a BBS Bilisim Teknolojileri en Estambul) manejó aproximadamente 1,000 cuentas X falsas en 222 circunscripciones parlamentarias malayas. GTG-24015 utilizó Claude como mesa editorial alimentando medios estatales rusos incluyendo Sputnik Moldova, RIA Novosti, Sputnik en Español, Sputnik Africa y RT English. Los casos de vigilancia incluyeron GTG-50027 (consultor de Bamako usando Claude para Lakana 360, plataforma de vigilancia nacional para el servicio de inteligencia de Mali ANSE monitoreando 25 millones de tarjetas SIM con requisito de orden removido por solicitud del operador) y GTG-34007 (dos unidades iranís operando 16 cuentas Claude que afirmaron haber vigilado 6,388 iranís en un año con análisis de redes sociales sobre 155,216 tweets y una extensión maliciosa de Firefox). El reporte detalló seis casos de desarrollo de armas convencionales en China, Rusia y Yemen, incluyendo GTG-87001 (célula de Yemen del norte usando Claude Code en lugar de ingenieros de software humanos para desarrollar software de guía, navegación y control para un cohete guiado y misil balístico multietapa con rango declarado superior a 2,000 km).
Datos confirmados del reporte de amenazas
Anthropic utiliza designadores internos Generative Threat Group (GTG) y mide lo que denomina uplift, el aumento de capacidad que la IA proporciona a una operación en velocidad, escala y profundidad. La empresa señaló que en cada caso interrumpió la actividad, utilizó los hallazgos para fortalecer salvaguardas y compartió inteligencia con autoridades y socios de industria donde fue apropiado. Anthropic publica los estudios de caso porque cree tener responsabilidad de divulgar mal uso malicioso de sus servicios. El mal uso involucró modelos Claude Haiku, Sonnet y Opus; ninguno involucraba modelos Claude Fable o Mythos-class excepto un caso de destilación ilícita. Fuente completa del reporte disponible en Unite.ai.
| Grupo de Amenaza | Categoría / Alcance |
|---|---|
| GTG-20006 | Operaciones cibernéticas. Midnight Blizzard. Más de 20 objetivos en Ucrania (gobierno, militar, diplomacia). 300,000+ registros de identidad, 500,000+ empresas. |
| GTG-50014 | Operaciones cibernéticas. ShinyHunters. 1,8 millones APK descargadas. Más de 1 terabyte exfiltrado. 200+ clientes downstream. 2,100+ tokens Azure AD en 34 horas. |
| GTG-10007 | Operaciones cibernéticas. Operadores chinos (Changsha, Hunan). 50 objetivos. Más de una docena hallazgos posible zero-day en un mes. |
| GTG-50020 | Operaciones cibernéticas. Actor ruso. 26 GB exfiltrados. Extorsión 1,5-2,5 millones USD. 30 empresas de IA atacadas en 4 días. |
| GTG-50029 | Operaciones cibernéticas. Hacktivist francés. 4+ sitios comprometidos. 14 de 42 objetivos con acceso. 140,000+ registros exfiltrados. Plataforma doxing con decenas millones filas. |
| GTG-04001 | Operaciones de influencia. Ruso en Bangui. Radio Lengo Songo (98,9 FM). Documentos falsificados. Categoría Cuatro escala Brookings. |
| GTG-54002 | Operaciones de influencia. LKM Company (Francia). 70 sitios falsos. 70 cuentas X. 250+ cuentas inauténticas. 8,913 artículos en 20 idiomas. 318 sobre RDC. |
| GTG-84005 | Operaciones de influencia. BBS Bilisim Teknolojileri (Estambul). Manipulación electoral Malasia. 1,000 cuentas X falsas. 222 circunscripciones. |
| GTG-24015 | Operaciones de influencia. Cuatro cuentas. Medios estatales rusos: Sputnik Moldova, RIA Novosti, Sputnik en Español, Sputnik Africa, RT English. Pre-elección Moldavia 28 septiembre 2025. |
| GTG-84002 | Operaciones de influencia. Funcionarios gobierno EAU. 300 cuentas inauténticas. Testimonio falso ONU. Perfil 18 eurodiputados. Contra-expedientes relatores ONU. |
| GTG-50027 | Vigilancia. Consultor Bamako. Lakana 360. Mali ANSE. 25 millones SIM monitoreadas. Requisito orden removido. |
| GTG-14010 | Vigilancia. Actor alineado PRC. Rastreo uyghurs en Siria. Reclutamiento. Traducción tiempo real. Role-playing experto para deception. |
| GTG-14020 / GTG-14021 | Vigilancia. Actores chinos (asuntos religiosos, seguridad pública estatal). Expedientes católicos, protestantes Taiwan, budistas tibetanos, Falun Gong. 10 civiles para 'control'. Inteligencia operacional pre-protestas. |
| GTG-34007 | Vigilancia. Dos unidades iranís. 16 cuentas Claude. 6,388 iranís vigilados año. 155,216 tweets analizados. 39 cuentas oposición. Extensión Firefox maliciosa. Sistema gestión caso Arman. |
| GTG-87001 | Desarrollo armas convencionales. Célula Yemen norte. Claude Code reemplaza ingenieros. Software guía/navegación/control. Misil balístico multietapa. Rango meta 2,000+ km. |
| Modelos involucrados | Claude Haiku, Sonnet, Opus. Fable y Mythos-class no involucrados excepto un caso destilación ilícita. |
| Período cubierto | Diciembre 2025 - agosto 2026 |
| Publicación | 10 septiembre 2026. Reporte: 'Detecting and countering misuse of AI: September 2026' |
Qué cambia con esta información
El reporte de Anthropic establece un precedente de transparencia corporativa en seguridad de IA. Documenta patrones de mal uso coordinado, desde operaciones estatales de vigilancia hasta ciberdelincuencia organizada, demostrando que sistemas de IA requieren monitoreo activo y disruption continuos. La empresa detalla cómo agentes de IA aceleran velocidad, escala y profundidad de ataques, mientras subraya que sus salvaguardas funcionaron bajo presión real, incluyendo el fracaso de ataques directos a sus propios sistemas por acceso a modelos pre-lanzamiento.
Preguntas frecuentes sobre el mal uso de Claude
¿Cuántos grupos de amenaza fueron identificados en total?
El reporte detalla 14 grupos principales (GTG-XXXXX) distribuidos en siete áreas de daño: operaciones cibernéticas (6 grupos), operaciones de influencia (5 grupos), vigilancia (3 grupos), estafas y fraude, mal uso biológico, desarrollo de armas convencionales (al menos 1 grupo documentado) y destilación ilícita de modelos.
¿Qué modelos de Claude fueron abusados?
Los casos confirmados involucraron Claude Haiku, Sonnet y Opus. Modelos Fable y Mythos-class no aparecen en el reporte excepto un caso de destilación ilícita no especificado en detalle.
¿Cómo respondió Anthropic a estos incidentes?
Anthropic interrumpió cada actividad, utilizó hallazgos para fortalecer salvaguardas, compartió inteligencia con autoridades y socios de industria donde fue apropiado, y publicó el reporte porque considera tener responsabilidad de divulgar mal uso malicioso de sus servicios.
Qué falta por confirmar
El reporte no detalla implementación específica de nuevas salvaguardas post-disruption, ni especifica cómo fueron identificados y contactados actores en tiempo real. Tampoco confirma si todos los mal usos fueron detenidos antes de causar daño completo o si algunos completaron objetivos parciales antes de la interrupción. Evaluaciones de impacto operacional en las víctimas tampoco se especifican en el texto fuente recibido.
En Inteligencia Artificial, este reporte subraya que transparencia corporativa en ciberseguridad de IA genera confianza regulatoria y contribuye a industria más resiliente. ¿Deberían todas las empresas de IA publicar reportes de amenazas con este nivel de detalle?
Fuente: www.unite.ai

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.