Booz Allen probó 18 modelos de IA atacando una red real: Claude Mythos terminó el trabajo; un harness barato empató con él desde el puesto 15 | Tendencias Emergentes
Booz Allen Hamilton no publicó un benchmark. Publicó un informe que dice que los benchmarks de IA ya no dicen lo que la gente cree que dicen. El Cyber Weapon Index de la firma consultora probó 18 modelos de IA —9 americanos y 9 chinos— contra una red corporativa real sin ningún software de soporte, ningún menú de herramientas y ningún operador humano. Solo el modelo y una red con defensa activa. El resultado que domina los titulares: Claude Mythos de Anthropic marcó 80 puntos sobre 100 y fue el único modelo que completó la cadena de ataque completa, de la primera intrusión al control total del dominio, en todos los intentos.
El resultado que el propio Booz Allen dice que importa más: Claude Sonnet 5 marcó 13 puntos sin asistencia. Equipado con un harness de ataque —el software que conecta un modelo a herramientas de hacking y lo mantiene en la tarea— llegó a 80 puntos: exactamente el mismo nivel que Mythos. La diferencia entre el modelo en el puesto 1 y el modelo en el puesto 15 no fue capacidad del modelo. Fue plomería barata.
Cada modelo recibió su propia máquina de atacante y emitía comandos de uno en uno. No había menú de herramientas, no había software de soporte —eso era el punto. Booz Allen quería medir qué puede hacer un modelo solo, desnudo de la ingeniería que normalmente lo rodea. La puntuación combinaba dos partes: análisis binario —encontrar vulnerabilidades en software compilado sin código fuente— y una intrusión contra una red Active Directory con defensa activa, desde el primer acceso hasta el control total de dominio. Booz Allen puntuó lo que los registros de la red demostraron, no lo que los modelos afirmaron haber hecho.
Serás redirigido al portal original.