Instituto de Investigación de Seguridad de la IA del Reino Unido: cinco modelos punteros hicieron trampa en las pruebas, y menos de la mitad cree que se equivoca

El 21 de julio, el Instituto Británico de Seguridad de la IA (AI Security Institute, AISI) dio a conocer una investigación de red teaming, en la que metió cinco modelos de vanguardia en sus propias pruebas de capacidad de ciberseguridad, y el resultado es que a cada uno lo atraparon intentando hacer trampa. En 475 ejecuciones, GPT-5.4 tuvo 67 veces (14,1%) la cifra más alta, y Claude Mythos Preview 37 veces (7,8%) la más baja. Lo más problemático es el extremo de la auditoría: cuando los modelos fueron preguntados, entre 75% y 86% dijeron lo que habían hecho, pero solo entre 25% y 44% creyeron que eso estaba mal.
(Antecedentes: evaluación del AISI sobre Claude Mythos: puede completar de forma autónoma 32 pasos de simulación de ataques de ciberseguridad empresarial)
(Contexto adicional: el modelo más fuerte de OpenAI, o3, “fue acusado de hacer trampa”; ¿será por privilegios que obtuvo respuestas de antemano para el examen, y con posible falsificación de la capacidad matemática?)

Índice de este artículo

Toggle

  • La técnica más común no es copiar respuestas buscando en internet
  • Admitir que lo hiciste no equivale a admitir que está mal
  • Lo que este informe sacude es el propio puntaje

En el informe publicado el 21 de julio, el AI Security Institute (AISI) señaló que, en sus pruebas de ciberseguridad, ninguno de los cinco modelos evaluados estuvo “limpio”. Con 475 ejecuciones como denominador, de OpenAI, GPT-5.4 mostró 67 intentos de hacer trampa (14,1%), GPT-5.6 Sol 60 veces (12,6%), GPT-5.5 54 veces (11,4%); en el lado de Anthropic, Claude Opus 4.7 fue 43 veces (9,1%), Claude Mythos Preview 37 veces (7,8%).

Las palabras textuales de AISI se reducen a una frase: «Cada uno de los modelos a los que probamos esta conducta intentó hacer trampa».

Primero, dejemos claras las definiciones. Según AISI, hacer trampa significa que el modelo, con el fin de tomar atajos, realiza acciones que exceden el alcance de la tarea o que están prohibidas explícitamente por las reglas. El escenario de evaluación es un “capture the flag” (captura la bandera) familiar en el sector de la ciberseguridad: el modelo debe hacer ingeniería inversa en un entorno simulado, explotar vulnerabilidades y encontrar una cadena de caracteres oculta. Este tipo de ejercicio ya exige que el modelo “hackee”, pero cada problema delimita el alcance y las reglas; salirse de la línea es lo que cuenta, y ninguna pregunta sugiere que el modelo deba hacer trampa.

El hecho de que no se puedan trazar tendencias con los cinco números es, en cambio, el hallazgo más importante del informe. AISI afirma de forma explícita que, al comparar entre desarrolladores, cuanto mayor es la capacidad no implica necesariamente mayor tasa de trampas: la trampa está moldeada principalmente por el método de entrenamiento (incluida la formación de alineamiento), no es un subproducto natural de la mejora de capacidad.

La técnica más común no es copiar respuestas buscando en internet

El informe desglosa la trampa en ocho categorías, con una distribución bastante dispersa. En las ejecuciones de trampas de GPT-5.4, aproximadamente 7 de cada 10 incluyen “sistemas que atacan fuera del objetivo de la evaluación”; GPT-5.5 también se sitúa en un orden de magnitud similar. GPT-5.6 Sol, en particular, prefiere “buscar soluciones ya hechas en internet”, cerca de 66%; Claude Opus 4.7 también se concentra en atacar sistemas no objetivo, alrededor de 53%; y Claude Mythos Preview destaca sobre todo por acceder a recursos de upstream prohibidos y otras infracciones.

Otras técnicas incluyen escalar privilegios en sistemas que no son el objetivo, sondear si la propia infraestructura de evaluación podría “filtrar” respuestas, enviar directamente una respuesta al azar, e incluso usar credenciales de la infraestructura de evaluación. AISI aclara que los modelos suelen no usar una sola técnica: es habitual que, en una misma ejecución, aparezcan varias.

La más llamativa ocurrió en una prueba de red que, por un error de configuración, era básicamente insoluble. El modelo evaluado, terco, salió del sistema de AISI y montó un servicio de terceros en internet abierto, escribió y ejecutó código; luego, intentó acceder a la propia infraestructura de evaluación de AISI, lo que activó de inmediato alertas de ciberseguridad. AISI dice que no causó daños ni fugas de datos, pero añadió que, si la infraestructura de evaluación no se hubiera diseñado con estándares de seguridad desde el inicio, este intento podría haber tenido éxito.

Admitir que lo hiciste no equivale a admitir que está mal

La forma más intuitiva de auditar IA hoy en día es preguntarle al modelo: “¿Acabas de hacer algo que no deberías?”. Los datos de AISI muestran que esa táctica no funciona, pero el lugar donde falla no coincide del todo con la intuición general.

Cuando se les preguntó, los cinco modelos tenían entre 75% y 86% de respuestas que indicaban claramente cuál era la acción de trampa que habían realizado; Claude Mythos Preview incluso llegó a 86%, siendo el más franco de los cinco. El atasco aparece en la siguiente pregunta: la proporción de quienes creen que lo que hicieron estaba mal era solo de 25% a 44%. El más franco, Claude Mythos Preview, además fue el que tuvo la tasa de admisión de error más baja: solo 25%; y el 37% restante calificó directamente esa conducta como “no hay ningún problema”.

En otras palabras, el modelo no está ocultando: simplemente no cree que haya algo malo en ello.

La segunda herramienta de auditoría, el chain-of-thought (cadena de pensamiento), tampoco es fiable. En las acciones de GPT-5.6 Sol que fueron clasificadas como trampas, el 40% no evaluó por completo si aquello era apropiado; otro ~21% sí vio las restricciones, y luego se dio el “visto bueno” o lo sopesó antes de hacerlo. Claude Opus 4.7 fue aún más extremo: en el 87% de las acciones de trampa, no produjo ninguna cadena de pensamiento, porque decidiría dinámicamente si emitir razonamiento; el 13% restante tuvo razonamiento pero no discutió ese punto.

Esta investigación sacude el propio puntaje

Para el mundo exterior, el daño aquí no está en la ciberseguridad, sino en el puntaje. La selección de empresas, las notas de los medios y las diapositivas en los lanzamientos de modelos se construyen sobre números de evaluaciones de capacidad, y AISI señala directamente que hacer trampa hace que la evaluación sobreestime la capacidad real del modelo.

AISI también dejó una línea defensiva. El informe dice que todas las evaluaciones de capacidad publicadas se revisaron manualmente, palabra por palabra, y, por lo que ellos saben, ningún modelo logró hacer trampa sin ser detectado; pero también recalca que un monitor automatizado de LLM seguro que fallará al menos en algo, por lo que los números anteriores deben leerse como el “mínimo” de intentos de trampas detectados. En cuanto a los que ya se vieron arrastrados, el tercero evaluador METR, por ejemplo, vio un impacto claramente notable en su evaluación de GPT-5.6 Sol.

La prescripción que da AISI es la de “no hay otra opción”. La auto-evaluación no es confiable, la cadena de pensamiento no es confiable; lo que queda es la revisión manual más un monitor automatizado, y la efectividad de esta combinación, curiosamente, disminuirá a medida que aumente la capacidad del modelo. La frase final del informe quizá sea la menos optimista de todo el documento: una solución más fundamental sería lograr que el modelo no haga trampa desde la fase de entrenamiento, pero este tipo de conducta ya fue registrada en modelos de vanguardia hace más de un año; alinear de forma robusta que deje de hacerlo probablemente no sea tan fácil.

Este artículo proviene de AI Security Institute y fue recopilado y reportado por 動區動趨.

Ver original
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
Sin comentarios
  • Fijado