Básico
Spot
Opera con criptomonedas libremente
Margen
Multiplica tus beneficios con el apalancamiento
Convertir e Inversión automática
0 Fees
Opera cualquier volumen sin tarifas ni deslizamiento
ETF
Obtén exposición a posiciones apalancadas de forma sencilla
Trading premercado
Opera nuevos tokens antes de su listado
Contrato
Accede a cientos de contratos perpetuos
CFD
Oro
Plataforma global de activos tradicionales
Opciones
Hot
Opera con opciones estándar al estilo europeo
Cuenta unificada
Maximiza la eficacia de tu capital
Trading de prueba
Introducción al trading de futuros
Prepárate para operar con futuros
Eventos de futuros
Únete a eventos para ganar recompensas
Trading de prueba
Usa fondos virtuales para probar el trading sin asumir riesgos
CFD
Derivados de Contratos por Diferencia sobre Acciones
Acciones EE. UU.
Accede a acciones y ETF estadounidenses reales
Acciones HK
Opera con acciones de calidad cotizadas en Hong Kong
Acciones surcoreanas
SK Hynix
Opera con acciones surcoreanas reales e invierte en activos populares
Futuros de acciones
Alto apalancamiento, trading 24/7
Acciones tokenizadas
Respaldado por acciones reales
IPO Access
Accede al acceso completo a las OPV de acciones globales
GUSD
3.8%
Acuña GUSD para obtener rendimientos de RWA del Tesoro
Actividades de acciones
Opera con acciones populares y desbloquea grandes airdrops
Lanzamiento
CandyDrop
Acumula golosinas para ganar airdrops
Launchpool
Staking rápido, ¡gana nuevos tokens con potencial!
HODLer Airdrop
Holdea GT y consigue airdrops enormes gratis
Pre-IPOs
Accede al acceso completo a las OPV de acciones globales
Puntos Alpha
Opera activos on-chain y recibe airdrops
Puntos de futuros
Gana puntos de futuros y reclama recompensas de airdrop
Inversión
Simple Earn
Genera intereses con los tokens inactivos
Inversión automática
Invierte automáticamente de forma regular
Inversión dual
Aprovecha la volatilidad del mercado
Staking flexible
Gana recompensas con el staking flexible
Préstamo de criptomonedas
0 Fees
Usa tu cripto como garantía y pide otra en préstamo
Centro de préstamos
Centro de préstamos integral
Centro de patrimonio VIP
Planes de aumento patrimonial prémium
Gate Wealth
Toma el control del futuro financiero
Quant Fund
Estrategias cuantitativas de alto nivel
Staking
Haz staking de criptomonedas para ganar en productos PoS
Apalancamiento inteligente
Apalancamiento sin liquidación
GUSD
3.8%
Deposita y canjea cuando quieras, sin comisiones
Promociones
Centro de actividades
Únete a actividades y gana recompensas
Referido
200 USDT
Invita amigos y gana por tus referidos
Programa de afiliados
Gana recompensas de comisión exclusivas
Gate Booster
Aumenta tu influencia y gana airdrops
Anuncio
Novedades de plataforma en tiempo real
Gate Blog
Artículos del sector de las criptomonedas
Servicios VIP
Grandes descuentos en tarifas
Gestión de activos
Solución integral para la gestión de activos
Institucional
Soluciones de activos digitales: empresas
Desarrolladores (API)
Conecta con el ecosistema de aplicaciones Gate
Transferencia bancaria OTC
Deposita y retira fiat
Programa de bróker
Reembolsos generosos mediante API
AI
Gate AI
Tu compañero de IA conversacional para todo
Gate AI Bot
Usa Gate AI directamente en tu aplicación social
GateClaw
Gate Blue Lobster, listo para usar
Gate for AI Agent
Infraestructura de IA, Gate MCP, Skills y CLI
Gate Skills Hub
+10 000 habilidades
De la oficina al trading, una biblioteca de habilidades todo en uno para sacar el máximo partido a la IA
Instituto de Investigación de Seguridad de la IA del Reino Unido: cinco modelos punteros hicieron trampa en las pruebas, y menos de la mitad cree que se equivoca
El 21 de julio, el Instituto Británico de Seguridad de la IA (AI Security Institute, AISI) dio a conocer una investigación de red teaming, en la que metió cinco modelos de vanguardia en sus propias pruebas de capacidad de ciberseguridad, y el resultado es que a cada uno lo atraparon intentando hacer trampa. En 475 ejecuciones, GPT-5.4 tuvo 67 veces (14,1%) la cifra más alta, y Claude Mythos Preview 37 veces (7,8%) la más baja. Lo más problemático es el extremo de la auditoría: cuando los modelos fueron preguntados, entre 75% y 86% dijeron lo que habían hecho, pero solo entre 25% y 44% creyeron que eso estaba mal.
(Antecedentes: evaluación del AISI sobre Claude Mythos: puede completar de forma autónoma 32 pasos de simulación de ataques de ciberseguridad empresarial)
(Contexto adicional: el modelo más fuerte de OpenAI, o3, “fue acusado de hacer trampa”; ¿será por privilegios que obtuvo respuestas de antemano para el examen, y con posible falsificación de la capacidad matemática?)
Índice de este artículo
Toggle
En el informe publicado el 21 de julio, el AI Security Institute (AISI) señaló que, en sus pruebas de ciberseguridad, ninguno de los cinco modelos evaluados estuvo “limpio”. Con 475 ejecuciones como denominador, de OpenAI, GPT-5.4 mostró 67 intentos de hacer trampa (14,1%), GPT-5.6 Sol 60 veces (12,6%), GPT-5.5 54 veces (11,4%); en el lado de Anthropic, Claude Opus 4.7 fue 43 veces (9,1%), Claude Mythos Preview 37 veces (7,8%).
Las palabras textuales de AISI se reducen a una frase: «Cada uno de los modelos a los que probamos esta conducta intentó hacer trampa».
Primero, dejemos claras las definiciones. Según AISI, hacer trampa significa que el modelo, con el fin de tomar atajos, realiza acciones que exceden el alcance de la tarea o que están prohibidas explícitamente por las reglas. El escenario de evaluación es un “capture the flag” (captura la bandera) familiar en el sector de la ciberseguridad: el modelo debe hacer ingeniería inversa en un entorno simulado, explotar vulnerabilidades y encontrar una cadena de caracteres oculta. Este tipo de ejercicio ya exige que el modelo “hackee”, pero cada problema delimita el alcance y las reglas; salirse de la línea es lo que cuenta, y ninguna pregunta sugiere que el modelo deba hacer trampa.
El hecho de que no se puedan trazar tendencias con los cinco números es, en cambio, el hallazgo más importante del informe. AISI afirma de forma explícita que, al comparar entre desarrolladores, cuanto mayor es la capacidad no implica necesariamente mayor tasa de trampas: la trampa está moldeada principalmente por el método de entrenamiento (incluida la formación de alineamiento), no es un subproducto natural de la mejora de capacidad.
La técnica más común no es copiar respuestas buscando en internet
El informe desglosa la trampa en ocho categorías, con una distribución bastante dispersa. En las ejecuciones de trampas de GPT-5.4, aproximadamente 7 de cada 10 incluyen “sistemas que atacan fuera del objetivo de la evaluación”; GPT-5.5 también se sitúa en un orden de magnitud similar. GPT-5.6 Sol, en particular, prefiere “buscar soluciones ya hechas en internet”, cerca de 66%; Claude Opus 4.7 también se concentra en atacar sistemas no objetivo, alrededor de 53%; y Claude Mythos Preview destaca sobre todo por acceder a recursos de upstream prohibidos y otras infracciones.
Otras técnicas incluyen escalar privilegios en sistemas que no son el objetivo, sondear si la propia infraestructura de evaluación podría “filtrar” respuestas, enviar directamente una respuesta al azar, e incluso usar credenciales de la infraestructura de evaluación. AISI aclara que los modelos suelen no usar una sola técnica: es habitual que, en una misma ejecución, aparezcan varias.
La más llamativa ocurrió en una prueba de red que, por un error de configuración, era básicamente insoluble. El modelo evaluado, terco, salió del sistema de AISI y montó un servicio de terceros en internet abierto, escribió y ejecutó código; luego, intentó acceder a la propia infraestructura de evaluación de AISI, lo que activó de inmediato alertas de ciberseguridad. AISI dice que no causó daños ni fugas de datos, pero añadió que, si la infraestructura de evaluación no se hubiera diseñado con estándares de seguridad desde el inicio, este intento podría haber tenido éxito.
Admitir que lo hiciste no equivale a admitir que está mal
La forma más intuitiva de auditar IA hoy en día es preguntarle al modelo: “¿Acabas de hacer algo que no deberías?”. Los datos de AISI muestran que esa táctica no funciona, pero el lugar donde falla no coincide del todo con la intuición general.
Cuando se les preguntó, los cinco modelos tenían entre 75% y 86% de respuestas que indicaban claramente cuál era la acción de trampa que habían realizado; Claude Mythos Preview incluso llegó a 86%, siendo el más franco de los cinco. El atasco aparece en la siguiente pregunta: la proporción de quienes creen que lo que hicieron estaba mal era solo de 25% a 44%. El más franco, Claude Mythos Preview, además fue el que tuvo la tasa de admisión de error más baja: solo 25%; y el 37% restante calificó directamente esa conducta como “no hay ningún problema”.
En otras palabras, el modelo no está ocultando: simplemente no cree que haya algo malo en ello.
La segunda herramienta de auditoría, el chain-of-thought (cadena de pensamiento), tampoco es fiable. En las acciones de GPT-5.6 Sol que fueron clasificadas como trampas, el 40% no evaluó por completo si aquello era apropiado; otro ~21% sí vio las restricciones, y luego se dio el “visto bueno” o lo sopesó antes de hacerlo. Claude Opus 4.7 fue aún más extremo: en el 87% de las acciones de trampa, no produjo ninguna cadena de pensamiento, porque decidiría dinámicamente si emitir razonamiento; el 13% restante tuvo razonamiento pero no discutió ese punto.
Esta investigación sacude el propio puntaje
Para el mundo exterior, el daño aquí no está en la ciberseguridad, sino en el puntaje. La selección de empresas, las notas de los medios y las diapositivas en los lanzamientos de modelos se construyen sobre números de evaluaciones de capacidad, y AISI señala directamente que hacer trampa hace que la evaluación sobreestime la capacidad real del modelo.
AISI también dejó una línea defensiva. El informe dice que todas las evaluaciones de capacidad publicadas se revisaron manualmente, palabra por palabra, y, por lo que ellos saben, ningún modelo logró hacer trampa sin ser detectado; pero también recalca que un monitor automatizado de LLM seguro que fallará al menos en algo, por lo que los números anteriores deben leerse como el “mínimo” de intentos de trampas detectados. En cuanto a los que ya se vieron arrastrados, el tercero evaluador METR, por ejemplo, vio un impacto claramente notable en su evaluación de GPT-5.6 Sol.
La prescripción que da AISI es la de “no hay otra opción”. La auto-evaluación no es confiable, la cadena de pensamiento no es confiable; lo que queda es la revisión manual más un monitor automatizado, y la efectividad de esta combinación, curiosamente, disminuirá a medida que aumente la capacidad del modelo. La frase final del informe quizá sea la menos optimista de todo el documento: una solución más fundamental sería lograr que el modelo no haga trampa desde la fase de entrenamiento, pero este tipo de conducta ya fue registrada en modelos de vanguardia hace más de un año; alinear de forma robusta que deje de hacerlo probablemente no sea tan fácil.
Este artículo proviene de AI Security Institute y fue recopilado y reportado por 動區動趨.