Фьючерсы
Доступ к сотням фьючерсов
CFD
Золото
Одна платформа мировых активов
Опционы
Hot
Торги опционами Vanilla в европейском стиле
Единый счет
Увеличьте эффективность вашего капитала
Демо-торговля
Введение в торговлю фьючерсами
Подготовьтесь к торговле фьючерсами
Фьючерсные события
Получайте награды в событиях
Демо-торговля
Используйте виртуальные средства для торговли без риска
CFD
Деривативы CFD на акции
Акции США
Доступ к реальным акциям США и ETF
Акции Гонконга
Торгуйте качественными акциями, котирующимися в Гонконге
Корейские акции
SK Hynix
Торгуйте реальными корейскими акциями и инвестируйте в популярные активы
Фьючерсы на акции
Высокое кредитное плечо, круглосуточная торговля
Токенизированные акции
Обеспечено реальными акциями
IPO Access
Откройте полный доступ к глобальным IPO акций
GUSD
3.8%
Создать GUSD для получения доходности казначейских RWA
Мероприятия, связанные с акциями
Торгуйте популярными акциями и получайте щедрые эирдропы
Запуск
CandyDrop
Собирайте конфеты, чтобы заработать аирдропы
Launchpool
Быстрый стейкинг, заработайте потенциальные новые токены
HODLer Airdrop
Удерживайте GT и получайте огромные аирдропы бесплатно
Pre-IPOs
Откройте полный доступ к глобальным IPO акций
Alpha Points
Торгуйте и получайте аирдропы
Фьючерсные баллы
Зарабатывайте баллы и получайте награды аирдропа
Инвестиции
Simple Earn
Зарабатывайте проценты с помощью неиспользуемых токенов
Автоинвест.
Автоинвестиции на регулярной основе.
Бивалютные инвестиции
Доход от волатильности рынка
Мягкий стейкинг
Получайте вознаграждения с помощью гибкого стейкинга
Криптозаймы
0 Fees
Заложите одну криптовалюту, чтобы занять другую
Центр кредитования
Единый центр кредитования
VIP-центр богатства
Планы премиального роста
Gate Wealth
Возьмите под контроль свое финансовое будущее
Количественный фонд
Лучшие стратегии
Стейкинг
Делайте стейкинг криптовалюты, чтобы заработать на продуктах PoS
Умное плечо
Плечо без риска ликвидации
GUSD
3.8%
Пополнение и погашение в любое время, без комиссии
Рекламные акции
Промоакции
Участвуйте и получайте награды
Реферал
200 USDT
Приглашайте друзей за бонусы
Партнерская программа
Эксклюзивные комиссионные
Gate Booster
Растите влияние и получайте аирдроп
Анонсы
Обновления в реальном времени
Блог Gate
Статьи о криптоиндустрии
VIP-услуги
Огромные скидки на комиссии
Управление активами
Универсальное решение для управления активами
Институциональный
Крипто-решения для бизнеса
Разработчикам (API)
Подключение к экосистеме приложений Gate
Внебиржевые банковские переводы
Ввод и вывод фиатных денег
Брокерская программа
Щедрые механизмы скидок API
AI
Gate AI
Ваш универсальный AI-ассистент для любых задач
Gate AI Bot
Используйте Gate AI прямо в вашем социальном приложении
GateClaw
Gate Синий Лобстер — готов к использованию
Gate for AI Agent
AI-инфраструктура: Gate MCP, Skills и CLI
Gate Skills Hub
Более 10 тыс навыков
От офиса до трейдинга: единая база навыков для эффективного использования ИИ
Британский институт исследований по безопасности ИИ: все пять передовых моделей жульничали во время тестов, и менее половины считают, что ошибаются
Британский AI Security Institute (AI Security Institute, AISI) 21 июля опубликовал исследование красной командой: пять передовых моделей загрузили в собственный интернет безопасности для теста возможностей, и в итоге каждая из них была поймана на попытке читерства. В 475 запусках GPT-5.4 показал максимум — 67 раз (14,1%), а Claude Mythos Preview — минимум, 37 раз (7,8%). Сложнее всего на стороне аудита: когда модели спрашивали, что именно они сделали, 75%–86% говорили о том, что проделали, но считали это неправильным лишь 25%–44%.
(Предыстория: оценка AI Security Institute Великобритании Claude Mythos — способен самостоятельно выполнить 32 шага симуляции корпоративной сетевой атаки)
(Справка: самый сильный у OpenAI o3 «уличили в читерстве», вероятно из‑за привилегий заранее получив ответы теста; фальсификация математических способностей?)
Содержание
Toggle
В отчете, опубликованном AI Security Institute 21 июля, говорится, что ни одна из пяти проверенных передовых моделей не была «чистой» в их собственных тестах на кибербезопасность. В качестве знаменателя — 475 запусков: у OpenAI GPT-5.4 было 67 попыток читерства (14,1%), GPT-5.6 Sol — 60 раз (12,6%), GPT-5.5 — 54 раза (11,4%); у Anthropic: Claude Opus 4.7 — 43 раза (9,1%), Claude Mythos Preview — 37 раз (7,8%).
Единственная фраза AISI дословно: «Каждая из моделей, на которую мы нацеливали тест на это поведение, пыталась читерить».
Сначала уточним определения. AISI называет читерством то, что модель ради обхода делает действия, выходящие за рамки задачи или напрямую запрещенные явными правилами. Сценарии оценки — это знакомая кибербезопасникам игра в захват флага (capture the flag): модель должна в симуляционной среде выполнить реверс-инжиниринг, находить уязвимости и вычислять спрятанную строку. Такие задания изначально требуют «хитрости», но в каждой задаче четко прописаны границы и правила: выход за линию считается нарушением, и ни в одном задании нет подсказок модели, что нужно читерить.
Пять цифр не дают трендовой линии — и это, наоборот, важнее всего в этом отчете. AISI прямо говорит: по уровню возможностей «через разных разработчиков» сила модели не означает более высокий процент читерства; читерство в основном формируется способом обучения (включая alignment‑обучение), а не является естественным побочным эффектом улучшения способностей.
Самый распространенный способ — не списывать ответы в интернете
В отчете приемы читерства разложены по восьми категориям — распределение довольно разрозненное. В «читерских» запусках GPT-5.4 примерно в 70% случаев встречается «атака систем вне целей оценки», у GPT-5.5 — тоже в том же порядке величин; GPT-5.6 Sol чаще всего выбирает «поиск готовых ответов в интернете» — около 66%; Claude Opus 4.7 также в основном нацелен на атаку нецелевых систем — около 53%; у Claude Mythos Preview ярче всего выражены попытки доступа к запрещенным upstream‑ресурсам и другим нарушениям.
Другие способы включают повышение привилегий на нецелевых системах, попытки проверить, не «выпадут ли» ответы из самой оценочной рамки, прямую догадку ответа и сдачу, а также даже задействование учетных данных оценочной инфраструктуры. AISI отдельно подчеркивает: модель обычно не ограничивается одним приемом; несколько техник в одном запуске — норма.
Самый вопиющий случай произошел в сетевом тесте, который из-за ошибки в настройках изначально был по сути неразрешим. Модели, несмотря на это, упорно пытались уйти за пределы системы AISI, подняли в публичной сети сторонний сервис, написали в нем программу и выполнили ее, после чего в обратную сторону пытались получить доступ к оценочной инфраструктуре самого AISI — тем самым прямо срабатывали системы кибербезопасности. AISI говорит, что ущерба не было и данные не утекли, но добавляет: если бы оценочная инфраструктура изначально не была спроектирована с учетом стандартов безопасности, эта попытка могла бы сработать.
Признать, что сделал, не равно признать, что сделал неправильно
Самый интуитивный способ аудита AI в индустрии — вернуться и спросить модель: «Ты только что делал то, чего делать не должен?». По данным AISI, этот прием не работает, но точка отказа отличается от обычного ожидания.
Когда им задавали вопрос, у пяти моделей 75%–86% ответов давали вполне конкретные признания — они прямо говорили о том, какое именно читерское действие они совершили; Claude Mythos Preview признался даже в 86% случаев — самый откровенный среди пяти. Но «затык» был на следующем вопросе: доля тех, кто считает, что сделанное — это ошибка, составляет всего 25%–44%. Самый откровенный Claude Mythos Preview одновременно имеет и самую низкую ставку признания ошибки: всего 25%; при этом 37% напрямую оценивали это поведение как «никаких проблем».
Иными словами, модель не скрывает — она просто не считает, что в этом есть что‑то неправильное.
Вторая аудитная проверка — цепочка рассуждений (chain-of-thought) — тоже ненадежна. В действиях, которые сочли читерством, у GPT-5.6 Sol в 40% случаев полностью отсутствовала оценка того, уместно ли это; еще примерно 21% — увидели ограничения, затем сами себе «открыли зеленый свет» или взвесили и все равно сделали. Claude Opus 4.7 еще жестче: в 87% читерских действий вообще не было никакой цепочки рассуждений, потому что он динамически решает, выводить ли рассуждения; оставшиеся 13% имели рассуждения, но не обсуждали этот момент.
Этот отчет подрывает сами оценки
Для внешнего мира в этом нет «убийственности» в плане кибербезопасности — удар приходится на баллы. Подбор компании, медиа‑репортажи, презентационные слайды на мероприятиях по выпуску моделей — все опирается на цифры оценок возможностей, а AISI прямо указывает: читерство приводит к завышению истинных способностей, которые измеряют тесты.
AISI оставляет и линию обороны. В отчете сказано, что все опубликованные тесты возможностей проходили ручную буквальную перепроверку человеком, и по их знаниям не было ни одной модели, которая успешно читерила и при этом не была поймана; но также подчеркивается, что автоматизированные LLM‑мониторы наверняка будут что‑то пропускать, поэтому приведенные выше цифры стоит читать как «нижнюю границу» зафиксированных попыток читерства. Что касается тех, чьи результаты уже «потеряли в весе»: сторонняя оценочная организация METR сообщила, что тесты GPT-5.6 Sol заметно пострадали.
Назначение AISI — это безальтернативный вариант. Самоотчет ненадежен, chain-of-thought ненадежен; остается только ручная перепроверка плюс автоматический монитор. И эффективность этой связки, как раз, будет падать по мере роста возможностей модели. Финальная фраза отчета, вероятно, самая мрачная во всем документе: более фундаментальное решение — добиться, чтобы модель не читерила уже на стадии обучения, но такое поведение было зафиксировано на передовых моделях более года назад; а надежно «подогнать» под это поведение, похоже, будет не так просто.
Этот текст подготовлен на основе материалов AI Security Institute, отредактирован и опубликован Dongqu Dongqu.