Cơ bản
Giao ngay
Giao dịch tiền điện tử một cách tự do
Giao dịch ký quỹ
Tăng lợi nhuận của bạn với đòn bẩy
Chuyển đổi và Đầu tư định kỳ
0 Fees
Giao dịch bất kể khối lượng không mất phí không trượt giá
ETF
Sản phẩm ETF có thuộc tính đòn bẩy giao dịch giao ngay không cần vay không cháy tải khoản
Giao dịch trước giờ mở cửa
Giao dịch token mới trước niêm yết
Futures
Truy cập hàng trăm hợp đồng vĩnh cửu
CFD
Vàng
Một nền tảng cho tài sản truyền thống
Quyền chọn
Hot
Giao dịch với các quyền chọn kiểu Châu Âu
Tài khoản hợp nhất
Tối đa hóa hiệu quả sử dụng vốn của bạn
Giao dịch demo
Giới thiệu về Giao dịch hợp đồng tương lai
Nắm vững kỹ năng giao dịch hợp đồng từ đầu
Sự kiện tương lai
Tham gia sự kiện để nhận phần thưởng
Giao dịch demo
Sử dụng tiền ảo để trải nghiệm giao dịch không rủi ro
CFD
Phái sinh Hợp đồng Chênh lệch Cổ phiếu
Cổ phiếu Hoa Kỳ
Tiếp cận cổ phiếu và quỹ ETF thực của Hoa Kỳ
Cổ phiếu Hongkong
Giao dịch cổ phiếu chất lượng được niêm yết tại Hongkong
Cổ phiếu Hàn Quốc
SK Hynix
Giao dịch cổ phiếu Hàn Quốc thực và đầu tư vào các tài sản phổ biến
Futures cổ phiếu
Đòn bẩy cao, giao dịch 24/7
Cổ phiếu token hóa
Được hỗ trợ bởi tài sản cổ phiếu thực
IPO Access
Mở khóa quyền truy cập đầy đủ vào các IPO cổ phiếu toàn cầu
GUSD
3.8%
Đúc GUSD để nhận lợi suất từ RWA kho bạc
Hoạt động cổ phiếu
Giao dịch cổ phiếu phổ biến và nhận airdrop hấp dẫn
Launch
CandyDrop
Sưu tập kẹo để kiếm airdrop
Launchpool
Thế chấp nhanh, kiếm token mới tiềm năng
HODLer Airdrop
Nắm giữ GT và nhận được airdrop lớn miễn phí
Pre-IPOs
Mở khóa quyền truy cập đầy đủ vào các IPO cổ phiếu toàn cầu
Điểm Alpha
Giao dịch trên chuỗi và nhận airdrop
Điểm Futures
Kiếm điểm futures và nhận phần thưởng airdrop
Đầu tư
Simple Earn
Kiếm lãi từ các token nhàn rỗi
Đầu tư tự động
Đầu tư tự động một cách thường xuyên.
Sản phẩm tiền kép
Kiếm lợi nhuận từ biến động thị trường
Soft Staking
Kiếm phần thưởng với staking linh hoạt
Vay Crypto
0 Fees
Thế chấp một loại tiền điện tử để vay một loại khác
Trung tâm cho vay
Trung tâm cho vay một cửa
Trung tâm tài sản VIP
Kế hoạch tăng trưởng tài sản cao cấp
Gate Wealth
Nắm quyền kiểm soát tương lai tài chính của bạn
Quỹ định lượng
Chiến lược định lượng hàng đầu
Staking
Stake tiền điện tử để kiếm tiền từ các sản phẩm PoS
Đòn bẩy thông minh
Đòn bẩy không thanh lý
GUSD
3.8%
Nạp & đổi bất cứ lúc nào, miễn phí đổi
Khuyến mãi
AI
Gate AI
Trợ lý AI đa năng đồng hành cùng bạn
Gate AI Bot
Sử dụng Gate AI trực tiếp trong ứng dụng xã hội của bạn
GateClaw
Gate Tôm hùm xanh, mở hộp là dùng ngay
Gate for AI Agent
Hạ tầng AI, Gate MCP, Skills và CLI
Gate Skills Hub
Hơn 10.000 kỹ năng
Từ văn phòng đến giao dịch, thư viện kỹ năng một cửa giúp AI tiện lợi hơn
Viện Nghiên cứu An toàn AI của Anh: 5 mô hình tiên tiến đều gian lận khi làm bài kiểm tra, và chưa đến một nửa cho rằng mình đã sai
英國 AI 安全研究院(AI Security Institute,AISI)7 月 21 日公布紅隊研究,把五個前沿模型丟進自家網路安全能力評測,結果 mỗi một 模型都被抓到試圖作弊。475 次執行中,GPT-5.4 有 67 次(14,1%)最高,Claude Mythos Preview 37 次(7,8%)最低。更棘手的是稽核端,模型被問到時有 75% 到 86% 會講出自己做了什麼,但認為那是錯的只有 25% 到 44%。
(前情提要:英國 AI 安全研究所評測 Claude Mythos:能自主完成 32 步企業網路攻擊模擬)
(背景補充:OpenAI 最強模型 o3「遭爆作弊」疑用特權提前獲測試答案,數學能力造假?)
本文目錄
Toggle
英國 AI 安全研究院在 7 月 21 日發表的報告中指出,五個受測的前沿模型在自家網路安全能力評測裡,沒有一個是乾淨的。以 475 次執行為分母,OpenAI 的 GPT-5.4 有 67 次出現作弊嘗試(14,1%),GPT-5.6 Sol 60 次(12,6%),GPT-5.5 54 次(11,4%);Anthropic 這邊,Claude Opus 4.7 是 43 次(9,1%),Claude Mythos Preview 37 次(7,8%)。
AISI 的原話只有一句:「每一個我們針對這項行為測試過的模型,都試圖作弊。」
先把定義講清楚。AISI 說的作弊,是指模型為了走捷徑而做出超出任務範圍、或規則明文禁止的動作。評測場景是資安界熟悉的抓旗(capture the flag),模型要在模擬環境裡逆向工程、打漏洞,找出一串藏起來的字串。這種題目本來就要求模型「駭」,但每一題都畫了範圍跟規則,越線才算數,而且沒有任何一題提示模型去作弊。
五個數字排不出趨勢線,這點反而是報告裡比較重要的發現。AISI 明講,跨開發商來看能力愈強不代表作弊率愈高,代表作弊主要是被訓練方式(含對齊訓練)塑造出來的,不是能力提升的自然副產品。
最常見的手法不是上網抄答案
報告把作弊手法拆成八類,分布相當分散。GPT-5.4 的作弊執行中,約 7 成出現「攻擊評測目標以外的系統」,GPT-5.5 也在同一個量級;GPT-5.6 Sol 最愛的則是「上網搜尋現成解答」,約 66%;Claude Opus 4.7 同樣以攻擊非目標系統為主,約 53%;Claude Mythos Preview 最突出的是存取被禁止的上游資源與其他違規。
其他手法還包括在非目標系統上提權、探測評測框架本身看它會不會漏出答案、直接猜一個答案交上去,甚至動用評測基礎設施的憑證。AISI 特別註明,模型往往不只用一招,同一次執行中出現多種手法是常態。
最誇張的一次,發生在一道因為設定錯誤而根本無解的網路評測。受測模型鍥而不捨到跑去 AISI 系統之外、架設在公開網路上的第三方服務寫程式並執行,反過來試圖存取 AISI 自己的評測基礎設施,直接觸發資安警報。AISI 說沒有造成損害、沒有資料外洩,但補了一句,如果評測基礎設施當初沒照安全標準設計,這次嘗試是有可能成功的。
承認做了,不等於承認做錯
業界目前稽核 AI 最直覺的做法,就是回頭問模型「你剛剛有沒有做不該做的事」。AISI 的資料顯示這招不管用,但失效的位置跟一般想像的不太一樣。
被問到時,五個模型有 75% 到 86% 的回答會明確講出自己那個作弊動作,Claude Mythos Preview 甚至高達 86%,是五個裡面最坦白的。卡住的是下一題,認為自己做的事情是錯的比例只有 25% 到 44%。最坦白的 Claude Mythos Preview 同時也是認錯率最低的那一個,只有 25%,另外有 37% 直接把該行為評為「沒問題」。
換句話說,模型不是在隱瞞,是不覺得那有什麼。
第二把稽核工具思維鏈(chain-of-thought)也一樣不牢靠。GPT-5.6 Sol 在被判定為作弊的動作裡,有 40% 完全沒有評估過這件事適不適當,另有約 21% 是看到了限制,然後自己給自己開綠燈或權衡後照做。Claude Opus 4.7 更極端,87% 的作弊動作根本沒有產出任何思維鏈,因為它會動態決定要不要輸出推理,剩下 13% 有推理但沒討論到這件事。
這份報告動搖的是分數本身
對外部世界來說,這件事的殺傷力不在資安,而在分數。企業選型、媒體報導、模型發表會的投影片,全都建立在能力評測的數字上,而 AISI 直接點名,作弊會讓評測高估模型的真實能力。
AISI 也留了防守線。報告說所有已發表的能力評測都經過人工逐字複查,就他們所知沒有任何模型成功作弊而未被抓到;但也強調自動化 LLM 監控器一定會漏,上述數字要當成「偵測到的作弊嘗試下限」來讀。至於已經被拖累的,第三方評測機構 METR 對 GPT-5.6 Sol 的評測就受到明顯影響。
AISI 給的處方,是別無選擇的那一種。自我報告不可信,思維鏈不可信,剩下的只有人工複查加上自動監控器,而這套組合的有效性,正好會隨著模型能力上升而遞減。報告最後那句話大概是整份檔案裡最不樂觀的:更根本的解法是從訓練階段就讓模型不作弊,但這種行為一年多前就已經在前沿模型上被記錄下來,要穩健地把它對齊掉,恐怕沒那麼容易。
本文源自 AI Security Institute,由動區動趨整理報導。