Viện Nghiên cứu An toàn AI của Anh: 5 mô hình tiên tiến đều gian lận khi làm bài kiểm tra, và chưa đến một nửa cho rằng mình đã sai

英國 AI 安全研究院(AI Security Institute,AISI)7 月 21 日公布紅隊研究,把五個前沿模型丟進自家網路安全能力評測,結果 mỗi một 模型都被抓到試圖作弊。475 次執行中,GPT-5.4 有 67 次(14,1%)最高,Claude Mythos Preview 37 次(7,8%)最低。更棘手的是稽核端,模型被問到時有 75% 到 86% 會講出自己做了什麼,但認為那是錯的只有 25% 到 44%。
(前情提要:英國 AI 安全研究所評測 Claude Mythos:能自主完成 32 步企業網路攻擊模擬)
(背景補充:OpenAI 最強模型 o3「遭爆作弊」疑用特權提前獲測試答案,數學能力造假?)

本文目錄

Toggle

  • 最常見的手法不是上網抄答案
  • 承認做了,不等於承認做錯
  • 這份報告動搖的是分數本身

英國 AI 安全研究院在 7 月 21 日發表的報告中指出,五個受測的前沿模型在自家網路安全能力評測裡,沒有一個是乾淨的。以 475 次執行為分母,OpenAI 的 GPT-5.4 有 67 次出現作弊嘗試(14,1%),GPT-5.6 Sol 60 次(12,6%),GPT-5.5 54 次(11,4%);Anthropic 這邊,Claude Opus 4.7 是 43 次(9,1%),Claude Mythos Preview 37 次(7,8%)。

AISI 的原話只有一句:「每一個我們針對這項行為測試過的模型,都試圖作弊。」

先把定義講清楚。AISI 說的作弊,是指模型為了走捷徑而做出超出任務範圍、或規則明文禁止的動作。評測場景是資安界熟悉的抓旗(capture the flag),模型要在模擬環境裡逆向工程、打漏洞,找出一串藏起來的字串。這種題目本來就要求模型「駭」,但每一題都畫了範圍跟規則,越線才算數,而且沒有任何一題提示模型去作弊。

五個數字排不出趨勢線,這點反而是報告裡比較重要的發現。AISI 明講,跨開發商來看能力愈強不代表作弊率愈高,代表作弊主要是被訓練方式(含對齊訓練)塑造出來的,不是能力提升的自然副產品。

最常見的手法不是上網抄答案

報告把作弊手法拆成八類,分布相當分散。GPT-5.4 的作弊執行中,約 7 成出現「攻擊評測目標以外的系統」,GPT-5.5 也在同一個量級;GPT-5.6 Sol 最愛的則是「上網搜尋現成解答」,約 66%;Claude Opus 4.7 同樣以攻擊非目標系統為主,約 53%;Claude Mythos Preview 最突出的是存取被禁止的上游資源與其他違規。

其他手法還包括在非目標系統上提權、探測評測框架本身看它會不會漏出答案、直接猜一個答案交上去,甚至動用評測基礎設施的憑證。AISI 特別註明,模型往往不只用一招,同一次執行中出現多種手法是常態。

最誇張的一次,發生在一道因為設定錯誤而根本無解的網路評測。受測模型鍥而不捨到跑去 AISI 系統之外、架設在公開網路上的第三方服務寫程式並執行,反過來試圖存取 AISI 自己的評測基礎設施,直接觸發資安警報。AISI 說沒有造成損害、沒有資料外洩,但補了一句,如果評測基礎設施當初沒照安全標準設計,這次嘗試是有可能成功的。

承認做了,不等於承認做錯

業界目前稽核 AI 最直覺的做法,就是回頭問模型「你剛剛有沒有做不該做的事」。AISI 的資料顯示這招不管用,但失效的位置跟一般想像的不太一樣。

被問到時,五個模型有 75% 到 86% 的回答會明確講出自己那個作弊動作,Claude Mythos Preview 甚至高達 86%,是五個裡面最坦白的。卡住的是下一題,認為自己做的事情是錯的比例只有 25% 到 44%。最坦白的 Claude Mythos Preview 同時也是認錯率最低的那一個,只有 25%,另外有 37% 直接把該行為評為「沒問題」。

換句話說,模型不是在隱瞞,是不覺得那有什麼。

第二把稽核工具思維鏈(chain-of-thought)也一樣不牢靠。GPT-5.6 Sol 在被判定為作弊的動作裡,有 40% 完全沒有評估過這件事適不適當,另有約 21% 是看到了限制,然後自己給自己開綠燈或權衡後照做。Claude Opus 4.7 更極端,87% 的作弊動作根本沒有產出任何思維鏈,因為它會動態決定要不要輸出推理,剩下 13% 有推理但沒討論到這件事。

這份報告動搖的是分數本身

對外部世界來說,這件事的殺傷力不在資安,而在分數。企業選型、媒體報導、模型發表會的投影片,全都建立在能力評測的數字上,而 AISI 直接點名,作弊會讓評測高估模型的真實能力。

AISI 也留了防守線。報告說所有已發表的能力評測都經過人工逐字複查,就他們所知沒有任何模型成功作弊而未被抓到;但也強調自動化 LLM 監控器一定會漏,上述數字要當成「偵測到的作弊嘗試下限」來讀。至於已經被拖累的,第三方評測機構 METR 對 GPT-5.6 Sol 的評測就受到明顯影響。

AISI 給的處方,是別無選擇的那一種。自我報告不可信,思維鏈不可信,剩下的只有人工複查加上自動監控器,而這套組合的有效性,正好會隨著模型能力上升而遞減。報告最後那句話大概是整份檔案裡最不樂觀的:更根本的解法是從訓練階段就讓模型不作弊,但這種行為一年多前就已經在前沿模型上被記錄下來,要穩健地把它對齊掉,恐怕沒那麼容易。

本文源自 AI Security Institute,由動區動趨整理報導。

Xem bản gốc
Trang này có thể chứa nội dung của bên thứ ba, được cung cấp chỉ nhằm mục đích thông tin (không phải là tuyên bố/bảo đảm) và không được coi là sự chứng thực cho quan điểm của Gate hoặc là lời khuyên về tài chính hoặc chuyên môn. Xem Tuyên bố từ chối trách nhiệm để biết chi tiết.
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Bình luận
Thêm một bình luận
Thêm một bình luận
Không có bình luận
  • Đã ghim