實驗》AI 沒讓人變聰明,但「承認自己不懂」的人幾乎歸零

法國與義大利學者以 3,132 名受試者做了五個實驗,發現只要 AI 建議在場,人們承認「我不知道」的比例會從 44% 崩到 3%,答對比例從 27% 掉到 9%,對自己答案的信心卻從 30% 竄到 76%。題目被刻意設計成 AI 一定答錯,就算加上答對給錢的誘因,暫緩判斷也只回到 8%。主持研究的 Valerio Capraro 認為,這得靠 AI 素養與教育政策處理。
(前情提要:AI 聊天機器人不只附和:Nature 研究揭「放大螺旋」導致使用者錯誤幻覺)
(背景補充:人類患上AI病「大腦外包」極度惡化!iKala創辦人警告:求方便毀掉原創力)

重點摘要

  • 五個實驗、3,132 名受試者,AI 在場時承認不知道的比例從 44% 崩到 3%
  • 受試者正確率從 27% 掉到 9%,對答案的信心卻從 30% 升到 76%
  • 加入答對給錢的誘因後,暫緩判斷回到 8%、正確率回到 16%,仍遠低於基準線

五個實驗、3,132 名受試者,結論只有一句話。據科技媒體 The Register 報導,法國與義大利的學者發現,只要手邊有 AI 可以問,人們承認「我不知道」的比例會從 44% 崩到 3%,答對比例同時從 27% 掉到 9%,但對自己答案的信心反而從 30% 竄到 76%。

研究由米蘭比可卡大學(University of Milano-Bicocca)副教授 Valerio Capraro、巴黎高等師範學院的 Chiara Marcoccia 與羅馬大學的 Walter Quattrociocchi 共同完成,論文 7 月中旬掛上 arXiv,五個實驗有四個經過預先註冊。

AI 沒有讓人變聰明或變笨,是把人「覺得自己懂了」門檻往下大幅降低。

題目被刻意設計成 AI 一定答錯

研究團隊沒有隨機出題。他們挑的是大型語言模型特別容易翻車的問題,全部圍繞電影裡的視覺細節,例如《我愛貝克漢》球隊制服是什麼顏色。這種題目要看過畫面才答得出來,模型只能靠語料硬猜。

把 AI 建議固定設成錯的,等於把「有沒有用 AI」跟「AI 準不準」兩件事拆開。受試者全程都可以選擇不作答,直接說自己不知道。

結果是,只要 AI 在旁邊,「不作答」的選項幾乎沒人按。不論建議是受試者主動問來的,還是系統直接把答案攤在畫面上,抑制效果都一樣。

用錢誘導也只追回一小截

團隊接著加碼,答對給錢、答錯扣錢。誘因確實有用,受試者變得比較少問 AI,也比較少照抄,暫緩判斷的比例從 3% 回到 8%,正確率從 9% 拉到 16%。

但離基準線還很遠,沒有 AI 的時候,暫緩判斷是 44%、正確率是 27%。換句話說,就算是錢擺在桌上,受試者也只追回不到四分之一的差距。

「對人類而言,說出『我不知道』的能力非常重要,那代表我們認知到自身知識的邊界。」Valerio Capraro 說,「但現在有了 AI,幾乎任何問題都能拿到現成答案,我們因此想知道,這會不會干擾人類說『我不知道』、暫緩判斷的能力。」

Valerio Capraro 真正擔心的是小孩,因為「大人已經學過批判性思考」。他認為這件事得靠 AI 素養與教育政策處理,教育層面的介入比較有機會見效。

對天天用 AI 讀鏈上數據、拆研報的人來說,這篇論文是一面鏡子。我們該擔心的不是模型胡說八道,是自己看完 AI 摘要之後,有沒有質問自己「我真的懂了嗎」。

常見問題

使用 AI 會影響人的批判性思考嗎?

米蘭比可卡大學 Valerio Capraro 團隊的五個實驗(3,132 人)顯示,AI 建議在場時,受試者承認自己不知道的比例從 44% 降到 3%,正確率從 27% 掉到 9%,對答案的信心卻從 30% 升到 76%。

為什麼這份研究要把題目設計成 AI 會答錯?

團隊刻意挑選大型語言模型容易失誤的電影視覺細節題,讓 AI 建議固定是錯的。這樣才能把「有沒有用 AI」跟「AI 準不準」拆開,證明壓抑暫緩判斷的是 AI 在場本身,不是答案品質。

此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 回覆
  • 轉發
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
暫無回覆
  • 已置頂