研究界也有一則提醒「不要被高分迷惑」的訊號。近期對一個主打模擬人類認知行為的模型提出質疑:模型在大量心理學任務上表現亮眼,但後續測試透過改寫提示語,觀察模型是否真正依指令理解題意;結果顯示,它可能更像是在記憶資料集的答案模式,而不是理解問題本身。
這類結果的重要性在於,它觸及目前許多評測的共同盲點:當任務格式固定、資料分布相近時,模型可以用統計線索取得高分,卻不代表具備可遷移的推理能力。對產業而言,這也提醒導入 AI 時不能只看單一 benchmark,而要設計包含提示變形、領域轉移、反例與對抗式測試的驗證流程,才能更接近真實部署環境。