除了政策與安全,模型可靠性也有新進展。研究人員指出,部分推理型模型在強化學習訓練下容易變得更「自信」,即使在證據不足時仍以很高把握給出答案;問題不在於模型一定更常錯,而是錯時的自信會誤導使用者。為處理這個缺口,研究提出在強化學習獎勵中加入校準項,讓模型的自我信心分數更貼近實際正確率,並在多個任務上展示能在不犧牲準確度下顯著降低校準誤差。
這對香港常見的應用場景(客服、法務輔助、投資研究摘要、醫療文件初篩)尤其重要:企業需要的往往不是「永遠回答」,而是能在低把握時主動提示風險、要求更多上下文、或把案件交回人手。若供應商開始把「不確定性」以可機器讀取的方式輸出(例如置信區間、校準後分數、拒答/升級策略),將有助於把 AI 系統納入更可審計的風控流程,也更符合香港對合規與營運穩定性的期待。