模型發布

Mistral 發布 Shieldstral:以問答框架重構內容審核的 3B 多模態安全分類器

Mistral 於 8 月 4 日發布 Shieldstral,一個採用 Apache 2.0 授權的 3B 開源權重多模態安全分類器,將內容審核重塑為「政策自適應的問答任務」,在文字安全上匹敵體積最多七倍的模型,並於多模態審核上刷新 SOTA,且可在單張 16GB GPU 上運行。

Mistral 於 2026 年 8 月 4 日發布 Shieldstral,一個 3B 參數、開源權重(Apache 2.0)的多模態安全分類器。它的核心主張是:內容審核不應被固定的一組危害類別綁死,而應被重塑為「政策自適應的二元問答任務」——在推論時以自然語言寫下政策問題,模型即回傳一個校準後的安全分數,無需針對新場景重新訓練。

什麼發生了:把「審核」變成「回答政策問題」

傳統的護欄(guardrail)模型會把一組固定的危害分類學(taxonomy)烘焙進權重之中,因此要重新套用到新的部署場景(例如從資安研究工具轉到心理健康平台)往往需要重新訓練。Shieldstral 換了一條路:

  • 每次請求由三部分組成:待判斷的內容(提示詞、回應、提示—回應配對,或可含文字的圖片)與政策問題
  • 推論時模型只讀出 yesno 兩個 logits,並以 softmax 正規化為連續的安全分數
  • 同一份權重能在部署期間直接適應全新政策,因為政策完全活在提示詞裡,不必重訓。

這個單一表述同時統一了提示詞分類、回應審核、拒答偵測(refusal detection)與毒性偵測(toxicity detection),並以同一介面處理文字與圖像。

為什麼重要:政策可適應性是關鍵

Mistral 強調,同一內容在不同產品、不同受眾下可能有截然不同的判斷——對資安研究工具無害的內容,在心理健康平台上可能有害。Shieldstral 讓政策的定義與模型本體分離,企業可依自身合規需求即時「注入」政策,而非遷就模型內建的固定分類。

Mistral 宣稱 Shieldstral 在文字安全上匹敵體積最多七倍的開放護欄模型,並於多模態審核上樹立新的 SOTA;同時只需單張 16GB NVIDIA GPU 即可高效運行,降低了安全層的部署門檻。它是 Mistral 以創始成員身份加入的 Open Secure AI Alliance(與 NVIDIA 等機構合作)的首批成果之一。

對開發者與企業的意涵

  • 合規彈性:企業可依不同市場、不同產品線撰寫自然語言政策,動態調整審核尺度,更符合法規快速變遷的環境。
  • 成本與部署:3B 規模加單卡運行,意味著安全層不再必需大型雲端推理,邊緣或私有化部署更可行。
  • 訓練方法:Mistral 以「對照式」資料建構——讓 LLM 把安全文字改寫成成對的對照樣本,每筆刻意違反某一政策但不違反其相近的姊妹政策,藉此訓練模型推理政策邊界,而非背誦標籤。

對香港的 AI 應用團隊而言,這類「政策與模型分離」的審核架構,能在隱私與法遵(如資料駐留)要求下,提供更靈活、可審計的內容安全層。


本文信息來源:Mistral AI。

返回 AI 資訊