← AI 動態 The Decoder

Mistral推輕量開源安全模型,動態審查媲美巨型AI

法國Mistral推出30億參數開源安全模型Shieldstral。它捨棄固定分類,讓開發者透過「是非題」動態審查AI內容,體積小巧但效能媲美大七倍巨型模型。

Mistral AI安全 多模態模型
Mistral推輕量開源安全模型,動態審查媲美巨型AI

法國AI新創Mistral發表了名為Shieldstral的開源安全模型(Guardrail model)。這款模型僅有30億(3B)參數,但在標準文本安全測試中的表現,卻能與體積大上好幾倍的大型模型並駕齊驅,甚至在「文本與影像」的聯合多模態分類測試中創下歷史新高分。

Shieldstral最大的亮點在於其極具彈性的動態審查機制。傳統的安全防護模型多半採用固定的危險類別(如暴力、色情等)來過濾內容;而Shieldstral則允許營運者在系統運行時,直接使用自然語言設定「是非題」(例如:這段對話是否洩露了個人隱私?)來做為審查的判斷標準,無須重新訓練模型。

這項技術突破對企業與開發者意義重大。它不僅大幅降低了部署AI安全機制的硬體算力成本,更賦予了極高的客製化空間,讓各行各業都能用極低的門檻,針對自身業務需求建立精準且即時的AI內容防護網。