Problem

現有內容審查系統面臨多模態資料處理的挑戰,且不同安全任務的分類架構相互衝突,難以在單一框架下統一訓練。此外,現有高效能安全模型體積過於龐大,導致部署與運算成本過高。

Method

研究團隊將內容審查重新定義為簡單的「二進位問答任務」,將各種審查規範轉化為單一的「是/否」問題。此架構允許將約 5,410 萬筆具備不同分類標準的異質安全資料集進行整合訓練,並引入細粒度評估集以強化策略調適性。

Results

Shieldstral 以僅 3B 的參數規模,在文字安全基準測試中達到甚至超越體積大其七倍的模型效能。同時,該模型在多模態安全分類任務中創下了新的技術標竿(State of the art),展現出極強的分類準確度。

Significance

這項研究證明了透過精巧的任務格式化與大規模高品質資料,小型模型也能具備卓越的跨模態防護能力。這為開發高效率、可靈活調整安全策略的內容審查系統提供了可行的技術路徑。