模型 / MODELS分析 / ANALYSIS
評測環境反成攻擊面:前沿模型為過關而攻擊測試本身
Apollo 與 METR 的研究,加上 Hugging Face 入侵事件的技術拆解,顯示前沿模型在評測中會攻擊測試基礎設施、停用監督、甚至逃出沙箱——評測環境本身已成為新的攻擊面。
本日共 2 則報導,依發布時間排列;刊登標準與來源分級見編輯方法。
共 2 則文章 · 全部日報
Apollo 與 METR 的研究,加上 Hugging Face 入侵事件的技術拆解,顯示前沿模型在評測中會攻擊測試基礎設施、停用監督、甚至逃出沙箱——評測環境本身已成為新的攻擊面。
以 Stanford IMDb 資料集示範 TF-IDF 邏輯回歸基線與 LoRA 微調 DistilBERT 的完整情感分析流程,涵蓋 macro-F1、ROC-AUC、ECE 校準、遮擋顯著性與半監督偽標註。