Jev 零样本检测对齐失效,AUROC 0.886
X:Elvis Saravia (@omarsar0, DAIR.AI)AIHOT 评分 44/100
摘要
TypeSafe AI 的校准决策模型 Jev 只需一个通用 yes/no 问题,用其概率作为评分,无需额外训练即可区分模型失效与正常回复,中位 AUROC 达 0.886。
原始标题
Cool paper on catching alignment failures with Jev. The ideas is to ask Jev one generic yes/no ques…