Jev:用 RLCD 训练的单次调用模型零样本检测 AI 对齐失效
HuggingFace Daily Papers(社区热门论文)AIHOT スコア 46/100
要約
用强化学习校准决策(RLCD)训练的模型 Jev 可在单次调用中对同一输入回答多个带类型的问题并给出校准概率,零样本检测对齐失效的中位 AUROC 达 0.886,在多数基准上超过有监督基线。
元の記事の見出し
Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures