Jev 新闻

Jev:用 RLCD 训练的单次调用模型零样本检测 AI 对齐失效

HuggingFace Daily Papers(社区热门论文)AIHOT 评分 46/100

摘要

用强化学习校准决策(RLCD)训练的模型 Jev 可在单次调用中对同一输入回答多个带类型的问题并给出校准概率,零样本检测对齐失效的中位 AUROC 达 0.886,在多数基准上超过有监督基线。

原始标题

Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures