JEV-as-a-Judge:置信时接受,不确定时升级
HuggingFace Daily Papers(社区热门论文)AIHOT 评分 44/100
摘要
JEV-as-a-Judge 用仅做决策的评审模型做低成本初筛,在普通偏好与证据支撑的事实性任务上,与最强对比的 SOTA LLM 评审差距在 3 个百分点以内,费用仅为其 0.36%。当判断需要检查推导过程或抵御精心编写的错误答案时,差距会扩大,且 JEV 与对比模型的差距集中在低置信度决策上。一个冻结的级联流程接受高置信度判定、升级不确定判定,以更低成本保留了对比模型 99% 的准确率。
原始标题
JEV-as-a-Judge: Accept When Confident, Escalate When Unsure