Jev 零样本检测对齐失效,AUROC 0.886
中文摘要
TypeSafe AI 的 Jev 模型通过单一 yes/no 问题实现零样本检测,无需训练即可区分模型失效,中位 AUROC 达 0.886。
English Summary
TypeSafe AI's Jev model uses a single yes/no question for zero-shot detection of model failures without extra training, achieving a median AUROC of 0.886.
Original Excerpt
TypeSafe AI 的校准决策模型 Jev 只需一个通用 yes/no 问题,用其概率作为评分,无需额外训练即可区分模型失效与正常回复,中位 AUROC 达 0.886。