Multiverse Computing:大模型安全对齐需从主题级转向边界级
Multiverse Computing指出,现有基于主题的LLM安全护栏易导致过度拒绝。研究提出“边界感知”方法,通过自蒸馏与数据配对,在政治等特定场景中精准区分有害子集与良性补集,显著降低误拒率并保留安全性。
共 1 篇相关文章
Multiverse Computing指出,现有基于主题的LLM安全护栏易导致过度拒绝。研究提出“边界感知”方法,通过自蒸馏与数据配对,在政治等特定场景中精准区分有害子集与良性补集,显著降低误拒率并保留安全性。