希伯来语能否绕过大模型安全机制?karminski 实测 Fable-5.1 与 DeepSeek-V4.1-Flash
中文摘要
karminski实测Fable-5.1和DeepSeek-V4.1-Flash,驳斥希伯来语绕过AI安全传闻。三种语言有害内容拒绝率无显著差异。
English Summary
karminski tested models on claims Hebrew bypasses AI safety. No significant difference in harmful content refusal rates was found across English, Chinese, and Hebrew, refuting the rumors.
Original Excerpt
针对网传希伯来语申诉可解封账号并可能绕过模型安全层的说法,karminski 用 HuggingFace 公开语料构建三语测试,实测 Fable-5.1 有害内容拒绝率为英语 95.0%、中文 94.4%、希伯来语 95.1%,DeepSeek-V4.1-Flash 达 99.3%-100%,三种语言拒绝率无显著差异。