Anthropic 最新论文撬开大模型黑箱:隐藏动机发现率提升 4 倍以上
中文摘要
Anthropic发布NLA,使隐藏动机发现率提升4倍以上
English Summary
Anthropic's Natural Language Autoencoders (NLA) translate high-dimensional activations into readable text, increasing hidden motive discovery by over 4x to improve Claude's pre-deployment alignment auditing.
Original Excerpt
📌 一句话摘要 Anthropic 发布自然语言自动编码器 NLA,将模型内部高维激活值翻译为可读文本,使隐藏动机发现率提升 4 倍以上,已用于 Claude 预部署对齐审计。 📝 详细摘要 Anthropic 最新论文提出自然语言自动编码器 NLA,旨在撬开大模型黑箱。NLA 通过激活值言语化器 AV 将模型内部高维激活值翻译为自然语言解释,再由激活值重建器 AR 从解释反向重建原始激活值,形成闭环验证。训练分为监督...