OpenAI 报告自我复制提示词注入
中文摘要
OpenAI报告了一种自我复制的提示词注入攻击,恶意指令可隐藏在内容中,诱导AI执行并将其复制到回复中,从而在不同AI交互间传播。
English Summary
OpenAI reports self-replicating prompt injections where malicious instructions hidden in content trick AI into executing and copying them into replies, spreading across different AI interactions.
Original Excerpt
OpenAI 官方失准报告网站上的新事件报告。 自我复制的提示词注入,能够有效地从一个 AI 交互传播到另一个 AI 交互。 恶意指令可以隐藏在 AI 读取的内容中,比如一封邮件,诱使 AI 去执行它,而不是只完成用户的任务。 巧妙之处在于,该指令还告诉 AI 把同一条恶意指令复制到它的回复中,从而可能暴露给下一个读取它的 AI。