罗盘 / 提示注入攻击防御
暗星档案 · 未点亮的星

提示注入攻击防御

本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

提示注入攻击防御T6 量级 · 行星
让AI分得清哪些是指令、哪些只是它读到的数据
暗星编号DS-1085
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

提示注入连续位居OWASP大语言模型十大风险榜首,OpenAI、Anthropic、Google DeepMind在2025年的公开研究中已承认这在现有LLM架构下无法被彻底解决——模型对上下文窗口里的每个token一视同仁,没有区分"指令"与"数据"的特权通道。2025年底针对企业AI的注入攻击同比激增约340%,间接注入(藏在邮件/网页/文档里的指令)已占攻击的过半。攻破意味着AI Agent能安全地读取、处理不可信的外部内容而不被劫持执行未授权操作,这是AI大规模自主执行任务的前提安全能力。

卡在哪 · 机制级卡点

根源是当前Transformer架构没有把"指令通道"和"数据通道"结构性分离,属于架构级而非补丁级问题;2026年的主流应对策略已从"彻底预防"转向"遏制损害"(最小权限、内容溯源、外部确定性策略引擎如CaMeL/FIDES),尚无公认能收敛问题的架构方案。

谁在攻

Anthropic/OpenAI/Google DeepMind AI安全团队(2025年公开研究);CaMeL/FIDES架构研究团队

怎么参与

从AI安全对齐、Agent架构设计或红队测试方向进入相关实验室