罗盘 / 权重安全
暗星档案 · 未点亮的星

模型权重与算法机密安全

本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

模型权重与算法机密安全T5 量级 · 新星
让前沿 AI 模型权重扛得住国家级攻击者的窃取——AI 风险链条中最脆、也最被低估的一环。
暗星编号DS-0315
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

前沿模型的权重文件是几十亿美元训练投入的最终结晶,也是所有部署侧安全措施的前提:权重一旦被窃取,安全护栏、使用政策、API 监控全部瞬间归零,窃取者可以在无任何约束下运行和微调模型。RAND 的安全等级框架把抵御能力分为 SL1-SL5,其中 SL5 对应抵御最顶级国家行为体的持续攻击——而目前没有任何一家前沿实验室被认为达到了这个等级。这不是普通的企业信息安全问题,而是文明级的单点故障:越接近变革性 AI,这份文件的战略价值越接近核材料。攻破它意味着为整个 AI 转型期建立一道真正可信的物理与数字防线。

卡在哪 · 机制级卡点

顶级国家行为体拥有供应链植入、内部人策反、零日漏洞囤积等常规企业安全根本无法防御的手段,而权重又必须在训练、推理、研究中被数千张 GPU 和大量员工高频访问——「既要极端保密又要大规模使用」在现有安全架构下近乎矛盾。达到 RAND SL5 级需要机密计算硬件、物理隔离数据中心、内部威胁防御的全栈重建,公认与现状之间有数年差距,且没有任何单一技术能补齐。

谁在攻

RAND(Securing AI Model Weights 安全等级框架)、Anthropic / OpenAI / Google DeepMind 各自的安全团队

怎么参与

读安全工程与机密计算方向(TEE、供应链安全、内部威胁检测),RAND 的权重安全报告是最好的问题地图。进前沿实验室的 security 团队、或做机密计算的硬件/云厂商安全部门;从一个具体子问题切入:如何在数千 GPU 高频访问权重的前提下做到不可导出(weight exfiltration 防御)。

谁在攻这颗暗星 · 攻关者名录5 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

INDUSTRY业界 · 创业与工程2
杰森·克林顿Jason Clinton首席信息安全官(CISO)
Anthropic
公开表示将近一半精力投入保护 Anthropic 的模型权重,是前沿实验室内部把权重防窃取当作头号威胁在攻的代表人物。
马特·奈特Matt Knight安全负责人 / CISO(2020–2025)
OpenAI
OpenAI 首位专职安全招聘,用五年多搭建其安全、隐私与权重防护体系,是实验室侧防止权重外泄工程实践的主要负责人。
THIRD PARTY第三方 · 政策/资助/倡导3
塞拉·内沃Sella Nevo梅塞尔森中心(Meselson Center)主任 / 报告一作
RAND
RAND《Securing AI Model Weights》报告的领衔作者,提出 SL1–SL5 安全等级框架,把权重安全定义为文明级单点故障。
丹·拉哈夫Dan Lahav报告合著者
RAND
《Securing AI Model Weights》核心合著者之一,参与构建对抗国家级攻击者的权重安全等级体系与威胁建模。
杰夫·阿尔斯托特Jeff Alstott报告合著者 / 安全研究员
RAND
《Securing AI Model Weights》合著者,研究达到 SL5(抵御顶级国家行为体)所需的全栈安全重建路径。

去哪家 · 机构与公司名录5 家 · 其中初创/成长期 4

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

Corvex初创
早期(Secure Model Weights 2026-03 early availability) · 美国
用 NVIDIA 机密计算指令做硬件强制的权重加密隔离,让模型能安全跑在第三方基础设施上
↗ 直击「权重必须被数千张 GPU 高频访问、又要极端保密」的核心矛盾——让实验室能在不信任的云上推理而权重仍加密隔离,是把 TEE 从概念推向权重保护产品的新玩家
Phala Network初创
2018 创 · 已发币/成长期 · 分布式
做机密 LLM——用 GPU TEE(Intel TDX/NVIDIA 机密计算)在推理时保护模型权重与用户数据
↗ 把机密计算与去中心化基础设施结合做「可验证的机密 AI 推理」,为权重安全提供不依赖单一云厂商信任的替代路径
Pattern Labs初创
AI 安全评估公司 · 美国
AI 网络安全评估,与 Anthropic 合作研究机密推理系统的设计原则与安全风险
↗ 2025-06 与 Anthropic 联合发布机密推理系统白皮书——是把「前沿实验室怎么在推理期真正守住权重」讲成可落地工程规范的少数专业方
VoltageGPU初创
2025 创 · 早期
提供 TEE 机密推理(12 个 OpenAI 兼容模型),提示与响应在 Intel TDX enclave 内加密,运营方也读不到
↗ 创始人 Julien Aubry;代表一批 2025 新生的「机密推理即服务」初创,把权重与数据保护做成开箱即用的 API——是这条链条上最年轻的一批玩家
RAND Corporation非营利
1948 创 · 非营利研究机构 · 美国加州圣莫尼卡
提出前沿模型权重安全的 SL1–SL5 等级框架(Securing AI Model Weights),定义抵御国家级攻击者的标准
↗ SL5(抵御顶级国家行为体持续攻击)是当前公认没有任何前沿实验室达到的标尺——RAND 把「权重安全」从模糊的企业信息安全变成可分级、可审计的文明级单点故障问题

来源 · 可查证