罗盘 / 端侧大模型推理与隐私
暗星档案 · 未点亮的星端侧大模型推理与隐私
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
端侧大模型推理与隐私T5 量级 · 新星
让手机自己跑得动大模型,数据不用传到云端
暗星编号DS-0773
轴A · 可及性与成员福祉
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
把大模型部署在手机、IoT设备等端侧而非依赖云端API,能从根本上保护用户隐私(数据不出设备),但端侧硬件的算力、内存、功耗都远低于云端服务器。攻破意味着:通过模型压缩、量化、混合架构等技术,让十亿参数级的模型能在手机上实时运行、体验接近云端大模型,让「隐私保护」和「AI能力」不再是二选一。
卡在哪 · 机制级卡点
当前十亿参数级模型已能在旗舰手机上实时运行(如苹果Intelligence的30亿参数端侧模型),但更强能力的模型(百亿参数级)仍无法在端侧承载,设备-服务器混合推理(不确定查询才路由到云端)是折中方案,但如何精确判断「这个查询是否需要云端能力」本身又是未解的路由难题。
谁在攻
苹果(Apple Intelligence端侧30亿参数模型);llama.cpp、MLC-LLM等开源端侧推理框架社区
怎么参与
在手机或树莓派上用 llama.cpp 部署一个量化后的开源小模型,测试实际推理速度和内存占用