罗盘 / 联邦学习非独立同分布难题
暗星档案 · 未点亮的星联邦学习非独立同分布难题
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
联邦学习非独立同分布难题T5 量级 · 新星
让分散在各处、分布不一致的数据也能联合训练出好模型
暗星编号DS-0756
轴R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
联邦学习让多方在不共享原始数据的前提下联合训练模型(医院、银行、手机终端等),但现实中各参与方的数据分布天然不一致(标签偏斜、特征偏斜、数量偏斜、时空偏斜)。攻破意味着:医疗、金融等强隐私行业能真正联合建模而不必先做痛苦的数据标准化,模型收敛速度和最终精度能接近集中式训练,让「数据不出域、价值可流通」从口号变成工程现实。
卡在哪 · 机制级卡点
非独立同分布数据会显著拖慢收敛、降低最终精度,现有方法(调整参数更新路径 / 修改客户端损失景观)在标签偏斜和时空偏斜场景下效果有限,尤其是「时空偏斜」这一类新识别出的偏斜类型目前几乎没有针对性解法。
谁在攻
学术界持续产出方法论文(如 FedHiSyn、FL-GUARD 等),暂未核实到有明确产品化机构专攻此问题
怎么参与
在 Flower 或 FedML 开源框架上跑一个非 IID 场景的联邦学习基准实验,对比 IID vs Non-IID 下的精度差距