低资源语言 · AI 普惠
本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
全球七千多种语言中,绝大多数在互联网上的语料量不足以训练出可用的 AI 模型,这些语言的使用者——往往本就是资源最匮乏的人群——正被系统性排除在 AI 红利之外。语言鸿沟不同于以往的数字鸿沟:它不只是接入问题,而是智能工具本身对你的母语、文化语境和专业领域『失聪』。攻破它意味着教育、医疗咨询、法律援助等 AI 增强的公共服务能真正抵达最后十亿人,而不是让 AI 把既有不平等再放大一轮。这是可及性(A 轴)上少数目标清晰、路径部分可见、却长期投入不足的方向。
根本卡点是数据:低资源语言缺乏成规模的高质量文本与语音语料,而语料生产本身需要母语者社区的持续投入,商业回报又低,形成投入死循环。其次,跨语言迁移学习虽能借高资源语言的能力『补贴』低资源语言,但在文化语境、专业术语和非拉丁文字系统上系统性失真,且缺乏母语者评测基准,失真难以被发现和度量。
Meta(NLLB,No Language Left Behind)、Cohere Labs(Aya 多语言模型)、Masakhane(非洲语言草根研究社区)、Google(千语言计划)
读 NLP 中的多语言建模与跨语言迁移方向,关注 NLLB、Aya 等开源项目的论文与代码。最实际的切入点是加入 Masakhane 这类开放社区:为一种你熟悉的低资源语言建语料、做评测基准,是本科生也能做出真实贡献的子问题。若在国内,方言与少数民族语言的语料与评测同样是近乎空白的地带。
谁在攻这颗暗星 · 攻关者名录13 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。
去哪家 · 机构与公司名录7 家 · 其中初创/成长期 2
给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。