罗盘 / 低资源语言AI
暗星档案 · 未点亮的星

低资源语言 · AI 普惠

本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

低资源语言 · AI 普惠T5 量级 · 新星
让全球数千种语言的使用者不被排除在 AI 能力红利之外——语言正在成为新的智能鸿沟。
暗星编号DS-0321
A · 可及性与成员福祉
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

全球七千多种语言中,绝大多数在互联网上的语料量不足以训练出可用的 AI 模型,这些语言的使用者——往往本就是资源最匮乏的人群——正被系统性排除在 AI 红利之外。语言鸿沟不同于以往的数字鸿沟:它不只是接入问题,而是智能工具本身对你的母语、文化语境和专业领域『失聪』。攻破它意味着教育、医疗咨询、法律援助等 AI 增强的公共服务能真正抵达最后十亿人,而不是让 AI 把既有不平等再放大一轮。这是可及性(A 轴)上少数目标清晰、路径部分可见、却长期投入不足的方向。

卡在哪 · 机制级卡点

根本卡点是数据:低资源语言缺乏成规模的高质量文本与语音语料,而语料生产本身需要母语者社区的持续投入,商业回报又低,形成投入死循环。其次,跨语言迁移学习虽能借高资源语言的能力『补贴』低资源语言,但在文化语境、专业术语和非拉丁文字系统上系统性失真,且缺乏母语者评测基准,失真难以被发现和度量。

谁在攻

Meta(NLLB,No Language Left Behind)、Cohere Labs(Aya 多语言模型)、Masakhane(非洲语言草根研究社区)、Google(千语言计划)

怎么参与

读 NLP 中的多语言建模与跨语言迁移方向,关注 NLLB、Aya 等开源项目的论文与代码。最实际的切入点是加入 Masakhane 这类开放社区:为一种你熟悉的低资源语言建语料、做评测基准,是本科生也能做出真实贡献的子问题。若在国内,方言与少数民族语言的语料与评测同样是近乎空白的地带。

谁在攻这颗暗星 · 攻关者名录13 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

ACADEMIA学界 · 科研4
戴维·阿德拉尼David Ifeoluwa Adelani低资源语言 NLP 研究者 / 助理教授
McGill 大学 / Mila(Masakhane 核心成员)
主导 MasakhaNER、MasakhaNEWS 等数十种非洲低资源语言的命名实体识别与新闻分类基准数据集,把非洲语言系统性带上机器翻译与评测地图。
大卫·阿德拉尼David Ifeoluwa Adelani计算语言学助理教授、Masakhane 核心成员
麦吉尔大学 / Mila
非洲语言 NLP 最活跃的研究者之一,主导 MasakhaNER 等非洲语言语料与基准建设,专攻低资源语言的评测地基。
格雷厄姆·纽比格Graham Neubig计算机科学副教授
卡内基梅隆大学(CMU)
低资源机器翻译与多语言 NLP 领军学者,长期研究小语种迁移学习与语料稀缺条件下的建模方法。
史蒂文·伯德Steven Bird计算语言学教授
查尔斯达尔文大学
低资源与濒危语言技术奠基者(NLTK 共同作者),倡导以社区为中心的语言文档与数字化方法,直面「懂语言又愿长期做数据的人最缺」的症结。
INDUSTRY业界 · 创业与工程8
玛尔塔·科斯塔-茹萨Marta R. Costa-jussà机器翻译研究科学家 / NLLB 负责人
Meta AI(FAIR)
领导 Meta『No Language Left Behind』(NLLB)项目,构建覆盖 200 语种、面向低资源语言的开源翻译模型与评测集 FLORES-200。
萨拉·胡克Sara Hooker研究副总裁 / Cohere For AI 创始负责人
Cohere Labs(原 Cohere For AI)
创立并领导 Cohere For AI,发起 Aya 多语言开源模型与全球研究者协作,以社区众包方式覆盖百余种语言、直击低资源语料稀缺问题。
阿赫梅特·于斯蒂恩Ahmet ÜstünAya 模型技术负责人之一 / 研究科学家
Cohere Labs
Aya 系列多语言指令模型(Aya 101 / Aya 23)的核心与通讯作者,负责把多语言指令数据蒸馏进开源模型。
杰德·阿博特Jade AbbottMasakhane 联合创始人 / Lelapa AI 联合创始人
Lelapa AI / Masakhane
2019 年发起 Masakhane 草根研究社区,后共同创立面向非洲语言的商业 AI 公司 Lelapa AI,推动非洲语言从研究走向可用产品。
张宇Yu Zhang通用语音模型(USM)主研究员
Google Research
Google『千语言计划』通用语音模型(USM)的技术负责人之一,把自动语音识别扩展到 100+ 语种,攻语音侧的低资源鸿沟。
安杰拉·范Angela Fan研究科学家、NLLB 项目主要作者
Meta AI
「No Language Left Behind(NLLB)」项目的核心作者之一,主导把机器翻译扩展到 200 种语言、含大量低资源语言的开源模型与评测。
玛尔塔·科斯塔-胡萨Marta R. Costa-jussà机器翻译研究负责人
Meta AI
NLLB 的机器翻译研究带头人,长期研究多语言与低资源翻译方法及其偏差评测,是把长尾语言纳入大模型翻译的关键研究者。
尤利娅·克罗伊策Julia Kreutzer研究科学家、Masakhane 成员
Cohere For AI
长期参与 Masakhane 与低资源翻译研究,推动开放多语言数据集与评测(如 Aya 等多语言项目),连接草根社区与前沿模型。
THIRD PARTY第三方 · 政策/资助/倡导1
劳拉·马丁努斯Laura MartinusMasakhane 联合创始人
Masakhane(开放研究社区)
与杰德·阿博特共同发起 Masakhane,搭建让母语者社区参与建语料、做评测基准的开放协作机制。

去哪家 · 机构与公司名录7 家 · 其中初创/成长期 2

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

Lelapa AI初创
2022 创 · 种子轮 约 $2.5M(Mozilla Ventures、Jeff Dean、Atlantica Ventures) · 南非 约翰内斯堡
做资源高效的非洲语言模型:多语言大模型 InkubaLM(覆盖斯瓦希里、约鲁巴、豪萨、祖鲁等)+ 语音产品 Vulavula(语音转写/翻译,支持语码转换)。
↗ 号称非洲首个多语言 LLM,Google 首席科学家 Jeff Dean 与 Mozilla 都投;主打『小算力也能做本地化 AI』,是低资源语言创业最典型的样板。
Sarvam AI成长期
2023 创 · B 轮 $234M · 估值 $15 亿(2026 独角兽 · HCLTech 领投) · 印度 班加罗尔
做印度语言主权大模型(Sarvam-1、Indus 等),团队出自 IIT 马德拉斯的 AI4Bharat。
↗ 印度首个语言 AI 独角兽,被印度政府 IndiaAI Mission 选为国产基础模型承建方——低资源语言从『草根』升级为『国家主权 AI』的标志。
African Languages Lab (AfriLabs)科研实验室
青年主导的协作实验室,记录、数字化、翻译并用 NLP 赋能低资源非洲语言,已构建约 18 种非洲语言的数据集。
↗ 『青年主导』的语料+评测生产模式,直接对准语料死循环里最难的母语者持续投入环节。
Cohere Labs(Aya 项目)科研实验室
Cohere 旗下研究部门 · 加拿大 多伦多
开源多语言模型 Aya,覆盖 100+ 语言,含大量低资源语言的指令微调数据。
↗ 全球最大规模的开放多语言协作之一(数千名志愿贡献者),是跨语言迁移学习的重要开源基准来源。
AI4Bharat科研实验室
IIT Madras 研究实验室 · 印度 金奈
为印度 22 种官方语言建开源资源:IndicTrans2 翻译模型、251B token 预训练语料,覆盖 Bodo、Kangri、Khasi 等极低资源语言
↗ 从 400+ 地区采集 1.5 万小时转写语音;首个支持全部 22 种印度语言的开源 Transformer NMT——把"算法眼里不存在的语言"系统性数字化
Karya非营利
2021 创 · 非营利(社会企业) · 印度 班加罗尔
『全球首家伦理数据公司』:雇农村印度人以约 20 倍最低工资采集 50+ 印度语言的文本/语音语料,破解低资源语言的语料死循环。
↗ 把语料生产做成数据合作社——工人对自己造的数据享有所有权,数据每次转售都拿分成;IndiaAI Mission 官方合作方。这是解决『语料无人做』的机制创新,信息增量极高。
Masakhane非营利
开放研究社区 · 泛非(分布式)
非洲语言 NLP 的草根开放研究社区,众包语料、基准与开源模型。
↗ 非集中式、上千名研究者参与,是本科生也能做出真实贡献的入口;很多非洲语言评测基准就诞生于此。求职/入行者的最佳切入社区。

来源 · 可查证