人类史料全息数字化
本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
人类几千年积累的记录——档案馆里的手稿、绝版书、地方志、口述史——绝大多数至今没有数字化,或者数字化了却被版权和机构壁垒锁在各自的库里。Google Books 曾经最接近这个目标,扫了几千万册书之后因版权诉讼实质停滞,此后再没有出现同等规模的推动者。这不是「扫描」的技术问题,而是一项文明级基础设施:全部人类记录可检索可用,意味着每个研究者、每个 AI、每个普通人都站在完整的人类经验之上工作。攻破它解锁的是知识获取的彻底平权,以及以全量史料为底座的历史学、语言学与文化研究。
卡在三个环节的叠加:一是版权制度——20 世纪的绝大多数出版物仍在版权期内,「孤儿作品」(找不到权利人的作品)在多数法域无合法的大规模数字化通道,Google Books 和解方案 2011 年被法院否决后无人再敢碰这个规模;二是机构壁垒——档案馆、图书馆各自为政,数字化成果不互通、元数据标准不统一;三是激励缺失——这是典型的公共品,商业回报撑不起千万册级的扫描与长期保存成本。
Internet Archive(含 Open Library)、Europeana(欧盟文化遗产聚合平台)、梵蒂冈图书馆数字化项目(DigiVatLib)、HathiTrust
法律与工程两条入口都开着:法律方向读版权法与信息政策,孤儿作品立法和文本数据挖掘例外条款是当前最有杠杆的子问题;工程方向从 OCR/手稿识别(尤其非拉丁文字和历史字体)或图书馆元数据互通标准切入。Internet Archive、各国国家图书馆数字化部门、数字人文实验室都是可进的团队。
谁在攻这颗暗星 · 攻关者名录10 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。
去哪家 · 机构与公司名录5 家 · 其中初创/成长期 0
给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。