罗盘 / 深层能力测评
暗星档案 · 未点亮的星超越标准化考试的测评效度
本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
超越标准化考试的测评效度T4 量级 · 亮星
现有测评主要测可标准化的浅层能力,如何有效度地测量深度理解、创造与迁移仍是方法论空白。
暗星编号DS-0133
轴A · 可及性与成员福祉
领域cognition-education
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
标准化考试之所以流行,是因为它便宜、可比、易规模化——但它测的主要是能被标准化的浅层技能。这是文明级方向,因为'我们测什么'会反向定义'教什么、学什么',浅层测评正在系统性地把整个教育拉向应试。攻破它——建立能有效度、可规模化地测量深度理解、创造力和迁移能力的方法——将解锁教育目标本身的升级。
卡在哪 · 机制级卡点
卡点是效度与可规模化的两难:深度理解、创造力这类构念本身难以清晰操作化,评估它们往往需要专家人工判断,既贵又主观、难以标准化比较;而一旦追求规模化和客观性,又滑回可被应试攻略的浅层题型。如何两者兼得,是尚未解决的测量学空白——具体临界路径待考。
谁在攻
无人区——PISA(OECD)、ETS 等机构有零散探索(如问题解决、协作能力测评),但没有形成攻克该难题的集中力量
怎么参与
走教育测量学/心理计量(psychometrics)与评估设计路径,进大型测评机构或学术团队,从一个具体高阶构念(如'科学论证能力')切入,研究如何用 AI 辅助评分等新手段,把'既有效度又可规模化'做成可验证的测评原型。
谁在攻这颗暗星 · 攻关者名录3 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。
ACADEMIA学界 · 科研2
琳达·达林-哈蒙德Linda Darling-Hammond教育学家 / 学习政策研究所主席
学习政策研究所(Learning Policy Institute)· 斯坦福大学荣休教授
长期倡导'表现性评估/真实性评估'替代浅层标准化考试,推动能测量深度理解与迁移的评估体系,是超越标准化考试议题最有影响力的实践推动者之一。
兰迪·贝内特Randy E. Bennett评估创新研究者
美国教育考试服务中心(ETS)· 曾任 Frederiksen 评估创新讲席(2010–2025)
融合认知科学、技术与测量学研究下一代评估,倡导'生而具社会文化响应性'的测评设计,长期攻'既有效度又可规模化'的测量学空白。
THIRD PARTY第三方 · 政策/资助/倡导1
安德烈亚斯·施莱歇尔Andreas SchleicherOECD 教育与技能司司长 / PISA 之父
经济合作与发展组织(OECD)
PISA 国际测评的缔造者与掌舵人,持续推动 PISA 从纸笔学科题走向问题解决、协作等高阶能力测评,是'测什么牵引教什么'这一议题的全球主导者。
去哪家 · 机构与公司名录3 家 · 其中初创/成长期 1
给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。
Riiid Labs(뤼이드)成长期
用 AI 从'缩短版测评'预测完整评分、设计个性化学习路径,压缩测评时长同时保效度
RIIID Tutor 逾 200 万用户;代表'用 AI 让测评更短却更准'的一条效度提升路线
The Learning Agency Lab非营利
用 Kaggle Feedback Prize 系列赛推动自动作文/开放式作答评分,构建对齐现行课标的最大公开学生写作数据集
↗ 顶级模型评分准确率≈人类标注者一致度(约 75%),成果被 Google Gemini 等采纳;是把'深层写作能力可规模化、可有效度评分'往前推的中立力量
Duolingo English Test大厂
端到端用 AI/ML 做高利害语言测评——自动生成题目、按 CEFR 对齐难度、自动评阅口语与写作
↗ 首个全流程 AI 驱动的高利害考试,用计算机自适应+AI 出题把'又便宜又有效度'做成规模化产品,正面挑战传统标准化考试