罗盘 / 深层能力测评
暗星档案 · 未点亮的星

超越标准化考试的测评效度

本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

超越标准化考试的测评效度T4 量级 · 亮星
现有测评主要测可标准化的浅层能力,如何有效度地测量深度理解、创造与迁移仍是方法论空白。
暗星编号DS-0133
A · 可及性与成员福祉
领域cognition-education
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

标准化考试之所以流行,是因为它便宜、可比、易规模化——但它测的主要是能被标准化的浅层技能。这是文明级方向,因为'我们测什么'会反向定义'教什么、学什么',浅层测评正在系统性地把整个教育拉向应试。攻破它——建立能有效度、可规模化地测量深度理解、创造力和迁移能力的方法——将解锁教育目标本身的升级。

卡在哪 · 机制级卡点

卡点是效度与可规模化的两难:深度理解、创造力这类构念本身难以清晰操作化,评估它们往往需要专家人工判断,既贵又主观、难以标准化比较;而一旦追求规模化和客观性,又滑回可被应试攻略的浅层题型。如何两者兼得,是尚未解决的测量学空白——具体临界路径待考。

谁在攻

无人区——PISA(OECD)、ETS 等机构有零散探索(如问题解决、协作能力测评),但没有形成攻克该难题的集中力量

怎么参与

走教育测量学/心理计量(psychometrics)与评估设计路径,进大型测评机构或学术团队,从一个具体高阶构念(如'科学论证能力')切入,研究如何用 AI 辅助评分等新手段,把'既有效度又可规模化'做成可验证的测评原型。

谁在攻这颗暗星 · 攻关者名录3 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

ACADEMIA学界 · 科研2
琳达·达林-哈蒙德Linda Darling-Hammond教育学家 / 学习政策研究所主席
学习政策研究所(Learning Policy Institute)· 斯坦福大学荣休教授
长期倡导'表现性评估/真实性评估'替代浅层标准化考试,推动能测量深度理解与迁移的评估体系,是超越标准化考试议题最有影响力的实践推动者之一。
兰迪·贝内特Randy E. Bennett评估创新研究者
美国教育考试服务中心(ETS)· 曾任 Frederiksen 评估创新讲席(2010–2025)
融合认知科学、技术与测量学研究下一代评估,倡导'生而具社会文化响应性'的测评设计,长期攻'既有效度又可规模化'的测量学空白。
THIRD PARTY第三方 · 政策/资助/倡导1
安德烈亚斯·施莱歇尔Andreas SchleicherOECD 教育与技能司司长 / PISA 之父
经济合作与发展组织(OECD)
PISA 国际测评的缔造者与掌舵人,持续推动 PISA 从纸笔学科题走向问题解决、协作等高阶能力测评,是'测什么牵引教什么'这一议题的全球主导者。

去哪家 · 机构与公司名录3 家 · 其中初创/成长期 1

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

来源 · 可查证