2026年8月17日·科学·7 分钟阅读

从高考公平说起——一次关于排名的绕路

我们原本只是争论一道题应该怎么判,后来却一路追问到一个更麻烦的问题:所谓公平排名,究竟是在测量事实,还是在规定我们想要什么样的人?

前些天跟朋友聊起高考公平,起点其实很小:选择题是不是太容易蒙,解答题是不是又难免沾上阅卷人的主观判断。

我最初的想法颇为简单。既然如此,数理科目何不多用填空题?它保留了客观判分的便利,又把四选一那种四分之一的猜中概率压得很低。朋友更在意的是另一件事:只要相似的解答总能得到相似的分数,评分就算公平。我却觉得还差一点。一个系统完全可以非常稳定地判错;方差虽小,偏差仍在。“一视同仁”固然可贵,却不能代替“判得对”。

AI 阅卷使这个分歧不再那么尖锐。对于数学、物理一类题目,未来的机器未必需要事先穷举所有标准解法。它只要能检查推理链,调用符号计算或定理验证器,再把拿不准的少数答案交给人工复核,就有可能同时压低随机的阅卷差异,以及“没见过这种解法,所以不敢给分”的偏差。

不过,这只解决了怎样判的问题,并没有解决判什么。到那时,真正麻烦的就不再是谁来阅卷,而是:什么样的表现本来就该值多少分?

讨论由此从考试技术绕到了社会选择。

一张总分表丢掉了什么

社会需要的人显然不止一种。有人算得极快,有人证明极强,有人善于建模;也有人未必能在规定时间里写出漂亮答案,却能在开放问题上走得很远。如果把这些能力写成一个向量,传统总分所做的,无非是选定一组权重,再把这个向量压成一个数。

但不同学校、不同专业,为什么一定要用同一组权重?工程专业也许更看重结果是否正确、模型能否落地;数学专业也许更看重证明、抽象和非标准推理。于是一个很自然的设想出现了:国家负责尽可能可靠地测出多维能力,学校则预先公开自己的价值函数,按不同权重选择不同的人。这样既保留统一考试的可比性,也不必假装“全国最优秀的学生”只有一种定义。

再往前一步,这就不只是高考的问题了。比赛、招聘、大学排名乃至机器学习的 benchmark,似乎都可以拆成四层:测量、价值、排名、审计。先问一个人或一个对象究竟表现出了什么;再说明我们在乎哪些维度;然后才形成排名;最后检查这个次序对测量误差和权重变化是否稳健。

这四层中,我最喜欢的一句话是:

事实测量应尽量客观;价值判断不必统一,但必须明说。

这个说法相当顺手,顺手到很容易让人误以为它也相当新。可惜直觉最擅长的事情之一,就是把熟悉感误认成发现。

文献检索是给直觉降温的好办法

Friedler、Scheidegger 和 Venkatasubramanian 早已把不可直接观察的 construct、实际观测到的东西以及最终 decision 分开讨论。Jacobs 与 Wallach 又把 measurement theory 直接带进 fairness:量得稳定是一回事,量到想量的东西则是另一回事。Bothmann 等人则提醒,所谓公平并不能脱离规范性前提;他们甚至为那种“我们认为世界本应如此”的参照取了一个很诚实的名字——fictitious world。

更大的“撞车”来自我原本不熟悉的多准则决策分析。1998 年提出的 SMAA 已经允许指标和权重带有不确定性,并在权重空间中追问:什么样的价值取向会让某个候选方案胜出?后来 Robust Ordinal Regression 又区分了 necessary preference 与 possible preference——只有在所有相容的价值函数下 A 都优于 B,这种优越才是必要的;若只在一部分函数下成立,它就只是可能的。Corrente 等人甚至把“不精确的评价值”也放进了同一套框架。

于是还可以把问题收窄一些:与其执意给出一条漂亮的名次,不如先问这条名次有没有资格如此确定。若 A 与 B 的差距小于测量误差,或权重稍微一动,两者便互换位置,那么郑重其事地写下第一名和第二名,多少有些像拿游标卡尺去量雾。

这条路同样早已有了足迹。Singh、Kempe 和 Joachims 讨论过 merit 本身不确定时的公平排名;统计学中也有直接为真实名次构造置信集合的方法。借用 Mogstad 等人的框架,一个对象更诚实的结论有时不是“排名第三”,而是“它的真实名次可能在第二到第六之间”。强行把带噪声的估计排成一条没有误差条的全序,不过是把计算机输出的整齐误当成证据的充分。

这样看来,最初那个四层框架并未消失,只是失去了新鲜的外衣。独立地走到一个旧思想面前,不足以使它变成新发现;但这往往说明,它确实是从问题的结构里很自然地长出来的。很多思考并不是在第一个漂亮念头出现时变得有趣,而是在那个念头撞上已有知识之后,才露出真正没有解决的部分。

排名不是一把静止的尺子

继续往下想,问题又变了一次。

前面的讨论多少把被评价者看成静止的:规则摆在那里,人把表现交上来,系统负责测量和排序。现实中的人却会看规则,而且通常看得很仔细。

如果一所大学公开说自己特别重视某种能力,高中、家庭和培训机构就会围绕这种能力组织训练;如果大学排行榜强调若干指标,大学也会调整资源去提高这些指标;如果一个机器学习 benchmark 成了公认目标,模型开发便会朝那个 benchmark 优化。尺子一旦摆到桌面上,被测的东西就会开始朝尺子生长。

这同样不是无人涉足之地。Hardt 等人的 strategic classification 研究人在知道分类规则后如何主动改变特征;strategic ranking 又把竞争和排序直接放进了大学录取一类场景。Performative prediction 进一步讨论预测或决策怎样改变它原本试图预测的世界。关于 ranking games 的研究也已指出,排名会同时改变被排名者与排名提供者的激励。

不过到了这里,最初那场关于高考的闲谈反倒显出了真正有意思的一面。

公平也许从来不是找出一张最好的试卷、一套最聪明的 AI 阅卷器,或者一个完美的加权公式。一个评价制度既在测量人,也在训练人;既在描述何为优秀,也在逐渐制造这种优秀。静态地看,一条规则可以十分准确;放进社会里反复运行,它却会改变自己所测量的对象,最后连原先的含义也一并改变。

因此,真正困难的问题或许不是“怎样把人排得最公平”,而是:

有没有一种评价制度,在所有人都开始针对它优化以后,仍能测到我们最初真正想测的东西?

这已经离选择题、填空题和阅卷误差很远了。我倒很喜欢这种绕路:它没有留下万能的排名公式,反而接连拿走了几个看似漂亮的答案;但答案少了一些,问题却清楚了一些。

有时查文献的作用并不是证明自己想得对,而是把那些已经有人想明白的部分从问题里一层层剥掉。剥到最后还剩什么,思考才真正从那里开始。

参考资料

  1. On the (im)possibility of fairness · Sorelle A. Friedler, Carlos Scheidegger, Suresh Venkatasubramanian
  2. Measurement and Fairness · Abigail Z. Jacobs, Hanna Wallach
  3. What is Fairness? On Protected Attributes and Fictitious Worlds · Ludwig Bothmann, Kristina Peters, Bernd Bischl
  4. SMAA - Stochastic multiobjective acceptability analysis · Risto Lahdelma, Joonas Hokkanen, Pekka Salminen
  5. Ordinal regression revisited: Multiple criteria ranking using a set of additive value functions · Salvatore Greco, Vincent Mousseau, Roman Słowiński
  6. Robust Ordinal Regression in case of Imprecise Evaluations · Salvatore Corrente, Salvatore Greco, Roman Słowiński
  7. Fairness in Ranking under Uncertainty · Ashudeep Singh, David Kempe, Thorsten Joachims
  8. Inference for Ranks with Applications to Mobility across Neighbourhoods and Academic Achievement across Countries · Magne Mogstad, Joseph P. Romano, Azeem M. Shaikh, Daniel Wilhelm
  9. Strategic Classification · Moritz Hardt, Nimrod Megiddo, Christos Papadimitriou, Mary Wootters
  10. Strategic ranking · Lydia T. Liu, Nikhil Garg, Christian Borgs
  11. Performative Prediction · Juan Perdomo, Tijana Zrnic, Celestine Mendler-Dünner, Moritz Hardt
  12. Ranking Games · Margit Osterloh, Bruno S. Frey