密封评测 · 负结果
纯物质证据编联,在这 21 支简上与随机不可区分
在预测端未接触答案的盲测协议下,仅凭简形与书写风格的统计特征做编联, 配对召回 0.20(置换 p=0.2627), top-1 找伴侣 0.10(p=0.2667)。 观测值约为随机的两倍,但完全落在零分布的常见范围内——不显著。 这一页记录这个结论怎么来的,以及此前两轮评测为什么被作废。
一、结果
| 指标 | 观测 | 随机零分布 | 置换 p |
|---|---|---|---|
| 配对召回(10 对金标中命中 2) | 0.20 | 均值 1.00,95 分位 3 | 0.2627 |
| 配对精确率(2 / 21 条预测关系) | 0.0952 | — | — |
| top-1 找伴侣(2 / 20) | 0.10 | 0.0502 | 0.2667 |
零分布:保持预测的分组规模 [3, 3, 3, 3, 3, 3, 3] 不变, 随机指派成员 20,000 次,随机种子 20260816。 金标来源:出版图版分组标记(一)…(十一),与赵晓斌论文简号一致;21 支简构成 11 组,共 10 对同组关系。
评分由主控用确定性脚本 score_sealed.py 在提案封存后执行,
预测端从未见过该脚本,也从未见过本页的任何数字。
二、为什么这次的成绩可信:两次纠错
同一批数据上做过两轮评测,前两版全部作废。作废的原因比成绩本身更值得记录。
作废原因 1 · 预测端看到了答案
第一轮的 agent prompt 里直接写入了赵晓斌论文的分组金标(如「(一)=743→782」)。
一个知道答案的预测器可以先写出正确配对再报高准确率,评测因此无意义。
文件时间戳进一步坐实协议被违反:score.json(22:02:14)早于
proposal.json(22:04:59)——先评分,后写提案。
作废原因 2 · 测试集的制作工艺本身编码了答案
这一条隐蔽得多。出版图版把已编联的简并排放在同一块灰色底板上, 而第一版切图按底板包围盒裁切,于是同组的两支简拿到了完全相同的裁切高度:
| crop_h | 同高的简 | 是否金标同组 |
|---|---|---|
| 1912 px | WJZ-01, WJZ-10 | 是 |
| 3796 px | WJZ-02, WJZ-20 | 是 |
| 3812 px | WJZ-08, WJZ-17 | 是 |
只要按 crop_h 撞号配对,就能白捡 15% 的金标相邻关系,而且看上去像是真本事。 这是一条由评测集制作工艺产生的泄漏通道,与「模型背过语料」是不同的一类问题,更难察觉。
修复:按简身实测包围盒重裁全部 21 支(01_单简_去泄漏/),
新尺寸零撞号;简身真实高度 slip_h 仅剩一对巧合撞号,属物理巧合而非工艺产物。
本站图册用的就是重裁后的这一版。
本轮协议
- 预测端 prompt 明令禁止读取封存对照表、论文目录、任何含 answer/gold/释文 字样的文件, 并禁止依据既有知识回忆简号;写完提案立即停止,不得自评。
- 评分由主控事后用确定性脚本执行,预测端从未见过该脚本。
- 预测端在提交时主动声明了自己排除掉的高风险特征(见下),且未接触金标。
三、失效机制
以下诊断由预测端在不知道成绩的情况下给出,与事后算出的结果一致。
- 相似度矩阵几乎是平的。21 支中有 13 支的 top1 与 top2 相似度之差小于 0.03 (WJZ-09 仅 0.006)。对多数简,「最像它的」与「第二像的」不可区分,top1 基本是噪声排序。
- 编联最硬的三类物质证据全部缺席。契口位置在紧裁图上已被裁掉; 对最外三列的异常检测在 9 支完整简间毫无共同模式,判为裁切锯齿;编绳暗带的位置完全散乱。 背划线——楚简编联最强的证据——本批图版根本没有。
- 同批同书手,区分度可能本就不足。21 支若出自同一批、同一书手、同一形制, 「同篇」与「不同篇」在简宽、字距、墨色上的差异,很可能小于同篇内部的自然波动。
- 组内次序等同随机。定向只能依赖残存天头留白,而天头留白恰恰是被判定为高风险的特征。
四、预测端主动排除的高风险特征
预测端在不知金标的情况下,自行判定并排除了以下特征,理由是「可能来自切分工艺而非简本身」:
img_w_px/img_h_px——即上一轮的泄漏通道本身。- 天头/地脚留白比、完简判断、边缘毛糙度。
raw_median_tone/raw_tone_std(图版级色调指纹)——理由是 「同版发表」与「同篇」高度相关,用它得到的分数虚高,比裁切高度更隐蔽。 这一条是预测端自己想到的,不在主控给的约束里。
它还识别出两类流程性假信号:简尾被抹除简号后的淡色矩形残迹(污染「末端留白」特征), 以及满宽实心黑块(无法在「墨节」与「流程涂黑」之间判定,故提取位置但不进入打分)。
五、这个负结果说明什么
它不是「编联做不了」,而是精确地说明了:
在没有契口、编绳痕、背划线的条件下,仅凭简形与书写风格的统计特征, 无法把同批同书手的竹简编联到超过随机的水平。
这恰好从反面支持本项目的核心研究问题——编联必须是物质证据与文本证据的仲裁, 两者缺一不可。文本通道在郭店/上博 8 篇上的实测(仅《五行》稳健显著,Holm 0.004)说明文本单独不够; 本次说明物质单独也不够,且当关键物质证据缺席时,连「够一点」都谈不上。
六、要真正做好,需要什么
- 保留简身外一圈背景的裁切——让契口可见。本次为去泄漏而紧裁, 反而牺牲了契口;下一版应保留固定物理宽度的边缘,并对每支单独随机化留白量以切断工艺泄漏。
- 统一标定的 px/mm——当前只有像素,无法跨图版比较真实尺寸。
- 背划线图像——需向整理方申请,或对原件做红外扫描。
可复核的文件
- 评分结果
sealed/SCORE_由主控执行.json(本页所有数字的唯一来源)- 评分脚本
sealed/score_sealed.py(主控执行,预测端不可见)- 封存提案
sealed/proposal.json- 方法说明
sealed/method_bianlian.md- 特征表
sealed/features_clean.json- 完整报告
sealed/密封评测报告.md
这些文件未随站点发布(评分脚本与提案公开会污染这批简日后的评测用途), 需要复核请直接向作者索取。