古文字数据平台 · 简帛 概说 图册 对读 密封评测 编联环境

竹简编联仲裁探索环境 · v0 演示

GOAI 前沿探索(AI for Research)· 开放探索赛题 · 队伍:炸酱面
研究问题:战国竹简出土时编绳朽断、简序散乱。重建简序(编联)时,物质证据(简长、契口、编绳痕、简背划线、茬口) 与文本证据(韵读、虚词、文意衔接、传世对读)常指向不同答案,而谁让步、让到什么程度,学界没有成文规则—— 这是郭店简争议三十年不收敛的机制。Agent 能否从编联已定的篇目中归纳出显式、可审计的仲裁规则, 并在争议篇上产出新方案,或把各家分歧归因到具体证据通道的权重差?

一、任务是什么:把打乱的简序排回去

下面是真实的已刊释文。选一篇,看仅凭文本信号能把简序恢复到什么程度。 绿色连接 = 该相邻关系与整理者方案一致;灰色 = 排错了。点击任一单元可读原文。

相邻关系复原正确 排错 数字 = 整理者原始编号
点击上方任一单元查看释文

二、参照系:和「纯随机」比,赢了多少

每篇做 2000 次随机排列构成零分布(下图灰点为抽样),彩色点为各文本通道的成绩。 只有明显落在灰云右侧才算超过随机。这一步是本环境最硬的部分——它排除了「只是运气好」。

经多重比较校正后,8 篇里只剩 1 篇稳健显著

篇目单元数ENS 复原率置换 p Holm 校正 p20 种子均值随机均值

Holm 为族错误率校正(8 篇多重比较)。20 种子均值用于检验结果是否只是某一次洗牌的运气。

v0 已录得的三个发现信号(全部在实验前定义)

① 文本通道有真实但极有限的能力。校正后仅《五行》稳健显著(0.37,Holm 0.004), 天花板是 1.0——单靠文本远不足以编联,这正是引入物质通道的动机。

② 一个反预期的失效边界。赛前预期「连续论说体优于章句体」,实测不符: 起作用的似乎是表层公式化重复(《五行》顶针衔接、《緇衣》「夫子曰/《詩》云」套语), 而在章节自足的《老子》甲退化为随机。此机制归因为待检假设,v1 消融检验。

③ 一次主动的自我否定。20 种子重跑发现《緇衣》洗牌敏感(均值 0.164,极差 0.14–0.23), 初版报告的 0.23 恰是最幸运的那个种子——已主动降格并写进正文。 这类记录正是本环境希望产出的东西。

三、环境接口:Agent 在里面做什么

固定已刊释文不可改动;金标简序锁在评分器内;物质字段 schema 冻结; 评分函数版本化;预算上限(证据申请 ≤3n 次 / LLM ≤20 万 token / ≤36 秒每简)
观察乱序单元释文;逐条付费申请后可见的物质字段;工具输出(篇内检索、韵部表、 虚词分布、对读检索、字形字典);预算余额;自身规则卡与全部历史日志
行动申请证据(指定通道与单元,扣预算);提出相邻对假设(附方向与理由); 提出整篇简序;修订仲裁规则卡(条款与权重);标注存疑字;提出对读假设
反馈配对级:物质硬约束冲突即时拒绝;方案级:复原率、τ 及对 2000 次置换零分布的 p 值; 争议篇:硬约束满足计数与各家已刊方案的重合度(不给「正确答案」);每次行动后返回预算余额
记录env_log.jsonl 逐步流水;规则卡版本史(可回放「Agent 何时学会了什么」); 假设账本(每个假设的提出/保留/放弃+理由)

下方是本演示所展示的 v0 回路的真实日志片段(results/env_log.jsonl,共 40 条):

四、诚实边界

v0 的「单元」是整理者的章/段划分,不是物理简。简级结论待 v1 图版与形制字段落地。

章段切分本身可能编码顺序信息(切分泄漏)。整理者是在确定编联之后、于文意完整处切分的, 因此切分位置隐含金标。已列为需防的第二种泄漏形态,对策为固定字数窗口的粒度扰动对照与 v1 简级重切。

物质通道目前 0 简落地,仲裁回路尚未真实运行。v0 闭合的回路是「文本单通道能力边界测定」; 标题所指的仲裁环境属 v1。若物质字段落不了地,按预案降级为「对读判据操作化」主线并同步缩小主张。

五、复现

仅需 Python 3 标准库,无任何第三方包。固定种子 20260806,输出完全确定,重跑字节级一致,总耗时约 30 秒。

python3 baseline/run_baseline.py # 主线 python3 baseline/run_baseline.py --seeds 20 # 洗牌稳健性 python3 baseline/test_baseline.py # 回归测试