下面是真实的已刊释文。选一篇,看仅凭文本信号能把简序恢复到什么程度。 绿色连接 = 该相邻关系与整理者方案一致;灰色 = 排错了。点击任一单元可读原文。
每篇做 2000 次随机排列构成零分布(下图灰点为抽样),彩色点为各文本通道的成绩。 只有明显落在灰云右侧才算超过随机。这一步是本环境最硬的部分——它排除了「只是运气好」。
| 篇目 | 单元数 | ENS 复原率 | 置换 p | Holm 校正 p | 20 种子均值 | 随机均值 |
|---|
Holm 为族错误率校正(8 篇多重比较)。20 种子均值用于检验结果是否只是某一次洗牌的运气。
① 文本通道有真实但极有限的能力。校正后仅《五行》稳健显著(0.37,Holm 0.004), 天花板是 1.0——单靠文本远不足以编联,这正是引入物质通道的动机。
② 一个反预期的失效边界。赛前预期「连续论说体优于章句体」,实测不符: 起作用的似乎是表层公式化重复(《五行》顶针衔接、《緇衣》「夫子曰/《詩》云」套语), 而在章节自足的《老子》甲退化为随机。此机制归因为待检假设,v1 消融检验。
③ 一次主动的自我否定。20 种子重跑发现《緇衣》洗牌敏感(均值 0.164,极差 0.14–0.23), 初版报告的 0.23 恰是最幸运的那个种子——已主动降格并写进正文。 这类记录正是本环境希望产出的东西。
| 固定 | 已刊释文不可改动;金标简序锁在评分器内;物质字段 schema 冻结; 评分函数版本化;预算上限(证据申请 ≤3n 次 / LLM ≤20 万 token / ≤36 秒每简) |
|---|---|
| 观察 | 乱序单元释文;逐条付费申请后可见的物质字段;工具输出(篇内检索、韵部表、 虚词分布、对读检索、字形字典);预算余额;自身规则卡与全部历史日志 |
| 行动 | 申请证据(指定通道与单元,扣预算);提出相邻对假设(附方向与理由); 提出整篇简序;修订仲裁规则卡(条款与权重);标注存疑字;提出对读假设 |
| 反馈 | 配对级:物质硬约束冲突即时拒绝;方案级:复原率、τ 及对 2000 次置换零分布的 p 值; 争议篇:硬约束满足计数与各家已刊方案的重合度(不给「正确答案」);每次行动后返回预算余额 |
| 记录 | env_log.jsonl 逐步流水;规则卡版本史(可回放「Agent 何时学会了什么」); 假设账本(每个假设的提出/保留/放弃+理由) |
下方是本演示所展示的 v0 回路的真实日志片段(results/env_log.jsonl,共 40 条):
v0 的「单元」是整理者的章/段划分,不是物理简。简级结论待 v1 图版与形制字段落地。
章段切分本身可能编码顺序信息(切分泄漏)。整理者是在确定编联之后、于文意完整处切分的, 因此切分位置隐含金标。已列为需防的第二种泄漏形态,对策为固定字数窗口的粒度扰动对照与 v1 简级重切。
物质通道目前 0 简落地,仲裁回路尚未真实运行。v0 闭合的回路是「文本单通道能力边界测定」; 标题所指的仲裁环境属 v1。若物质字段落不了地,按预案降级为「对读判据操作化」主线并同步缩小主张。
仅需 Python 3 标准库,无任何第三方包。固定种子 20260806,输出完全确定,重跑字节级一致,总耗时约 30 秒。