Skip to content

编辑决策标准

合成代理的参考文件。定义共识分类、仲裁规则、分数分歧处理和决策映射。


1. 共识标签

标签定义临界点处理
[CONSENSUS-ALL]全部 N 个审查通道都标记同一问题N/N 同意优先级 1 — 作者必须处理
[CONSENSUS-MAJORITY]超过半数但并非全部通道标记同一问题floor(N/2)+1 到 N-1 个通道同意优先级 1 或 2(取决于严重性)
[SPLIT]未形成简单多数——存在根本分歧少于 floor(N/2)+1 个通道同意需要仲裁;记录所有立场
[AUTOMATED-ONLY]仅阶段 0 脚本发现的问题脚本检测包括原样;脚本的严重性

例如,N=3 时多数为 2/3;N=5 时多数为 3/5 或 4/5。

匹配标准

在以下情况下,两个发现被视为“同一问题”:

  1. 他们引用了论文中的相同位置(部分、图、表),并且
  2. 他们描述了相同的根本问题(即使措辞不同)

不要匹配仅共享一个类别的调查结果(例如,不同部分中的两个不相关的“过度主张”调查结果是单独的问题)。


2. 仲裁规则

当审阅者不同意(SPLIT)时,综合代理会按照严格的优先顺序使用这些原则来解决:

优先事项 1:证据原则

具体文本证据(引文、数据点、引文)支持的立场胜过基于一般印象的立场。

示例committee_methodology 通道说“表 3 显示 p < 0.05”,而 committee_logic 通道说“结果似乎不令人信服”。方法通道有证据支持的立场获胜。

优先事项2:专业原则

对于特定领域的争议,给予相关专家更高的权重:

争议类型主要权威基本原理
研究设计、统计committee_methodology / evaluation_fairness 通道技术方法专业知识
文献覆盖面、新颖性committee_theorycommittee_literature / prior_art 通道领域知识
逻辑论证,过度主张committee_logic / claims_vs_evidence 通道论证专业知识
跨领域(范围不清楚)等重使用证据原则

优先事项 3:保守原则

当证据和专业知识达到平衡时,倾向于更谨慎(更挑剔)的评估。理由:标记作者要解决的潜在问题比消除真正的担忧更安全。

文件要求

每个仲裁都必须按以下结构记录:

markdown
#### Arbitration: [Issue Title]

- **Disagreement**: [Concise description]
- **Position A** ([Reviewer]): [Their view, with quote from their report]
- **Position B** ([Reviewer]): [Their view, with quote from their report]
- **Principle Applied**: [Evidence / Expertise / Conservative]
- **Resolution**: [Decision and rationale]
- **Confidence**: [High / Medium / Low]

3. 分数差异处理

检测阈值

当两个审阅者对同一维度的评分差距 > 2.0 分时,就会出现分数分歧

处理协议

间隙尺寸行动
<= 1.0直接平均,无需评论
1.1 - 2.0平均并记录报告中的价差
> 2.0强制解释:调查原因、申请仲裁、记录最终分数的理由

大分歧的调查步骤

  1. 确定哪些具体发现影响了每个评审者的分数
  2. 检查一位审阅者是否考虑了另一位审阅者错过的证据
  3. 将仲裁规则(第 2 节)应用于根本分歧
  4. 根据记录的理由设置最终分数(不要简单地平均)

分数合并表

方面主要来源次要来源合并规则
健全性committee_methodology / evaluation_fairnesscommittee_logic / claims_vs_evidence取平均;差距 > 2 时标记
再现性committee_methodology / evaluation_fairness直接使用
新颖性committee_theorycommittee_literature / prior_art直接使用
意义committee_theory / committee_literature直接使用
4 维 NeurIPS(质量、清晰度、重要性、原创性)0阶段脚本直接使用(客观、基于演绎)

4. 决策矩阵

对于审阅模式(咨询)

共识平均分(ScholarEval 9 维)推荐典型动作
对关键缺陷达成共识任何拒绝需要进行根本性返工
全体共识,无批判>= 7.0接受最多进行小修改
全体共识,无批判5.0 - 6.9修改并重新提交解决具体的弱点
全体共识,无批判< 5.0拒绝重大质量问题
多数共识>= 7.0有条件接受解决大多数人关心的问题
多数共识5.0 - 6.9重大修订需要进行实质性修改
多数共识< 5.0拒绝多个严重问题
分裂>= 7.0讨论突出分歧的领域
分裂< 7.0重大修订谨慎行事是错误的

对于 4 维量表 (1-6)

总分标签解释
5.5 - 6.0卓越的顶级品质,准备提交
4.5 - 5.4强的仅小问题
3.5 - 4.4足够的值得注意的问题,建议修改
2.5 - 3.4虚弱的需要进行重大修改
1.0 - 2.4不足的根本问题

5. 报告信心指标

综合代理应表明对最终评估的信心:

指标何时使用
高置信度大多数发现均达成共识,分数差异小,证据明确
中等置信度多数意见一致,但有一些分歧,分数差距适中
低信心多项 SPLIT 研究结果、分数差异较大、证据有限

将置信度指标纳入最终报告的总体评估部分。


6. 边缘情况

当所有审阅者错过自动发现时

没有代理审阅者处理的第 0 阶段自动发现结果应逐字包含在最终报告中。不要仅仅因为代理没有评论就压制自动发现的结果。

当代理发现自动化数据矛盾时

如果代理审阅者的评估与客观的自动化数据相矛盾(例如,代理说“引文已完成”,但 BIB 模块发现未定义的参考文献),则自动数据优先考虑事实问题。

当审稿人标记 CRITICAL 级问题时

CRITICAL 级发现会归一化为 major + gate_blocker=true,即使其他审稿人不同意也不会被压制。它们必须出现在最终报告中,并在修订路线图中作为优先级 1 予以解决。综合代理可以注明其他审稿人不同意,但发现本身必须保留。

基于 MIT 许可发布