编辑决策标准
合成代理的参考文件。定义共识分类、仲裁规则、分数分歧处理和决策映射。
1. 共识标签
| 标签 | 定义 | 临界点 | 处理 |
|---|---|---|---|
[CONSENSUS-ALL] | 全部 N 个审查通道都标记同一问题 | N/N 同意 | 优先级 1 — 作者必须处理 |
[CONSENSUS-MAJORITY] | 超过半数但并非全部通道标记同一问题 | 从 floor(N/2)+1 到 N-1 个通道同意 | 优先级 1 或 2(取决于严重性) |
[SPLIT] | 未形成简单多数——存在根本分歧 | 少于 floor(N/2)+1 个通道同意 | 需要仲裁;记录所有立场 |
[AUTOMATED-ONLY] | 仅阶段 0 脚本发现的问题 | 脚本检测 | 包括原样;脚本的严重性 |
例如,N=3 时多数为 2/3;N=5 时多数为 3/5 或 4/5。
匹配标准
在以下情况下,两个发现被视为“同一问题”:
- 他们引用了论文中的相同位置(部分、图、表),并且
- 他们描述了相同的根本问题(即使措辞不同)
不要匹配仅共享一个类别的调查结果(例如,不同部分中的两个不相关的“过度主张”调查结果是单独的问题)。
2. 仲裁规则
当审阅者不同意(SPLIT)时,综合代理会按照严格的优先顺序使用这些原则来解决:
优先事项 1:证据原则
由具体文本证据(引文、数据点、引文)支持的立场胜过基于一般印象的立场。
示例:committee_methodology 通道说“表 3 显示 p < 0.05”,而 committee_logic 通道说“结果似乎不令人信服”。方法通道有证据支持的立场获胜。
优先事项2:专业原则
对于特定领域的争议,给予相关专家更高的权重:
| 争议类型 | 主要权威 | 基本原理 |
|---|---|---|
| 研究设计、统计 | committee_methodology / evaluation_fairness 通道 | 技术方法专业知识 |
| 文献覆盖面、新颖性 | committee_theory、committee_literature / prior_art 通道 | 领域知识 |
| 逻辑论证,过度主张 | committee_logic / claims_vs_evidence 通道 | 论证专业知识 |
| 跨领域(范围不清楚) | 等重 | 使用证据原则 |
优先事项 3:保守原则
当证据和专业知识达到平衡时,倾向于更谨慎(更挑剔)的评估。理由:标记作者要解决的潜在问题比消除真正的担忧更安全。
文件要求
每个仲裁都必须按以下结构记录:
markdown
#### Arbitration: [Issue Title]
- **Disagreement**: [Concise description]
- **Position A** ([Reviewer]): [Their view, with quote from their report]
- **Position B** ([Reviewer]): [Their view, with quote from their report]
- **Principle Applied**: [Evidence / Expertise / Conservative]
- **Resolution**: [Decision and rationale]
- **Confidence**: [High / Medium / Low]3. 分数差异处理
检测阈值
当两个审阅者对同一维度的评分差距 > 2.0 分时,就会出现分数分歧。
处理协议
| 间隙尺寸 | 行动 |
|---|---|
| <= 1.0 | 直接平均,无需评论 |
| 1.1 - 2.0 | 平均并记录报告中的价差 |
| > 2.0 | 强制解释:调查原因、申请仲裁、记录最终分数的理由 |
大分歧的调查步骤
- 确定哪些具体发现影响了每个评审者的分数
- 检查一位审阅者是否考虑了另一位审阅者错过的证据
- 将仲裁规则(第 2 节)应用于根本分歧
- 根据记录的理由设置最终分数(不要简单地平均)
分数合并表
| 方面 | 主要来源 | 次要来源 | 合并规则 |
|---|---|---|---|
| 健全性 | committee_methodology / evaluation_fairness | committee_logic / claims_vs_evidence | 取平均;差距 > 2 时标记 |
| 再现性 | committee_methodology / evaluation_fairness | — | 直接使用 |
| 新颖性 | committee_theory、committee_literature / prior_art | — | 直接使用 |
| 意义 | committee_theory / committee_literature | — | 直接使用 |
| 4 维 NeurIPS(质量、清晰度、重要性、原创性) | 0阶段脚本 | — | 直接使用(客观、基于演绎) |
4. 决策矩阵
对于审阅模式(咨询)
| 共识 | 平均分(ScholarEval 9 维) | 推荐 | 典型动作 |
|---|---|---|---|
| 对关键缺陷达成共识 | 任何 | 拒绝 | 需要进行根本性返工 |
| 全体共识,无批判 | >= 7.0 | 接受 | 最多进行小修改 |
| 全体共识,无批判 | 5.0 - 6.9 | 修改并重新提交 | 解决具体的弱点 |
| 全体共识,无批判 | < 5.0 | 拒绝 | 重大质量问题 |
| 多数共识 | >= 7.0 | 有条件接受 | 解决大多数人关心的问题 |
| 多数共识 | 5.0 - 6.9 | 重大修订 | 需要进行实质性修改 |
| 多数共识 | < 5.0 | 拒绝 | 多个严重问题 |
| 分裂 | >= 7.0 | 讨论 | 突出分歧的领域 |
| 分裂 | < 7.0 | 重大修订 | 谨慎行事是错误的 |
对于 4 维量表 (1-6)
| 总分 | 标签 | 解释 |
|---|---|---|
| 5.5 - 6.0 | 卓越的 | 顶级品质,准备提交 |
| 4.5 - 5.4 | 强的 | 仅小问题 |
| 3.5 - 4.4 | 足够的 | 值得注意的问题,建议修改 |
| 2.5 - 3.4 | 虚弱的 | 需要进行重大修改 |
| 1.0 - 2.4 | 不足的 | 根本问题 |
5. 报告信心指标
综合代理应表明对最终评估的信心:
| 指标 | 何时使用 |
|---|---|
| 高置信度 | 大多数发现均达成共识,分数差异小,证据明确 |
| 中等置信度 | 多数意见一致,但有一些分歧,分数差距适中 |
| 低信心 | 多项 SPLIT 研究结果、分数差异较大、证据有限 |
将置信度指标纳入最终报告的总体评估部分。
6. 边缘情况
当所有审阅者错过自动发现时
没有代理审阅者处理的第 0 阶段自动发现结果应逐字包含在最终报告中。不要仅仅因为代理没有评论就压制自动发现的结果。
当代理发现自动化数据矛盾时
如果代理审阅者的评估与客观的自动化数据相矛盾(例如,代理说“引文已完成”,但 BIB 模块发现未定义的参考文献),则自动数据优先考虑事实问题。
当审稿人标记 CRITICAL 级问题时
CRITICAL 级发现会归一化为 major + gate_blocker=true,即使其他审稿人不同意也不会被压制。它们必须出现在最终报告中,并在修订路线图中作为优先级 1 予以解决。综合代理可以注明其他审稿人不同意,但发现本身必须保留。