论文审核质量准则
两个审计评分系统的描述性评分锚点。 使用这些评分标准来校准分数并将其映射到编辑决策。
4 维 NeurIPS 式量表 (1.0 - 6.0)
基本分数:6.0,每期扣除(严重 -1.5,主要 -0.75,次要 -0.25)。楼层:1.0。
质量(重量:30%)
主要检查:LOGIC、BIB、GBT7714
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 5.5 - 6.0 | 卓越的 | 技术上完美无缺;严格的证明或实验;所有主张都有证据支持;没有逻辑间隙 |
| 4.5 - 5.4 | 强的 | 方法合理,差距较小;足够的基线和消融;主张大多得到支持 |
| 3.5 - 4.4 | 足够的 | 总体来说不错,但也有明显的弱点;有些说法缺乏足够的证据;轻微的逻辑不一致 |
| 2.5 - 3.4 | 虚弱的 | 重大的方法论问题;多项主张没有得到支持;逻辑差距破坏了核心论点 |
| 1.0 - 2.4 | 不足的 | 推理或方法上的根本错误;关键证据缺失;结论不支持 |
净度(权重:30%)
主要检查:格式、语法、句子、一致性、参考文献、视觉、数字、DEAI
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 5.5 - 6.0 | 卓越的 | 字迹清晰晶莹;完美的格式;所有图表均经过精心设计和参考;没有语法问题 |
| 4.5 - 5.4 | 强的 | 文字清晰,有轻微格式问题;数字可读;偶尔出现语法或风格问题 |
| 3.5 - 4.4 | 足够的 | 总体可以理解,但有些部分不清楚;一些格式不一致;存在语法错误 |
| 2.5 - 3.4 | 虚弱的 | 经常不清楚;严重的格式问题;许多语法错误;人物设计不佳 |
| 1.0 - 2.4 | 不足的 | 非常难以遵循;普遍存在的格式问题;语法错误妨碍理解 |
显着性(权重:20%)
主要检查:逻辑、清单
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 5.5 - 6.0 | 卓越的 | 解决一个关键问题;结果大大推动了该领域的发展;广泛的影响潜力 |
| 4.5 - 5.4 | 强的 | 具有有意义结果的重要问题;对该领域的明确贡献 |
| 3.5 - 4.4 | 足够的 | 合理的问题;结果提供增量贡献;更广泛的影响有限 |
| 2.5 - 3.4 | 虚弱的 | 问题意义不明确;结果是边际的或适用范围狭窄 |
| 1.0 - 2.4 | 不足的 | 琐碎的问题或结果;对该领域没有明显的贡献 |
原创性(权重:20%)
主要检查:DEAI、CHECKLIST
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 5.5 - 6.0 | 卓越的 | 新颖的框架或范式;开辟新的研究方向;极具创意的方法 |
| 4.5 - 5.4 | 强的 | 新颖的方法或重要的新应用;与之前的工作明显不同 |
| 3.5 - 4.4 | 足够的 | 现有工作的增量扩展;一些新颖的元素,但很大程度上建立在已知的方法之上 |
| 2.5 - 3.4 | 虚弱的 | 现有方法的微小变化;与之前的工作相比,新颖性有限 |
| 1.0 - 2.4 | 不足的 | 没有明显的新颖性;似乎复制了现有的工作而没有有意义的扩展 |
决策图(4 维)
| 总分 | 推荐 | 典型的后续步骤 |
|---|---|---|
| >= 5.5 | 强烈接受 | 充满信心地提交;仅轻微抛光 |
| 4.5 - 5.4 | 接受 | 解决相机就绪版本中的小问题 |
| 3.5 - 4.4 | 边缘接受 | 修改并重新提交;遵循修订路线图 |
| 2.5 - 3.4 | 边缘拒绝 | 需要重大修订周期;重新考虑方法 |
| 1.5 - 2.4 | 拒绝 | 需要进行根本性返工 |
| 1.0 - 1.4 | 强烈拒绝 | 重新考虑研究方向或方法 |
9 维学者评估量表 (1.0 - 10.0)
8 个评分维度加上计算得出的总体评分。权重反映单一来源 在scripts/scholar_eval.py (SCHOLAR_EVAL_DIMENSIONS).
基本分数:10.0,每期扣除(严重 -2.5,主要 -1.25,次要 -0.5)。楼层:1.0。
健全性(权重:18%,来源:脚本)
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 9.0 - 10.0 | 出色的 | 所有主张均得到严格支持;没有逻辑间隙;统计方法适当且应用广泛 |
| 7.0 - 8.9 | 好的 | 主张大部分得到支持;较小的逻辑差距;适当的方法,但问题不大 |
| 5.0 - 6.9 | 公平的 | 一些主张缺乏支持;明显的方法论弱点;一些统计问题 |
| 3.0 - 4.9 | 贫穷的 | 主要主张不予支持;重大方法缺陷;统计方法不当 |
| 1.0 - 2.9 | 失败 | 基本逻辑错误;方法无效;结论没有证据支持 |
清晰度(权重:13%,来源:脚本)
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 9.0 - 10.0 | 出色的 | 写得特别好;组织完美;所有符号一致且定义明确 |
| 7.0 - 8.9 | 好的 | 字迹清晰;组织良好;轻微的符号或术语不一致 |
| 5.0 - 6.9 | 公平的 | 总体清晰,但有些部分令人困惑;组织可以改进;几个风格问题 |
| 3.0 - 4.9 | 贫穷的 | 经常不清楚;组织不善;术语不一致阻碍理解 |
| 1.0 - 2.9 | 失败 | 非常难以理解;杂乱无章;普遍存在的写作问题 |
演示(权重:8%,来源:脚本)
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 9.0 - 10.0 | 出色的 | 专业布局;所有数字/表格均可出版;整个格式一致 |
| 7.0 - 8.9 | 好的 | 良好的布局;数字清晰;轻微的格式不一致 |
| 5.0 - 6.9 | 公平的 | 可接受的布局;一些数字不清楚或标记不当;存在格式问题 |
| 3.0 - 4.9 | 贫穷的 | 重大布局问题;数字难以阅读;整个格式不一致 |
| 1.0 - 2.9 | 失败 | 不专业的演示;数字缺失或难以辨认;主要格式问题 |
新颖性(权重:13%,来源:LLM)
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 9.0 - 10.0 | 出色的 | 开创性的贡献;全新的方法或框架;范式转变的潜力 |
| 7.0 - 8.9 | 好的 | 明显新颖的方法;与之前的工作有明显区别;创意解决方案 |
| 5.0 - 6.9 | 公平的 | 增量新颖性;以合理的方式扩展现有方法;一些创意元素 |
| 3.0 - 4.9 | 贫穷的 | 边际新颖性;现有工作的微小变化;不清楚这将如何推动该领域的发展 |
| 1.0 - 2.9 | 失败 | 没有明显的新颖性;重复现有工作,但没有做出有意义的贡献 |
显着性(权重:13%,来源:LLM)
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 9.0 - 10.0 | 出色的 | 解决关键问题;研究结果将影响多个研究领域;高实际影响 |
| 7.0 - 8.9 | 好的 | 重要问题;有意义的结果;对目标社区产生明显影响 |
| 5.0 - 6.9 | 公平的 | 合理的问题;结果逐渐贡献;更广泛的影响有限 |
| 3.0 - 4.9 | 贫穷的 | 问题的重要性值得怀疑;结果适用范围狭窄;预期影响最小 |
| 1.0 - 2.9 | 失败 | 琐碎或不相关的问题;没有实用价值的结果 |
重现性(权重:8%,来源:混合)
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 9.0 - 10.0 | 出色的 | 代码和数据公开;记录所有超参数;提供完整的实验方案 |
| 7.0 - 8.9 | 好的 | 可用或承诺的代码;提供了大部分详细信息;通过合理的努力可能会重现 |
| 5.0 - 6.9 | 公平的 | 缺少一些细节;代码不可用;繁殖需要付出巨大的努力 |
| 3.0 - 4.9 | 贫穷的 | 主要细节缺失;没有代码或数据;繁殖非常困难 |
| 1.0 - 2.9 | 失败 | 细节不足,无法重现;没有工件;关键信息被隐瞒 |
道德(权重:5%,来源:法学硕士)
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 9.0 - 10.0 | 出色的 | 彻底的道德讨论;解决所有问题;必要时记录 IRB/同意书 |
| 7.0 - 8.9 | 好的 | 道德得到认可;解决的主要问题;讨论中的微小差距 |
| 5.0 - 6.9 | 公平的 | 有限的道德讨论;一些问题没有得到解决;未充分探讨潜在问题 |
| 3.0 - 4.9 | 贫穷的 | 道德在很大程度上被忽视;重大关切尚未得到解决;未讨论潜在危害 |
| 1.0 - 2.9 | 失败 | 没有道德考虑;明显违反道德规范;潜在的重大伤害 |
文献基础(权重:12%,来源:混合)——v3.0 中的新功能
| 分数范围 | 等级 | 行为指标 |
|---|---|---|
| 9.0 - 10.0 | 出色的 | 全面覆盖开创性和近期的作品;专题组织;清晰的间隙推导;没有重要的遗漏参考文献 |
| 7.0 - 8.9 | 好的 | 覆盖牢固;主要是主题组织;充分的差距识别;微小的差距 |
| 5.0 - 6.9 | 公平的 | 合理但显着的差距;一些枚举;弱间隙推导;最近几篇失踪的论文 |
| 3.0 - 4.9 | 贫穷的 | 覆盖不完整;主要是列举;许多重要的参考文献缺失 |
| 1.0 - 2.9 | 失败 | 最少的文献综述;基础工程缺失;没有文献贡献联系 |
总体(权重:10%,来源:计算得出)
所有非空维度的加权平均值,按可用总重量标准化。
决策图(ScholarEval)
| 总分 | 准备就绪标签 | 推荐 |
|---|---|---|
| >= 9.0 | 强烈接受 | 为顶级期刊或会议做好准备 |
| 8.0 - 8.9 | 接受 | 出版准备就绪 |
| 7.0 - 7.9 | 准备好进行小修改 | 提交前解决小问题 |
| 6.0 - 6.9 | 需要重大修改 | 需要大量返工 |
| 5.0 - 5.9 | 需要大量返工 | 需要根本性改进 |
| < 5.0 | 未准备好 | 重新考虑方法和方法 |
校准注意事项
- 分数与目标期刊或会议的标准相关。 NeurIPS 的 7.0 分代表着比区域研讨会的 7.0 分更高的绝对质量。
- 什么时候
--venue指定后,根据该期刊或会议的验收标准解释分数。 - 基于脚本的分数在清晰度和演示维度上最强;新颖性和重要性最弱(这些需要法学硕士的判断)。
- 如果脚本和 LLM 分数在同一维度上相差超过 2 分,请在报告中标记此差异。
- 4 维 (1-6) 和 9 维 (1-10) 系统是互补的。 4 维系统提供快速概览; 9 维 ScholarEval 提供更深入的分析。