Skip to content

论文审核质量准则

两个审计评分系统的描述性评分锚点。 使用这些评分标准来校准分数并将其映射到编辑决策。


4 维 NeurIPS 式量表 (1.0 - 6.0)

基本分数:6.0,每期扣除(严重 -1.5,主要 -0.75,次要 -0.25)。楼层:1.0。

质量(重量:30%)

主要检查:LOGIC、BIB、GBT7714

分数范围等级行为指标
5.5 - 6.0卓越的技术上完美无缺;严格的证明或实验;所有主张都有证据支持;没有逻辑间隙
4.5 - 5.4强的方法合理,差距较小;足够的基线和消融;主张大多得到支持
3.5 - 4.4足够的总体来说不错,但也有明显的弱点;有些说法缺乏足够的证据;轻微的逻辑不一致
2.5 - 3.4虚弱的重大的方法论问题;多项主张没有得到支持;逻辑差距破坏了核心论点
1.0 - 2.4不足的推理或方法上的根本错误;关键证据缺失;结论不支持

净度(权重:30%)

主要检查:格式、语法、句子、一致性、参考文献、视觉、数字、DEAI

分数范围等级行为指标
5.5 - 6.0卓越的字迹清晰晶莹;完美的格式;所有图表均经过精心设计和参考;没有语法问题
4.5 - 5.4强的文字清晰,有轻微格式问题;数字可读;偶尔出现语法或风格问题
3.5 - 4.4足够的总体可以理解,但有些部分不清楚;一些格式不一致;存在语法错误
2.5 - 3.4虚弱的经常不清楚;严重的格式问题;许多语法错误;人物设计不佳
1.0 - 2.4不足的非常难以遵循;普遍存在的格式问题;语法错误妨碍理解

显着性(权重:20%)

主要检查:逻辑、清单

分数范围等级行为指标
5.5 - 6.0卓越的解决一个关键问题;结果大大推动了该领域的发展;广泛的影响潜力
4.5 - 5.4强的具有有意义结果的重要问题;对该领域的明确贡献
3.5 - 4.4足够的合理的问题;结果提供增量贡献;更广泛的影响有限
2.5 - 3.4虚弱的问题意义不明确;结果是边际的或适用范围狭窄
1.0 - 2.4不足的琐碎的问题或结果;对该领域没有明显的贡献

原创性(权重:20%)

主要检查:DEAI、CHECKLIST

分数范围等级行为指标
5.5 - 6.0卓越的新颖的框架或范式;开辟新的研究方向;极具创意的方法
4.5 - 5.4强的新颖的方法或重要的新应用;与之前的工作明显不同
3.5 - 4.4足够的现有工作的增量扩展;一些新颖的元素,但很大程度上建立在已知的方法之上
2.5 - 3.4虚弱的现有方法的微小变化;与之前的工作相比,新颖性有限
1.0 - 2.4不足的没有明显的新颖性;似乎复制了现有的工作而没有有意义的扩展

决策图(4 维)

总分推荐典型的后续步骤
>= 5.5强烈接受充满信心地提交;仅轻微抛光
4.5 - 5.4接受解决相机就绪版本中的小问题
3.5 - 4.4边缘接受修改并重新提交;遵循修订路线图
2.5 - 3.4边缘拒绝需要重大修订周期;重新考虑方法
1.5 - 2.4拒绝需要进行根本性返工
1.0 - 1.4强烈拒绝重新考虑研究方向或方法

9 维学者评估量表 (1.0 - 10.0)

8 个评分维度加上计算得出的总体评分。权重反映单一来源 在scripts/scholar_eval.py (SCHOLAR_EVAL_DIMENSIONS).

基本分数:10.0,每期扣除(严重 -2.5,主要 -1.25,次要 -0.5)。楼层:1.0。

健全性(权重:18%,来源:脚本)

分数范围等级行为指标
9.0 - 10.0出色的所有主张均得到严格支持;没有逻辑间隙;统计方法适当且应用广泛
7.0 - 8.9好的主张大部分得到支持;较小的逻辑差距;适当的方法,但问题不大
5.0 - 6.9公平的一些主张缺乏支持;明显的方法论弱点;一些统计问题
3.0 - 4.9贫穷的主要主张不予支持;重大方法缺陷;统计方法不当
1.0 - 2.9失败基本逻辑错误;方法无效;结论没有证据支持

清晰度(权重:13%,来源:脚本)

分数范围等级行为指标
9.0 - 10.0出色的写得特别好;组织完美;所有符号一致且定义明确
7.0 - 8.9好的字迹清晰;组织良好;轻微的符号或术语不一致
5.0 - 6.9公平的总体清晰,但有些部分令人困惑;组织可以改进;几个风格问题
3.0 - 4.9贫穷的经常不清楚;组织不善;术语不一致阻碍理解
1.0 - 2.9失败非常难以理解;杂乱无章;普遍存在的写作问题

演示(权重:8%,来源:脚本)

分数范围等级行为指标
9.0 - 10.0出色的专业布局;所有数字/表格均可出版;整个格式一致
7.0 - 8.9好的良好的布局;数字清晰;轻微的格式不一致
5.0 - 6.9公平的可接受的布局;一些数字不清楚或标记不当;存在格式问题
3.0 - 4.9贫穷的重大布局问题;数字难以阅读;整个格式不一致
1.0 - 2.9失败不专业的演示;数字缺失或难以辨认;主要格式问题

新颖性(权重:13%,来源:LLM)

分数范围等级行为指标
9.0 - 10.0出色的开创性的贡献;全新的方法或框架;范式转变的潜力
7.0 - 8.9好的明显新颖的方法;与之前的工作有明显区别;创意解决方案
5.0 - 6.9公平的增量新颖性;以合理的方式扩展现有方法;一些创意元素
3.0 - 4.9贫穷的边际新颖性;现有工作的微小变化;不清楚这将如何推动该领域的发展
1.0 - 2.9失败没有明显的新颖性;重复现有工作,但没有做出有意义的贡献

显着性(权重:13%,来源:LLM)

分数范围等级行为指标
9.0 - 10.0出色的解决关键问题;研究结果将影响多个研究领域;高实际影响
7.0 - 8.9好的重要问题;有意义的结果;对目标社区产生明显影响
5.0 - 6.9公平的合理的问题;结果逐渐贡献;更广泛的影响有限
3.0 - 4.9贫穷的问题的重要性值得怀疑;结果适用范围狭窄;预期影响最小
1.0 - 2.9失败琐碎或不相关的问题;没有实用价值的结果

重现性(权重:8%,来源:混合)

分数范围等级行为指标
9.0 - 10.0出色的代码和数据公开;记录所有超参数;提供完整的实验方案
7.0 - 8.9好的可用或承诺的代码;提供了大部分详细信息;通过合理的努力可能会重现
5.0 - 6.9公平的缺少一些细节;代码不可用;繁殖需要付出巨大的努力
3.0 - 4.9贫穷的主要细节缺失;没有代码或数据;繁殖非常困难
1.0 - 2.9失败细节不足,无法重现;没有工件;关键信息被隐瞒

道德(权重:5%,来源:法学硕士)

分数范围等级行为指标
9.0 - 10.0出色的彻底的道德讨论;解决所有问题;必要时记录 IRB/同意书
7.0 - 8.9好的道德得到认可;解决的主要问题;讨论中的微小差距
5.0 - 6.9公平的有限的道德讨论;一些问题没有得到解决;未充分探讨潜在问题
3.0 - 4.9贫穷的道德在很大程度上被忽视;重大关切尚未得到解决;未讨论潜在危害
1.0 - 2.9失败没有道德考虑;明显违反道德规范;潜在的重大伤害

文献基础(权重:12%,来源:混合)——v3.0 中的新功能

分数范围等级行为指标
9.0 - 10.0出色的全面覆盖开创性和近期的作品;专题组织;清晰的间隙推导;没有重要的遗漏参考文献
7.0 - 8.9好的覆盖牢固;主要是主题组织;充分的差距识别;微小的差距
5.0 - 6.9公平的合理但显着的差距;一些枚举;弱间隙推导;最近几篇失踪的论文
3.0 - 4.9贫穷的覆盖不完整;主要是列举;许多重要的参考文献缺失
1.0 - 2.9失败最少的文献综述;基础工程缺失;没有文献贡献联系

总体(权重:10%,来源:计算得出)

所有非空维度的加权平均值,按可用总重量标准化。

决策图(ScholarEval)

总分准备就绪标签推荐
>= 9.0强烈接受为顶级期刊或会议做好准备
8.0 - 8.9接受出版准备就绪
7.0 - 7.9准备好进行小修改提交前解决小问题
6.0 - 6.9需要重大修改需要大量返工
5.0 - 5.9需要大量返工需要根本性改进
< 5.0未准备好重新考虑方法和方法

校准注意事项

  • 分数与目标期刊或会议的标准相关。 NeurIPS 的 7.0 分代表着比区域研讨会的 7.0 分更高的绝对质量。
  • 什么时候--venue指定后,根据该期刊或会议的验收标准解释分数。
  • 基于脚本的分数在清晰度和演示维度上最强;新颖性和重要性最弱(这些需要法学硕士的判断)。
  • 如果脚本和 LLM 分数在同一维度上相差超过 2 分,请在报告中标记此差异。
  • 4 维 (1-6) 和 9 维 (1-10) 系统是互补的。 4 维系统提供快速概览; 9 维 ScholarEval 提供更深入的分析。

基于 MIT 许可发布