Skip to content

ScholarEval 9 维评分指南

ScholarEval是该技能的审阅者风格评分标准的内部名称。 以下维度遵循 OpenReview / NeurIPS / ICLR 中使用的标准 审稿人表格——它们不是源自 arXiv:2510.16234,其 “ScholarEval”框架仅在两个维度上对_研究想法_进行评分 (健全性+贡献)。只有文学基础受此启发 论文的文献基础思想。不要引用 arXiv:2510.16234 作为来源 完整的标题。

概述

该评分标准涵盖 8 个维度的学术论文评分以及计算得出的总体评分 (共 9 个)使用混合脚本 + LLM 方法。基于脚本的尺寸使用 自动问题检测;基于法学硕士的维度需要阅读全文。

尺寸重量定义一次scripts/scholar_eval.py (SCHOLAR_EVAL_DIMENSIONS);下面的百分比反映了该来源。

方面

1. 健全性(18%,脚本)

它衡量什么:技术正确性、逻辑有效性、得到充分支持的主张。

评分标准

分数描述
9-10逻辑无误,所有主张均得到严格支持
7-8方法论健全,差距较小
5-6一些逻辑问题或不受支持的主张
3-4重大方法论问题
1-2基本逻辑错误

脚本来源:逻辑模块问题的推论。

2. 清晰度(13%,脚本)

衡量的是什么:写作质量、可读性、组织性。

评分标准

分数描述
9-10语言异常清晰、条理清晰、精确
7-8写作清晰,有轻微语法/风格问题
5-6可读,但有明显的风格问题
3-4难以理解,严重的语言问题
1-2难以理解或严重混乱

脚本来源:从GRAMMAR、SENTENCES、FORMAT、DEAI模块推导。

3. 演示(8%,脚本)

衡量的内容:视觉质量、图形/表格清晰度、参考完整性。

评分标准

分数描述
9-10专业的数据、完美的参考、简洁的布局
7-8良好的演示,但存在一些小问题
5-6一些图/参考问题
3-4视觉质量差,参考文献损坏
1-2缺少数字,大量损坏的参考资料

脚本来源:来自图形、视觉、参考模块的推论。

4.新颖性(13%,法学硕士)

它衡量什么:贡献的原创性,与之前工作的区别。

LLM评估提示(在SKILL.md中使用):

评价本文的新颖性。考虑:

  • 该方法与现有方法有何不同?
  • 这些贡献是真正的新贡献还是增量贡献?
  • 这篇论文是否清楚地阐明了什么是新颖的?

评分标准

分数描述
9-10范式转变的贡献
7-8显着的新颖性,明显超越现有技术
5-6中等新颖性,与现有工作有一些重叠
3-4大部分是渐进式的,差异化有限
1-2没有新意,重复已知的方法

5. 意义(13%,法学硕士)

它衡量什么:对现场的潜在影响、社区利益。

评分标准

分数描述
9-10可能重塑该领域
7-8高影响力,解决重要问题
5-6影响中等,贡献有用
3-4影响有限,利基应用
1-2影响可以忽略不计

6. 再现性(8%,混合)

它测量什么:其他人可以重现结果吗?

脚本组件:检查逻辑模块中与方法相关的问题。 LLM 组件:评估实验描述的完整性、代码/数据的可用性。

评分标准

分数描述
9-10完整的代码、数据和详细的方法论
7-8足够的细节,可以通过一些努力来再现
5-6存在关键细节,但存在差距
3-4难以重现,缺少关键信息
1-2无法仅从论文中复制

7. 道德(5%,法学硕士)

衡量的内容:道德考虑、利益冲突、数据隐私。

评分标准

分数描述
9-10彻底的道德讨论,无忧无虑
7-8充分的道德考虑
5-6一些道德方面被忽视
3-4尚未解决的显着道德问题
1-2严重违反道德规范

8. 文学基础(12%,混合)——v3.0 中的新功能

它衡量什么:论文在现有文献中的基础和定位有多好。

脚本组件:自动文献搜索覆盖率分析literature_compare.py. LLM 部分:领域审稿人的定性文献评估。

要求--literature-search脚本组件的标志。

评分标准

分数描述
9-10覆盖全面、专题组织、差距推导清晰
7-8覆盖牢固,间隙较小,组织充分
5-6覆盖合理但差距明显,差距识别能力弱
3-4覆盖不完整,列举而非专题
1-2很少或没有文献综述

references/LITERATURE_GROUNDING_GUIDE.md详细评分标准。

9. 总体(10%,计算得出)

所有可用维度得分的加权平均值,针对缺失值进行归一化。

出版准备量表

分数标签意义
9.0+强烈接受准备提交顶级期刊或会议
8.0-8.9接受充满信心地准备出版
7.0-7.9小修改解决小问题后准备就绪
6.0-6.9主要修订需要重大改进
5.0-5.9重大返工需要进行实质性修改
<5.0未准备好不适合提交

推演规则(脚本维度)

自动检查检测到的问题会从 10 分起降低分数:

严重性扣除
批判的-2.5
主要的-1.25
次要的-0.5

最低分数为 1.0(下限)。

LLM评估JSON格式

使用时--llm-json,提供具有以下结构的文件:

json
{
  "novelty": {
    "score": 7.5,
    "evidence": "The paper introduces a novel attention mechanism..."
  },
  "significance": {
    "score": 8.0,
    "evidence": "Addresses a critical gap in real-time processing..."
  },
  "reproducibility_llm": {
    "score": 6.5,
    "evidence": "Code is promised but not yet released..."
  },
  "ethics": {
    "score": 9.0,
    "evidence": "No ethical concerns identified..."
  }
}

与 NeurIPS 4 维评分的关系

ScholarEval 是对现有 4 维 NeurIPS 评分的补充

  • NeurIPS:质量、清晰度、重要性、原创性(1-6 级)
  • ScholarEval:8 个评分维度 + 总体计算(1-10 等级)

两个系统独立运行并并排出现在报告中。 使用以下命令启用 ScholarEval--scholar-eval旗帜。

基于 MIT 许可发布