ScholarEval 9 维评分指南
ScholarEval是该技能的审阅者风格评分标准的内部名称。 以下维度遵循 OpenReview / NeurIPS / ICLR 中使用的标准 审稿人表格——它们不是源自 arXiv:2510.16234,其 “ScholarEval”框架仅在两个维度上对_研究想法_进行评分 (健全性+贡献)。只有文学基础受此启发 论文的文献基础思想。不要引用 arXiv:2510.16234 作为来源 完整的标题。
概述
该评分标准涵盖 8 个维度的学术论文评分以及计算得出的总体评分 (共 9 个)使用混合脚本 + LLM 方法。基于脚本的尺寸使用 自动问题检测;基于法学硕士的维度需要阅读全文。
尺寸重量定义一次scripts/scholar_eval.py (SCHOLAR_EVAL_DIMENSIONS);下面的百分比反映了该来源。
方面
1. 健全性(18%,脚本)
它衡量什么:技术正确性、逻辑有效性、得到充分支持的主张。
评分标准:
| 分数 | 描述 |
|---|---|
| 9-10 | 逻辑无误,所有主张均得到严格支持 |
| 7-8 | 方法论健全,差距较小 |
| 5-6 | 一些逻辑问题或不受支持的主张 |
| 3-4 | 重大方法论问题 |
| 1-2 | 基本逻辑错误 |
脚本来源:逻辑模块问题的推论。
2. 清晰度(13%,脚本)
衡量的是什么:写作质量、可读性、组织性。
评分标准:
| 分数 | 描述 |
|---|---|
| 9-10 | 语言异常清晰、条理清晰、精确 |
| 7-8 | 写作清晰,有轻微语法/风格问题 |
| 5-6 | 可读,但有明显的风格问题 |
| 3-4 | 难以理解,严重的语言问题 |
| 1-2 | 难以理解或严重混乱 |
脚本来源:从GRAMMAR、SENTENCES、FORMAT、DEAI模块推导。
3. 演示(8%,脚本)
衡量的内容:视觉质量、图形/表格清晰度、参考完整性。
评分标准:
| 分数 | 描述 |
|---|---|
| 9-10 | 专业的数据、完美的参考、简洁的布局 |
| 7-8 | 良好的演示,但存在一些小问题 |
| 5-6 | 一些图/参考问题 |
| 3-4 | 视觉质量差,参考文献损坏 |
| 1-2 | 缺少数字,大量损坏的参考资料 |
脚本来源:来自图形、视觉、参考模块的推论。
4.新颖性(13%,法学硕士)
它衡量什么:贡献的原创性,与之前工作的区别。
LLM评估提示(在SKILL.md中使用):
评价本文的新颖性。考虑:
- 该方法与现有方法有何不同?
- 这些贡献是真正的新贡献还是增量贡献?
- 这篇论文是否清楚地阐明了什么是新颖的?
评分标准:
| 分数 | 描述 |
|---|---|
| 9-10 | 范式转变的贡献 |
| 7-8 | 显着的新颖性,明显超越现有技术 |
| 5-6 | 中等新颖性,与现有工作有一些重叠 |
| 3-4 | 大部分是渐进式的,差异化有限 |
| 1-2 | 没有新意,重复已知的方法 |
5. 意义(13%,法学硕士)
它衡量什么:对现场的潜在影响、社区利益。
评分标准:
| 分数 | 描述 |
|---|---|
| 9-10 | 可能重塑该领域 |
| 7-8 | 高影响力,解决重要问题 |
| 5-6 | 影响中等,贡献有用 |
| 3-4 | 影响有限,利基应用 |
| 1-2 | 影响可以忽略不计 |
6. 再现性(8%,混合)
它测量什么:其他人可以重现结果吗?
脚本组件:检查逻辑模块中与方法相关的问题。 LLM 组件:评估实验描述的完整性、代码/数据的可用性。
评分标准:
| 分数 | 描述 |
|---|---|
| 9-10 | 完整的代码、数据和详细的方法论 |
| 7-8 | 足够的细节,可以通过一些努力来再现 |
| 5-6 | 存在关键细节,但存在差距 |
| 3-4 | 难以重现,缺少关键信息 |
| 1-2 | 无法仅从论文中复制 |
7. 道德(5%,法学硕士)
衡量的内容:道德考虑、利益冲突、数据隐私。
评分标准:
| 分数 | 描述 |
|---|---|
| 9-10 | 彻底的道德讨论,无忧无虑 |
| 7-8 | 充分的道德考虑 |
| 5-6 | 一些道德方面被忽视 |
| 3-4 | 尚未解决的显着道德问题 |
| 1-2 | 严重违反道德规范 |
8. 文学基础(12%,混合)——v3.0 中的新功能
它衡量什么:论文在现有文献中的基础和定位有多好。
脚本组件:自动文献搜索覆盖率分析literature_compare.py. LLM 部分:领域审稿人的定性文献评估。
要求:--literature-search脚本组件的标志。
评分标准:
| 分数 | 描述 |
|---|---|
| 9-10 | 覆盖全面、专题组织、差距推导清晰 |
| 7-8 | 覆盖牢固,间隙较小,组织充分 |
| 5-6 | 覆盖合理但差距明显,差距识别能力弱 |
| 3-4 | 覆盖不完整,列举而非专题 |
| 1-2 | 很少或没有文献综述 |
看references/LITERATURE_GROUNDING_GUIDE.md详细评分标准。
9. 总体(10%,计算得出)
所有可用维度得分的加权平均值,针对缺失值进行归一化。
出版准备量表
| 分数 | 标签 | 意义 |
|---|---|---|
| 9.0+ | 强烈接受 | 准备提交顶级期刊或会议 |
| 8.0-8.9 | 接受 | 充满信心地准备出版 |
| 7.0-7.9 | 小修改 | 解决小问题后准备就绪 |
| 6.0-6.9 | 主要修订 | 需要重大改进 |
| 5.0-5.9 | 重大返工 | 需要进行实质性修改 |
| <5.0 | 未准备好 | 不适合提交 |
推演规则(脚本维度)
自动检查检测到的问题会从 10 分起降低分数:
| 严重性 | 扣除 |
|---|---|
| 批判的 | -2.5 |
| 主要的 | -1.25 |
| 次要的 | -0.5 |
最低分数为 1.0(下限)。
LLM评估JSON格式
使用时--llm-json,提供具有以下结构的文件:
{
"novelty": {
"score": 7.5,
"evidence": "The paper introduces a novel attention mechanism..."
},
"significance": {
"score": 8.0,
"evidence": "Addresses a critical gap in real-time processing..."
},
"reproducibility_llm": {
"score": 6.5,
"evidence": "Code is promised but not yet released..."
},
"ethics": {
"score": 9.0,
"evidence": "No ethical concerns identified..."
}
}与 NeurIPS 4 维评分的关系
ScholarEval 是对现有 4 维 NeurIPS 评分的补充:
- NeurIPS:质量、清晰度、重要性、原创性(1-6 级)
- ScholarEval:8 个评分维度 + 总体计算(1-10 等级)
两个系统独立运行并并排出现在报告中。 使用以下命令启用 ScholarEval--scholar-eval旗帜。