Skip to content

文学基础评分指南

ScholarEval v3.0 的新第九个维度:评估论文基于现有文献的程度。

概述

文献基础衡量论文的以下程度:

  1. 全面涵盖相关的前期工作
  2. 引用该领域的最新发展
  3. 相对于现有文献准确定位自己
  4. 识别并填补真正的研究空白

评分标准 (1-10)

分数组成部分

文学基础使用混合来源(脚本+法学硕士):

  • 脚本组件(来自literature_compare.py):自动覆盖率分析

    • 覆盖率(搜索结果中找到的被引论文)
    • 新近度分数(近期引用论文的分数)
    • 缺少参考文献的处罚
    • 新鲜度分布
  • 法学硕士组成部分(来自领域评审员):定性评估

    • 专题组织质量
    • 批判性分析深度
    • 研究差距推导
    • 引文上下文准确性

评分标准

分数等级行为指标
9-10出色的全面覆盖开创性和近期的作品;按主题组织;清晰的间隙推导;没有重要的遗漏参考文献
7-8好的覆盖牢固,间隙较小;主要是主题组织;充分的差距识别; 1-2 缺失近期论文
5-6公平的覆盖范围合理,但差距明显;一些列举而不是主题分析;弱间隙推导;一些缺失的参考文献
3-4贫穷的覆盖不完整;主要是列举;没有明确的间隙推导;许多重要的参考文献缺失
1-2失败最少的文献综述;关键基础工程缺失;文学和贡献之间没有联系

脚本分数计算

脚本组件(compute_literature_grounding_score) 使用这些权重:

因素重量描述
覆盖率40%cited_and_found / total_found——越高越好
新近度20%过去 3 年结果的比例
缺少裁判判罚30%处罚found_not_cited重要论文
新鲜10%出版年份分布

LLM评估提示

评估本文的文献基础。考虑:

  • 论文是否引用了具有正确归属的基础著作?
  • 是否涵盖了过去 3 年的关键论文?
  • 文献是否按主题组织并进行批判性分析?
  • 文献与本文的贡献之间是否存在明显的研究差距?
  • 相关工作部分是否有明显遗漏?

合并规则

当两者都可用时,最终得分 = 平均值(script_partial,llm_score)。 当只有一个来源有数据时,请使用可用的选项。

与域审阅者的关系

Domain Reviewer代理通过其现有的文献评估标准(A1-A4)提供文学基础的LLM组成部分:

  • A1:主题组织与列举组织
  • A2:批判性分析完整性
  • A3:研究差距推导
  • A4:引文密度漏斗

一体化

  • CLI 标志:--literature-search启用脚本组件
  • 没有--literature-search,文献基础显示“N/A(等待文献检索)”
  • 在审阅模式下,领域审阅者始终提供 LLM 组件

基于 MIT 许可发布