文学基础评分指南
ScholarEval v3.0 的新第九个维度:评估论文基于现有文献的程度。
概述
文献基础衡量论文的以下程度:
- 全面涵盖相关的前期工作
- 引用该领域的最新发展
- 相对于现有文献准确定位自己
- 识别并填补真正的研究空白
评分标准 (1-10)
分数组成部分
文学基础使用混合来源(脚本+法学硕士):
脚本组件(来自
literature_compare.py):自动覆盖率分析- 覆盖率(搜索结果中找到的被引论文)
- 新近度分数(近期引用论文的分数)
- 缺少参考文献的处罚
- 新鲜度分布
法学硕士组成部分(来自领域评审员):定性评估
- 专题组织质量
- 批判性分析深度
- 研究差距推导
- 引文上下文准确性
评分标准
| 分数 | 等级 | 行为指标 |
|---|---|---|
| 9-10 | 出色的 | 全面覆盖开创性和近期的作品;按主题组织;清晰的间隙推导;没有重要的遗漏参考文献 |
| 7-8 | 好的 | 覆盖牢固,间隙较小;主要是主题组织;充分的差距识别; 1-2 缺失近期论文 |
| 5-6 | 公平的 | 覆盖范围合理,但差距明显;一些列举而不是主题分析;弱间隙推导;一些缺失的参考文献 |
| 3-4 | 贫穷的 | 覆盖不完整;主要是列举;没有明确的间隙推导;许多重要的参考文献缺失 |
| 1-2 | 失败 | 最少的文献综述;关键基础工程缺失;文学和贡献之间没有联系 |
脚本分数计算
脚本组件(compute_literature_grounding_score) 使用这些权重:
| 因素 | 重量 | 描述 |
|---|---|---|
| 覆盖率 | 40% | cited_and_found / total_found——越高越好 |
| 新近度 | 20% | 过去 3 年结果的比例 |
| 缺少裁判判罚 | 30% | 处罚found_not_cited重要论文 |
| 新鲜 | 10% | 出版年份分布 |
LLM评估提示
评估本文的文献基础。考虑:
- 论文是否引用了具有正确归属的基础著作?
- 是否涵盖了过去 3 年的关键论文?
- 文献是否按主题组织并进行批判性分析?
- 文献与本文的贡献之间是否存在明显的研究差距?
- 相关工作部分是否有明显遗漏?
合并规则
当两者都可用时,最终得分 = 平均值(script_partial,llm_score)。 当只有一个来源有数据时,请使用可用的选项。
与域审阅者的关系
Domain Reviewer代理通过其现有的文献评估标准(A1-A4)提供文学基础的LLM组成部分:
- A1:主题组织与列举组织
- A2:批判性分析完整性
- A3:研究差距推导
- A4:引文密度漏斗
一体化
- CLI 标志:
--literature-search启用脚本组件 - 没有
--literature-search,文献基础显示“N/A(等待文献检索)” - 在审阅模式下,领域审阅者始终提供 LLM 组件