中文论文 AI 写作高频词 — 参考词表
本文档列出中文学位论文中最容易暴露 AI 写作痕迹的高频词, 并给出推荐的"每篇出现次数上限"。配套文件 tone-thresholds.yaml 是 deai_check.py 实际读取的权威配置;本文件仅作设计说明。
阈值如何生效
deai_check.py启动时读取tone-thresholds.yaml。term_thresholds:中每个词,单篇可见正文(经 parser 抽取,剥离引用、 公式、注释后)出现次数超过阈值即触发一次[Script] LOW痕迹。- 中文不分词,按字符串 substring 计数。
- 阈值修改在 yaml 中进行;本文件不被代码读取。
维护节律(本词表是快照,不是终态)
本词表记录的是当前的 AI 写作高频词,而非永久不变的真理。随着"赋能""彰显" 等词被广泛点名,有意识的作者会主动过滤、其频率随之下降;同时新的 AI 偏好词 持续涌现。建议每半年参考 excess-vocabulary 类研究复审一次,按需增删, 不要当成冻结清单。
- 上次复审:2026-06
- 来源:Kobak et al., Sci. Adv. 2025;Geng & Trotta 2025
高频 AI 中文连接词
这些词不是禁词,少量使用是必要的。阈值代表"再多评审就会觉得套路化"的临界值。
| 词 | 阈值 | 备注 |
|---|---|---|
| 首先 | 4 | 议论开头模板的标志词 |
| 其次 | 4 | 与"首先"成对,常被堆叠 |
| 然而 | 5 | 转折滥用,常常没有真正的转折语义 |
| 此外 | 4 | 补充连接词,常用于堆砌 |
| 因此 | 6 | 推理结论标志,可保留更多 |
| 另外 | 3 | 与"此外"功能重复,建议合并 |
| 进而 | 3 | AI 偏爱的递进词 |
| 而且 | 4 | 与"并且"功能重复 |
| 显然 | 3 | 越自然的语境越不需要这个词 |
| 通常 | 4 | 模糊频率,可量化时建议替换 |
| 一般 | 5 | 比"通常"更弱 |
| 尤其 | 3 | 强调词,AI 喜用 |
内容模板词
| 词 | 阈值 | 备注 |
|---|---|---|
| 显著 | 5 | 通常缺 p 值或效应量支撑 |
| 全面 | 3 | 单一研究难以"全面" |
| 深入 | 3 | 营销语言 |
| 大量 | 3 | 模糊量词 |
| 众多 | 3 | 模糊量词 |
| 重要 | 5 | 解释清楚何为"重要" |
| 关键 | 5 | 同上 |
| 核心 | 4 | 一篇论文不该出现太多"核心" |
| 基本 | 4 | 含糊 |
| 主要 | 5 | 含糊 |
| 最为 | 3 | 最高级修辞 |
| 极为 | 3 | 最高级修辞 |
| 尤为 | 3 | 最高级修辞 |
段落首字重复(burstiness)
连续 3 段以相同的前 4 个中文字符开头时触发。典型情况:
- "本节首先..." / "本节首先..." / "本节首先..."
- "为了进一步..." / "为了进一步..." / "为了进一步..."
- "在本章中..." / "在本章中..." / "在本章中..."
修复方法:把至少一段重写为不同的句法形态(前置状语、对比连接、问题句)。
段首清嗓子(throat clearing)
段落第一条非空可见行匹配以下模式即触发:
- 综上所述 / 总而言之 / 总的来说 / 由此可见
- 值得指出的是 / 值得注意的是 / 需要指出的是 / 需要说明的是
- 不难发现 / 不难看出 / 众所周知 / 毋庸讳言
- 「首先,」「其次,」「然而,」「此外,」开头
- 一方面 / 另一方面
每个触发记一次 [Script] LOW。
标点模式
- 整篇 "——" 数量超过
max_em_dashes_per_doc时,在首次出现处记一次聚合痕迹。 - 中文 "!" 或英文 "!" 出现在正文章节(摘要至结论之间)时,每次记一条痕迹。 公式、代码、注释被剥离不计。
不在本表中的内容
- 句法语法(由
analyze_logic.py/ 编辑器自检覆盖) - 引用密度(由
check_references.py覆盖) - 章节结构(由
check_format.py/map_structure.py覆盖) - 学校命名规范(由
templates/覆盖) - 保留术语(由
forbidden-terms.md覆盖)