Skip to content

中文论文 AI 写作高频词 — 参考词表

本文档列出中文学位论文中最容易暴露 AI 写作痕迹的高频词, 并给出推荐的"每篇出现次数上限"。配套文件 tone-thresholds.yamldeai_check.py 实际读取的权威配置;本文件仅作设计说明。

阈值如何生效

  • deai_check.py 启动时读取 tone-thresholds.yaml
  • term_thresholds: 中每个词,单篇可见正文(经 parser 抽取,剥离引用、 公式、注释后)出现次数超过阈值即触发一次 [Script] LOW 痕迹。
  • 中文不分词,按字符串 substring 计数。
  • 阈值修改在 yaml 中进行;本文件不被代码读取。

维护节律(本词表是快照,不是终态)

本词表记录的是当前的 AI 写作高频词,而非永久不变的真理。随着"赋能""彰显" 等词被广泛点名,有意识的作者会主动过滤、其频率随之下降;同时新的 AI 偏好词 持续涌现。建议每半年参考 excess-vocabulary 类研究复审一次,按需增删, 不要当成冻结清单。

  • 上次复审:2026-06
  • 来源:Kobak et al., Sci. Adv. 2025;Geng & Trotta 2025

高频 AI 中文连接词

这些词不是禁词,少量使用是必要的。阈值代表"再多评审就会觉得套路化"的临界值。

阈值备注
首先4议论开头模板的标志词
其次4与"首先"成对,常被堆叠
然而5转折滥用,常常没有真正的转折语义
此外4补充连接词,常用于堆砌
因此6推理结论标志,可保留更多
另外3与"此外"功能重复,建议合并
进而3AI 偏爱的递进词
而且4与"并且"功能重复
显然3越自然的语境越不需要这个词
通常4模糊频率,可量化时建议替换
一般5比"通常"更弱
尤其3强调词,AI 喜用

内容模板词

阈值备注
显著5通常缺 p 值或效应量支撑
全面3单一研究难以"全面"
深入3营销语言
大量3模糊量词
众多3模糊量词
重要5解释清楚何为"重要"
关键5同上
核心4一篇论文不该出现太多"核心"
基本4含糊
主要5含糊
最为3最高级修辞
极为3最高级修辞
尤为3最高级修辞

段落首字重复(burstiness)

连续 3 段以相同的前 4 个中文字符开头时触发。典型情况:

  • "本节首先..." / "本节首先..." / "本节首先..."
  • "为了进一步..." / "为了进一步..." / "为了进一步..."
  • "在本章中..." / "在本章中..." / "在本章中..."

修复方法:把至少一段重写为不同的句法形态(前置状语、对比连接、问题句)。

段首清嗓子(throat clearing)

段落第一条非空可见行匹配以下模式即触发:

  • 综上所述 / 总而言之 / 总的来说 / 由此可见
  • 值得指出的是 / 值得注意的是 / 需要指出的是 / 需要说明的是
  • 不难发现 / 不难看出 / 众所周知 / 毋庸讳言
  • 「首先,」「其次,」「然而,」「此外,」开头
  • 一方面 / 另一方面

每个触发记一次 [Script] LOW

标点模式

  • 整篇 "——" 数量超过 max_em_dashes_per_doc 时,在首次出现处记一次聚合痕迹。
  • 中文 "!" 或英文 "!" 出现在正文章节(摘要至结论之间)时,每次记一条痕迹。 公式、代码、注释被剥离不计。

不在本表中的内容

  • 句法语法(由 analyze_logic.py / 编辑器自检覆盖)
  • 引用密度(由 check_references.py 覆盖)
  • 章节结构(由 check_format.py / map_structure.py 覆盖)
  • 学校命名规范(由 templates/ 覆盖)
  • 保留术语(由 forbidden-terms.md 覆盖)

基于 MIT 许可发布