论文查重是怎么查的?重复率算法与各系统差异
查重系统通过连续字符匹配比对数据库,知网通常以连续 13 字重复为判定阈值。本文说明比对范围、各系统数据库差异、哪些部分计入重复率,以及查重前的准备事项。
查重的本质是文本比对:系统把你的论文切成片段,逐段与数据库里的已有文献比对,重合的部分计入重复率。
理解这个机制,降重的方向就清楚了。
判定阈值
以知网为例,通行的说法是连续 13 个字符相同即判定为重复(不同系统阈值不同,且官方不公开精确规则)。
这解释了几个现象:
为什么改几个词没用。 一句 30 字的话,你改了开头 5 个字,后面 25 个字连续相同,仍然会被判重。
为什么专业术语不用改。 术语本身很短,且是必要表述,通常不会因为几个术语相同就被判重——除非术语连成了长句。
为什么打乱语序有效。 把长句拆成短句、调整成分顺序,能打断连续匹配。
比对范围
主要包括:
- 学术期刊论文(各系统覆盖差异最大的部分)
- 学位论文库(往届硕博论文,知网这块最全)
- 会议论文
- 图书
- 互联网资源(网页、百科、文库)
- 本校往届论文库(部分学校单独建库)
互联网资源这一项常被低估。 从百度百科、知乎、公众号里抄的内容同样会被检出,很多人以为"网上的东西查不到",这是误解。
哪些部分计入
通常计入:摘要、正文各章、结论、致谢
通常不计入:封面、目录、参考文献列表(需格式规范才能被正确识别)
要注意的:如果参考文献格式不规范,系统可能识别不出来而把它当正文比对——那一大段文献列表会显著推高重复率。这是格式规范能直接影响重复率的一个实例。
各系统差异
知网:学校采用最多,数据库最全,检出率通常最高。个人无法直接购买,多通过学校统一检测或第三方渠道。
万方、维普:数据库覆盖不如知网全面,同一篇论文的检出率通常低于知网。
PaperPass、PaperYY 等:主要用于自查,价格低,但结果与知网差异较大。
实践建议:自查可以用便宜的系统了解大致情况,但最终以学校指定系统的结果为准。用其他系统查出 8%,学校用知网查出 25% 的情况完全可能发生。
查重前的准备
第一,确认检测范围。 问清楚学校提交的是全文还是仅正文、参考文献是否单独提交。
第二,规范参考文献格式。 前面说过,格式不规范会导致文献列表被当正文检测。
第三,检查图表处理。 图片形式的表格通常不会被检测(系统识别不了图片里的文字),但纯文本表格会。这不是让你把表格转成图片规避检测——学校模板多数要求表格是可编辑的文本形式,转图片会违反格式要求。
第四,留出修改时间。 多数学校只给 1-2 次免费检测机会,第一次结果出来后需要时间修改。不要卡在截止日期前一天才第一次查。
一个常见误区
降重不等于把话说得别扭。
为了避开连续 13 字,把通顺的句子改得七零八落,重复率是降下来了,但论文的可读性和学术性都受损,导师那一关反而更难过。
正确的方向是理解后重新表述——先把原文的意思吃透,然后合上原文用自己的话写出来。这样写出来的句子既不会重复,也是通顺的。这个方法慢,但效果最好,而且不会被查重系统的算法变化影响。
常见问题
重复率多少算合格?
各校标准不同,本科常见要求是低于 20% 或 30%,硕士多为 10%-15%,博士更严。部分学校对单章重复率也有单独要求。务必以本校规定为准,不要参照网上流传的通用数字。
参考文献和致谢算重复率吗?
规范格式的参考文献列表通常会被系统识别并排除,但前提是格式正确、能被系统认出。致谢多数系统计入检测范围。目录、封面通常不计入。具体以学校提交的检测范围要求为准。
知网查重和其他系统结果差多少?
差异可能很大,主要因为数据库覆盖不同。知网收录了大量学位论文与期刊,通常检出率最高;其他系统若数据库覆盖较少,可能漏检。学校用哪个系统就以哪个为准,用别的系统自查的结果只能作粗略参考。
自己发表过的论文算重复吗?
会被检出,但多数系统支持“去除本人已发表文献”功能,需要在提交时勾选并填写作者信息。若学校的正式检测未启用该功能,建议提前与教务或导师说明情况。
相关工具
同专题其他文章
本文内容仅供学习参考。论文写作须遵守所在学校的学术规范与诚信要求,生成内容不得直接作为毕业、发表用途。