很多同学一听说学校要查AIGC率,第一反应就是慌,然后到处找工具、找软件、找所谓的“过检秘籍”。但我发现一个很普遍的现象,大家连AIGC检测到底在检测什么都不知道,就开始盲目操作了。这就好比你要去考试,连考什么科目、什么题型都不清楚,复习怎么可能有方向?
我今天就把AIGC检测的原理用最通俗的话讲清楚,你只要搞懂了底层逻辑,降低AIGC率这件事就成功了一半,剩下的就是动手执行而已。
AIGC检测模型的核心原理,说白了就四个字:概率预测。AI在生成文本的时候,每写一个词,都是基于前面的词来计算“下一个词最有可能是什么”。比如前面写了“我今天吃了”,AI算出来“饭”的概率是80%,“面”的概率是15%,“苹果”的概率是5%,那AI几乎一定会写“饭”。所以AI生成的文章,从头到尾都是高概率词的组合,读起来特别“顺”,因为你猜得到它下一句大概会说什么。
但人类写作不一样。人类写“我今天吃了”,接下来可能写“一个巨难吃的食堂套餐”,也可能写“两口就跑去上课了”,甚至写“个亏,食堂没开门”。这些词在AI的概率模型里都属于低概率词,因为它们不常见、不典型。所以AIGC检测模型判断一篇文章是不是AI写的,就看它里面的低概率词出现的频率够不够高、句子的意外程度够不够大。如果你的文章从头到尾都是AI觉得“应该这么写”的词汇和句式,那查AIGC率一定高。
搞清楚了这个原理,降低AIGC率的方法就呼之欲出了——你需要做的就是在文章里主动制造“意外”。我亲测有效的操作有这几个:
第一个,故意插入一些不那么书面的动词。比如AI肯定会写“该模型展现了优异的性能”,我改成“该模型交出了不错的成绩单”。“交出了成绩单”在学术论文里不算出格,但它在AI的概率模型里绝对不是第一选择,这就制造了“意外”,AIGC检测就会认为这一段更像人写的。全文改个七八处这种表达,AIGC率就能掉几个点。
第二个,把AI写的“绝对肯定句”改成“带限定的陈述句”。AI写论文特别喜欢下肯定结论,比如“实验证明该方法最有效”。人类做科研的都知道,哪有什么“最有效”,只有“在特定条件下表现较好”。我改成“从本次实验的结果来看,该方法相比其他几种方案有一定优势”。“相比……有一定优势”这种措辞在AI的语料库里频率远低于“最有效”,又制造了一处“意外”。
第三个,也是最管用的,主动制造“不完整的引用提示”。AI写论文引用别人工作的时候,格式极其规范,比如“Smith等人(2020)的研究表明”。我改成“Smith他们2020年那篇文章里提到过”。“他们”、“那篇”、“提到过”这些词在正式学术写作里不常用,但绝对不违规,而且人类作者就是会这么写。AIGC检测模型遇到这种表达,几乎不会判定为AI生成。
这几个操作做完之后,别忘了再走一遍论文自查流程。我当时是用免费论文检测附带的那种简易AIGC检测功能先扫一遍,看看高危段落集中在哪些地方,然后重点针对这些段落制造“意外”。改完再查一遍,确认AIGC率降到安全区间了,才敢提交给学校。这个过程不复杂,就是需要一点点耐心和对语言的感觉。
最后说一句,查AIGC率这件事没那么可怕,它不是在抓你“用没用AI”,而是在看你“写的是不是太规整了”。你要是自己一个字一个字敲的,只是稍微参考了AI的框架,那你的文章里天然就有很多“不规整”的地方,AIGC率不会高到哪去。反而是那些全盘复制AI输出、一个字都没动的,才会被卡住。只要你自己动脑动笔了,按照上面的方法过一遍,一定没问题。