完全没接触过?从这四张卡开始
这一页假设你昨天才第一次听说这件事。先花五分钟搞懂四个词:
① AI 代笔已经是日常
现状你手机里的聊天机器人(ChatGPT、DeepSeek 这类大语言模型)都能一口气吐出三千字小说。网文作者拿它打底稿、工作室用它量产,已是公开的秘密。
② 预设 = AI 的剧本说明书
关键词直接命令「写个故事」,AI 写得千篇一律。于是社区把经验打包成预设:角色怎么立住、文风学谁、禁用哪些词、节奏怎么控。同一个 AI,喂不同预设,判若两人。预设作者是一个真实存在的创作圈子,互相分享、暗中较劲。
③ 但这个江湖没有点评平台
痛点哪个预设好用?作者自称天下第一,用户跟着感觉走,吵三百楼也吵不出结果。就像满街餐馆却没有任何点评网站——好不好吃,全看老板嗓门大。
④ 「AI 味」=机器的流水线味
靶子机器写的字自带一股怪味:排比句成瘾、「不是 A 而是 B」张口就来、每段结尾强行升华、比喻华丽但空洞。读者三行识破、直接弃文。消灭 AI 味,就是整个项目的靶心。
你觉得油,他觉得香——没秤,全是口味
关于「AI 味」,社区日常出现的三种僵局:
纯口味之争
无解「我说油,他说香。」个人感受无法复现、无法汇总,吵三百楼也选不出赢家。
单一工具说了算
偏科任何一个单独的检测器都会漏报、误伤。只信一家,不是得到真相,是换了个教主。
那就放弃客观?
有解把「有没有 AI 味」改写成一道可盲测的分类题:遮住出处,猜哪篇是人写的。猜得准不准,可以算分。
裁判不是空气,是一个较真的工具
造新秤之前,先介绍已经上岗的家底——llmlint 本体:
一本 360 条的坏习惯图鉴
家底每条规则锁定一种机器写作毛病:哪些词出现太勤、哪种句式又在复读、哪类结构太工整。默认 266 条在岗,覆盖 50 多个门类。
四种手法翻你的稿子
手段查词形:套话一抓一个准;算频率:「程度副词每千字 12 次」这种账算得清;跑算法:段落节奏、篇幅比例交给程序量;判语义:规则写不死的,请 AI 结合上下文现场裁。
体检报告,不是判决书
边界分数高 ≠ 文章该死。它负责把可疑之处标出来、附上证据;改不改、怎么改由人决定,而且改动必须通过下面的两条铁律验收。
一道考题的三种原料
秤不是拍脑袋造的,每个环节都有规矩和理由:
出卷
真人范文做参考,AI 按同样的命题现写作文,一篇对一篇配成考题。轻小说、武侠、宫斗、无限流……题材铺开——只在一种文体上考出来的成绩不算数,换个题材可能就翻车。
盲考
遮掉作者信息,让规则库指认哪篇是 AI。练习归练习、高考归高考:调规则用一批卷,正式计分用另一批考前封存的卷——防止考生背题刷分。
监考
请第三方神经网络检测器独立再测一遍,作为另一把参照尺:两边各自报告,结论不一致时正好暴露盲区——任何一边都不当最终判决。
这杆秤,目前长这样
下面四个数,全部来自仓库里可查证的内部对照实验记录:
266 条默认在岗
满分 1
人写 vs 机写(越高越油)
另一把参照尺
* 以上为内部小样本机器互测实验结果,没有人类评审参与,样本量有限。它证明的是「这杆秤能测量」,不是「什么是好文章」——那是下一章的事。
这个实验室,连自己都打
下面四个「大家本来都这么以为」,全是被实验亲手推翻的——这也是它存在的意义:
起点最差的,进步空间最大 ×
某模型裸稿 AI 味全场最高(0.969),按理最有下降空间,注入写作约束后实测收益却是零,篇幅还倒砍 26%。起点高只说明「测得出来」,不承诺「一定进步」。
一套约束,处处灵验 ×
同一套写作约束:在这个模型上 AI 味浓度实打实下降(0.896 → 0.776),换个模型零收益,再换个判不了。收益必须逐模型实测,推不出来。
平均分代表一切 ×
把多个模型的数据搅在一起算,表格一片飘绿、像是全面胜利;按模型拆开一看,信号几乎全来自其中一个。合并的大数字会撒谎,结论必须分层看。
骗过检测器 = 没 AI 味 ×
有的模型检测分低得贴地,套话密度却照样爆表——躲开神经网和不写套话是两种本事。所以秤有两面,分开测、都报告。
两条铁律,防自己人作弊
用这杆秤宣布「变好了」之前,必须先过这两关:
铁律一 · 「变好」要两个人签字
机器说检测分降了,还不算数——真人读者也得说文章没变差。两票全同意才能宣称「修好了」;缺人评的时候,一律按「未验收」挂起。没有这条,会出现「检测分漂亮、读者看完骂街」的假胜利。
铁律二 · 不许靠删字清零
命中减少了、也没冒出新命中,但整篇短了三分之一?不算过。改动幅度超出原文 ±20% 直接判无效——专治「把字全删了就没有 AI 味了」的邪道通关。
尺子造好了,该放蛐蛐进场了
评测实验室负责量「尺子准不准、约束灵不灵」;至于让谁的写作管线一路打到终点站排行榜——那是第二章的事。