llmlint 评测实验室 · 第一章 · 内部已跑通

吵了三百楼的
「AI 味」,上秤

网友为「这段像不像 AI 写的」能吵到天亮,因为没人带秤。评测实验室就是那杆秤:真人范文和 AI 同题作文捉对盲测,规则库当考生,第三方检测器当监考——分数说话,不服重跑。

战报陆续整理
先补背景 · 五分钟入门

完全没接触过?从这四张卡开始

这一页假设你昨天才第一次听说这件事。先花五分钟搞懂四个词:

① AI 代笔已经是日常

现状

你手机里的聊天机器人(ChatGPT、DeepSeek 这类大语言模型)都能一口气吐出三千字小说。网文作者拿它打底稿、工作室用它量产,已是公开的秘密。

② 预设 = AI 的剧本说明书

关键词

直接命令「写个故事」,AI 写得千篇一律。于是社区把经验打包成预设:角色怎么立住、文风学谁、禁用哪些词、节奏怎么控。同一个 AI,喂不同预设,判若两人。预设作者是一个真实存在的创作圈子,互相分享、暗中较劲。

③ 但这个江湖没有点评平台

痛点

哪个预设好用?作者自称天下第一,用户跟着感觉走,吵三百楼也吵不出结果。就像满街餐馆却没有任何点评网站——好不好吃,全看老板嗓门大。

④ 「AI 味」=机器的流水线味

靶子

机器写的字自带一股怪味:排比句成瘾、「不是 A 而是 B」张口就来、每段结尾强行升华、比喻华丽但空洞。读者三行识破、直接弃文。消灭 AI 味,就是整个项目的靶心。

评测实验室做的事只有一件:给这个没有裁判的江湖,装一块所有人服气的计分板。下面讲这块计分板是怎么造、怎么校、考出了什么分。
为什么需要秤

你觉得油,他觉得香——没秤,全是口味

关于「AI 味」,社区日常出现的三种僵局:

纯口味之争

无解

「我说油,他说香。」个人感受无法复现、无法汇总,吵三百楼也选不出赢家。

单一工具说了算

偏科

任何一个单独的检测器都会漏报、误伤。只信一家,不是得到真相,是换了个教主。

那就放弃客观?

有解

把「有没有 AI 味」改写成一道可盲测的分类题:遮住出处,猜哪篇是人写的。猜得准不准,可以算分。

玄学变考题,是整个实验室的第一块地基:凡是能出成考卷的东西,就逃不掉被打分。
认识裁判

裁判不是空气,是一个较真的工具

造新秤之前,先介绍已经上岗的家底——llmlint 本体:

一本 360 条的坏习惯图鉴

家底

每条规则锁定一种机器写作毛病:哪些词出现太勤、哪种句式又在复读、哪类结构太工整。默认 266 条在岗,覆盖 50 多个门类。

四种手法翻你的稿子

手段

查词形:套话一抓一个准;算频率:「程度副词每千字 12 次」这种账算得清;跑算法:段落节奏、篇幅比例交给程序量;判语义:规则写不死的,请 AI 结合上下文现场裁。

体检报告,不是判决书

边界

分数高 ≠ 文章该死。它负责把可疑之处标出来、附上证据;改不改、怎么改由人决定,而且改动必须通过下面的两条铁律验收。

造秤三步

一道考题的三种原料

秤不是拍脑袋造的,每个环节都有规矩和理由:

原料一

出卷

真人范文做参考,AI 按同样的命题现写作文,一篇对一篇配成考题。轻小说、武侠、宫斗、无限流……题材铺开——只在一种文体上考出来的成绩不算数,换个题材可能就翻车。

原料二

盲考

遮掉作者信息,让规则库指认哪篇是 AI。练习归练习、高考归高考:调规则用一批卷,正式计分用另一批考前封存的卷——防止考生背题刷分。

原料三

监考

第三方神经网络检测器独立再测一遍,作为另一把参照尺:两边各自报告,结论不一致时正好暴露盲区——任何一边都不当最终判决。

最新战报

这杆秤,目前长这样

下面四个数,全部来自仓库里可查证的内部对照实验记录:

360
中文正文规则库
266 条默认在岗
0.966
本轮实验的分辨得分*
满分 1
2.47 vs 8.86
套话密度中位数*
人写 vs 机写(越高越油)
0.870
第三方 AI 检测器*
另一把参照尺
怎么读这四个数:随机抽一篇人写的、一篇机写的,这杆秤有 96.6% 的把握指认正确;人写稿件的套话密度不到 AI 稿的三分之一;独立的外援检测器另有一把参照尺(0.870)——两把尺子各自报告、互不当对方的判决,不一致的地方就是盲区清单。

* 以上为内部小样本机器互测实验结果,没有人类评审参与,样本量有限。它证明的是「这杆秤能测量」,不是「什么是好文章」——那是下一章的事。

打脸陈列馆

这个实验室,连自己都打

下面四个「大家本来都这么以为」,全是被实验亲手推翻的——这也是它存在的意义:

曾经以为

起点最差的,进步空间最大 ×

某模型裸稿 AI 味全场最高(0.969),按理最有下降空间,注入写作约束后实测收益却是,篇幅还倒砍 26%。起点高只说明「测得出来」,不承诺「一定进步」。

曾经以为

一套约束,处处灵验 ×

同一套写作约束:在这个模型上 AI 味浓度实打实下降(0.896 → 0.776),换个模型零收益,再换个判不了。收益必须逐模型实测,推不出来。

曾经以为

平均分代表一切 ×

把多个模型的数据搅在一起算,表格一片飘绿、像是全面胜利;按模型拆开一看,信号几乎全来自其中一个。合并的大数字会撒谎,结论必须分层看。

曾经以为

骗过检测器 = 没 AI 味 ×

有的模型检测分低得贴地,套话密度却照样爆表——躲开神经网和不写套话是两种本事。所以秤有两面,分开测、都报告。

尺子的使用说明

两条铁律,防自己人作弊

用这杆秤宣布「变好了」之前,必须先过这两关:

铁律一 · 「变好」要两个人签字

机器说检测分降了,还不算数——真人读者也得说文章没变差。两票全同意才能宣称「修好了」;缺人评的时候,一律按「未验收」挂起。没有这条,会出现「检测分漂亮、读者看完骂街」的假胜利。

铁律二 · 不许靠删字清零

命中减少了、也没冒出新命中,但整篇短了三分之一?不算过。改动幅度超出原文 ±20% 直接判无效——专治「把字全删了就没有 AI 味了」的邪道通关。

第一章 · 完

尺子造好了,该放蛐蛐进场了

评测实验室负责量「尺子准不准、约束灵不灵」;至于让谁的写作管线一路打到终点站排行榜——那是第二章的事。

下一章 · 进化实验室:赛博斗蛐蛐 GitHub · 看方法与公开记录 数字口径与实验记录整理在仓库文档中;正文语料含版权内容,不随仓库公开。