llmlint 进化实验室 · 第二章 · 众筹预热期

赛博斗蛐蛐VS
你的预设敢下场吗?

「赛博斗蛐蛐」,就是让 AI 写作管线当蛐蛐、在同一个坑里捉对互搏。进化实验室(规划中)要把社区里千千万万的预设请进场:同一道命题捉对厮杀,真人读者盲评当裁判——终点站是公开排行榜。

招募首批参赛者

本章是第二章。没看过第一章的,先去评测实验室:看看那杆秤是怎么造的

新来的?先补三句

三十分钟前刚听说这事也能看懂

三个词,一分钟一个:

① 预设是什么

关键词

给 AI 的写作剧本包:角色人设、文风口吻、禁用词表、节奏控制全在里面。换一套预设,同一个 AI 立刻换了个灵魂。写手圈把它当硬通货互相传。

② AI 味是什么

敌人

机器稿的流水线味:排比成瘾、「不是 A 而是 B」张口就来、逢段必升华。读者一眼假,直接弃文——所有 AI 写作者的头号公敌。

③ 现状卡在哪

僵局

同一套预设换个模型就变样,可全网没有权威评分处:作者宣传靠嗓门,用户挑选靠玄学。缺的是一个不讲情面的评测机构。

我们的解法分两步:先造秤(第一章评测实验室,内部已跑通),再开赛场(本页进化实验室,规划中)——让预设别再吵,下场打。
为什么需要裁判

同一份预设,换个模型就是另一种命

这不是嘴仗。我们把同一套写作约束喂给三个模型做了对照实验,验出三份报告:

deepseek-v4-flash

有效

「AI 味浓度」(外部检测器给整篇打的像-AI 分,越低越像人)从 0.896 降到 0.776:26 组对照,纯属巧合的概率约 1%。连没提前透题的规矩也少踩了——不是背题绕考官,篇幅也没缩水。

gemini-3.1-pro

白给

三项质量指标全都没动,篇幅中位数倒被砍了 -757 字(-26%)——巧合概率远小于千分之一:规矩没让它少点 AI 味,就让它少写了。

mimo-v2.5-pro

存疑

它确实照着规矩改了写法,可 AI 味浓度纹丝不动(跟掷硬币分不出差别)。26 组样本下不了结论,不硬判。

收益必须逐模型实测,推不出来。——所以「哪个预设好用」这件事,需要一个不讲情面的评测机构。
裁判已就位

吹牛之前,先看家底

进化实验室不是 PPT——裁判手里的尺子早就造好了(详细原理见第一章):

360
中文正文规则库
266 条默认在岗
0.966
本轮实验的分辨得分*
满分 1
2.47 vs 8.86
套话密度中位数*
人写 vs 机写(越高越油)
0.870
第三方 AI 检测器*
另一把参照尺

* 以上为内部小样本机器互测实验结果,没有人类评审参与,样本量有限。它证明的是「这把尺子能测量」,不是「什么是好文章」——好文章的定义权,永远归下面的真人评委。

赛制章程

三个角色,一场有武德的残酷

你要带的东西,提案里都留好了位置:

选手

Author 蛐蛐

主笔模型 + 修订助手 + 文风预设 + 下笔规矩 + 参数 的组合体。一只蛐蛐 = 一整条写作管线,野路子配置也收。

裁判

Reviewer 评分器

模仿特定人类评分口味的独立评分器。上岗前必须先考一场封存的真人盲评卷子,考不过只能影子待岗、没有编制。

裁判的裁判

真人读者

匿名盲评,只打两项分:「AI 味」和「想继续读」。蛐蛐能不能活命只看真人的想读分——全场唯一算数的真值。

武德条款:AI 评分永远不能冒充人类判定写入真值;选手池和裁判池交替更新、禁止串通——防止蛐蛐学会讨好裁判、裁判学会偏袒蛐蛐,最后一起飘离真人口味。
温情条款
保送

淘汰是真残酷,但讲武德:总分前排之外,每种题材赛道各留几个前排保送名额,再配抽签野卡。「小众但稳定的口味」不被平均分绞死——只在一条赛道封神的候选会拿到「偏科大神」称号,而不是失败者盖章。

赛程表

从集结到开擂:六站路线图

众筹阶段的诚实声明:以下是规划路线,不是已交付功能。

第〇站 立规矩、搭实验台 当前位置 · 集结中

参赛报名表怎么填、每场生成怎么记账、考卷怎么封存切分——先把规矩钉死;之后每个结果都能凭存档编号查到出处。

第一站 最小生成链

命题进、初稿和修订稿出;计划把每一场的花费与耗时记入台账,做到任何一场都能原样重跑。

第二站 私有竞技场协议

比赛章程 + 匿名发卷机制。内测盲评间 /style-review 已在跑双轴打分实验——但它还是固定题库的内测间,不是公开擂台。

第三站 AI 裁判影子上岗

每位 AI 裁判都有版本档案;它打的分单独记一本账、永不混进真人评分。它最拿不准的题,优先请真人复核。

第四站 作者候选筛选

生死簿由真人评分执笔,AI 裁判只做廉价的初筛。三种活法:总分前排、各赛道前排、抽签野卡。

第五站 交替进化 + 开放竞技场 终点站 · 排行榜

自动变异、公共题库、面向用户的排行榜。挂牌提示:排行榜会改变参与者行为,审计、隐私、防作弊压测全过之后才开放。

开局第一枪已备好弹:10 道命题 × 3 只参赛蛐蛐 × 每只写 3 篇 = 90 篇正文,同题捉对厮杀。成功标准不是选出冠军,而是每一环都能重跑、经得起追问、欢迎被打脸。
入 场 方 式

开赛前,你想坐哪个位置?

三个位置都在招人,从围观到下场任选:

围观党

占坑等开赛

star / watch 仓库,赛程推进、实验战报第一时间看到。吃瓜免费。

参战党

自带蛐蛐报名

你调教的主笔、裁判、修订助手(Author / Reviewer / Critic),首轮开放后都能带进实验室同台。现在报名占位,看看是你的调教强,还是别人的野路子强。

预设作者

交预设当种子选手

先预约:开赛就把你舍不得公开吹的预设放进第一轮。赢了有实锤战绩,打完就能拿逐模型诊断报告回去改——这正是评测机构欠你的东西。

GitHub · star 占坑 赛制细则手册 · 先看机制 Issues · 报名参战 报名格式(暂定):你的配置思路 + 想打的赛道 + 你觉得谁是假想敌