三十分钟前刚听说这事也能看懂
三个词,一分钟一个:
① 预设是什么
关键词给 AI 的写作剧本包:角色人设、文风口吻、禁用词表、节奏控制全在里面。换一套预设,同一个 AI 立刻换了个灵魂。写手圈把它当硬通货互相传。
② AI 味是什么
敌人机器稿的流水线味:排比成瘾、「不是 A 而是 B」张口就来、逢段必升华。读者一眼假,直接弃文——所有 AI 写作者的头号公敌。
③ 现状卡在哪
僵局同一套预设换个模型就变样,可全网没有权威评分处:作者宣传靠嗓门,用户挑选靠玄学。缺的是一个不讲情面的评测机构。
同一份预设,换个模型就是另一种命
这不是嘴仗。我们把同一套写作约束喂给三个模型做了对照实验,验出三份报告:
deepseek-v4-flash
有效「AI 味浓度」(外部检测器给整篇打的像-AI 分,越低越像人)从 0.896 降到 0.776:26 组对照,纯属巧合的概率约 1%。连没提前透题的规矩也少踩了——不是背题绕考官,篇幅也没缩水。
gemini-3.1-pro
白给三项质量指标全都没动,篇幅中位数倒被砍了 -757 字(-26%)——巧合概率远小于千分之一:规矩没让它少点 AI 味,就让它少写了。
mimo-v2.5-pro
存疑它确实照着规矩改了写法,可 AI 味浓度纹丝不动(跟掷硬币分不出差别)。26 组样本下不了结论,不硬判。
吹牛之前,先看家底
进化实验室不是 PPT——裁判手里的尺子早就造好了(详细原理见第一章):
266 条默认在岗
满分 1
人写 vs 机写(越高越油)
另一把参照尺
* 以上为内部小样本机器互测实验结果,没有人类评审参与,样本量有限。它证明的是「这把尺子能测量」,不是「什么是好文章」——好文章的定义权,永远归下面的真人评委。
三个角色,一场有武德的残酷
你要带的东西,提案里都留好了位置:
Author 蛐蛐
主笔模型 + 修订助手 + 文风预设 + 下笔规矩 + 参数 的组合体。一只蛐蛐 = 一整条写作管线,野路子配置也收。
Reviewer 评分器
模仿特定人类评分口味的独立评分器。上岗前必须先考一场封存的真人盲评卷子,考不过只能影子待岗、没有编制。
真人读者
匿名盲评,只打两项分:「AI 味」和「想继续读」。蛐蛐能不能活命只看真人的想读分——全场唯一算数的真值。
淘汰是真残酷,但讲武德:总分前排之外,每种题材赛道各留几个前排保送名额,再配抽签野卡。「小众但稳定的口味」不被平均分绞死——只在一条赛道封神的候选会拿到「偏科大神」称号,而不是失败者盖章。
从集结到开擂:六站路线图
众筹阶段的诚实声明:以下是规划路线,不是已交付功能。
第〇站 立规矩、搭实验台 当前位置 · 集结中
参赛报名表怎么填、每场生成怎么记账、考卷怎么封存切分——先把规矩钉死;之后每个结果都能凭存档编号查到出处。
第一站 最小生成链
命题进、初稿和修订稿出;计划把每一场的花费与耗时记入台账,做到任何一场都能原样重跑。
第二站 私有竞技场协议
比赛章程 + 匿名发卷机制。内测盲评间 /style-review 已在跑双轴打分实验——但它还是固定题库的内测间,不是公开擂台。
第三站 AI 裁判影子上岗
每位 AI 裁判都有版本档案;它打的分单独记一本账、永不混进真人评分。它最拿不准的题,优先请真人复核。
第四站 作者候选筛选
生死簿由真人评分执笔,AI 裁判只做廉价的初筛。三种活法:总分前排、各赛道前排、抽签野卡。
第五站 交替进化 + 开放竞技场 终点站 · 排行榜
自动变异、公共题库、面向用户的排行榜。挂牌提示:排行榜会改变参与者行为,审计、隐私、防作弊压测全过之后才开放。
开赛前,你想坐哪个位置?
三个位置都在招人,从围观到下场任选:
占坑等开赛
star / watch 仓库,赛程推进、实验战报第一时间看到。吃瓜免费。
自带蛐蛐报名
你调教的主笔、裁判、修订助手(Author / Reviewer / Critic),首轮开放后都能带进实验室同台。现在报名占位,看看是你的调教强,还是别人的野路子强。
交预设当种子选手
先预约:开赛就把你舍不得公开吹的预设放进第一轮。赢了有实锤战绩,打完就能拿逐模型诊断报告回去改——这正是评测机构欠你的东西。