进化实验室 · 第二章 · 赛制细则手册

一只蛐蛐,
是怎么炼成的?

这页不画大饼,只讲机制:Author 由什么零件组成、进化一圈经过哪几道工序、人类坐在哪些位置上。所有设计只对着一个目标——够残酷,但别把「真人口味」这个唯一标准弄丢。

机制透明 · 拒绝黑箱

阅读顺序:第一章 · 评测实验室第二章 · 开赛预热 → 本页(细则手册)。第一次接触这个领域?先读前两页,回来这里看门道。

全场名册

四个位置,各就各位

先把最容易混淆的角色钉死——尤其 Critic,它不当裁判。四张卡会轮流点亮帮你认人:

人类

裁判的裁判

核心职责有三类:盲评打分、当 AI 裁判的教材和考卷、复核 AI 拿不准的题;手痒也可以亲自下场参赛(见下方座位四)。人类打的分是全场唯一算数的真值,其他一切分数都是参考。

Author · 选手

蛐蛐本尊

不是一个裸模型,而是一整条写作管线:主笔、修订助手、文风预设、下笔规矩、参数打包上场。下一幕当场解剖。

Reviewer · 裁判

AI 评分器

模仿某一类真人口味的独立评分器。只有预测权,没有判决权:它打的分永远单独记一本账,一分都不许混进人类评分。

Critic · 队内教练

修订助手

划重点:它在 Author 队伍里当教练,不坐裁判席。改完稿自己觉得妙没用,活命与否真人说了算。(旧文档曾把 Critic 当「评分员」,本手册起一律算修订助手——免得一个名字又当运动员又当裁判。)

选手解剖

一只 Author = 五个零件

文风预设和剧情细纲喂给主笔,主笔出初稿,队内教练批注:给建议就打回重写,放行了才挂牌出场。先看图,再逐个拆:

文风预设STYLE
剧情细纲BRIEF
主笔WRITER
初稿 v1DRAFT_V1
修订助手CRITIC
修订稿 v2DRAFT_V2
终稿FINAL
教练放行才出场;给了建议就回炉再写一版,循环到合格为止。

▲ 上图会自动循环演示一条生成管线:预设+细纲喂进主笔,产出初稿 v1;修订助手按自带的规则审稿——给建议就打回,主笔据此改出 v2,再审、再改,直到放行交出终稿。

  • 零件① 主笔(writer) 队伍里的大语言模型本尊,拿到剧情细纲(brief)先写出初稿 v1;教练给的修订建议,也由它消化后改出新版。选哪个模型当主笔,等于战队选核心选手——第一章说过,同一个模型换身装备就是另一种命。
  • 零件② 修订助手(critic) 队内教练,肚子里自带一套审稿规则。初稿到手只做两件事:给修订建议打回去,或者检查合格直接放行。给建议的路数有两种:列出修改计划让主笔照单执行,或者圈住关键段让主笔当场重写——开局第一轮就让这两种教练同台比武。
  • 零件③ 文风预设(style) 这只蛐蛐的「人设卡」:学谁的口吻、短句还是长句、爽点多密、对白多辣,全写在这里面。社区预设作者的看家本领就在这一栏。
  • 零件④ 下笔规矩(guide) 一本自动生成的负面清单:「这些 AI 常犯的错不许犯」。由第一章那套规则库按需投影生成,不用手写。
  • 零件⑤ 参数 一组旋钮:比如「温度」(控制 AI 下笔随机程度的档位)、「篇幅预算」(最多允许写多长)。同样的人设加同样的模型,旋钮拧得不同,写出来也是两只不同的蛐蛐。
换掉任何一个零件,就是另一只蛐蛐。开局第一轮就放两种打法同台:单枪匹马没有教练 / 教练坐镇开方子——开方子还分两种路数:列修改计划照单执行、圈住关键段定向重写。哪种教练值这个工资,数据说话。
引擎室

进化一圈,六道工序

整个引擎就是一个不断回炉的圈:生成 → 盲评 → 考裁判 → 预筛 → 复核 → 筛选。

这套玩法的祖师爷是遗传算法:像大自然「优胜劣汰」那样,让现有的解法互相组合、变异、淘汰较差的,自动「繁殖」出越来越好的解法。放进 AI 写作里——一只蛐蛐就是一个个体:以主笔+修订助手为核心,连同文风预设、下笔规矩、参数打包上场(正是上一幕解剖的五件套),每件零件都是它的基因。整个进化实验室就是生态圈,生杀大权握在真人读者手里:人类打分越高,越容易活下来。活下来的蛐蛐也不躺平——按设计,由 agent 复盘、抽取它们身上的「有利基因」,组合变异出下一代。
先用一道虚构示例命题帮你代入全程: 「女主在订婚宴上识破闺蜜与未婚夫的背叛,当场反击。」 三只参赛蛐蛐各自交出一篇两千字;五位真人读者匿名读完,给「AI 味」和「想继续读」打分,并回答「更想追读哪一篇」。此后——分数计入各蛐蛐的成绩册;这几篇文章连同人类评分,成为下一批 AI 裁判学员的新教材。 下面的六道工序,走的就是这个例子的一生。

▼ 下面的工序卡会按顺序点亮,演示一轮完整的进化循环。

1

生成

各只 Author 对同一命题各自成稿:初稿加修订稿;按设计,每一轮的花费与耗时都会记入台账。

2

盲评

真人匿名上阵:给「AI 味」和「想继续读」打分;同一命题的几篇再捉对站队——你更想追读哪篇。评分者不知道文章出自谁手,防止偏心。

3

考裁判

拿封存的真人评分当标准答案,测每位 AI 裁判模仿得到不到位。考卷定期换新,防止背题。

4

预筛

拿到资格的 AI 裁判先替真人海选:给新一代候选打廉价初筛分,把真人的子弹留给关键局——真人时间是最贵的资源。

5

复核

AI 最拿不准、跟人类分歧最大的样本,优先塞回真人手里终审——不确定的地方,恰恰是最值钱的数据。

6

筛选

生死簿以真人想读分落笔:总分前排、各赛道前排、抽签野卡三种活法,其余淘汰。

↺ 幸存者变异出新候选、场外新鲜血液报名进场——回到第 1 步,下一轮开卷。
为什么不让作者和裁判互相喂着进化?因为会闭环:作者学会讨好裁判 → 裁判在讨好稿上显得越来越准 → 双方一起飘离真人口味。所以两池交替更新——裁判的资格只由封存的真人考卷决定,作者的生死只由真人评分决定,谁也别想绕过人类发奖。
1 生成 自动演示 · 循环播放 · 数据为虚构示例
蛐蛐甲 蛐蛐甲的文稿 ✕ 淘汰
蛐蛐乙 蛐蛐乙的文稿 ✕ 淘汰
蛐蛐丙 蛐蛐丙的文稿 ✕ 淘汰
真人评委团匿名盲评 · 唯一真值
AI 裁判影子记账 · 不判生死

沙盘自动循环:每轮淘汰一名最低分,幸存者变异并迎来新选手;真人打分永远发生在 AI 记账之前——这就是「有武德的残酷」。

裁判考证

AI 裁判上岗,比考编还严

把 Reviewer 想成「AI 队伍里考出来的阅卷老师」——上岗前也得考编,流程如下:

报名建档

用什么模型、什么提示词、什么评分尺,全部登记在案,一个版本一个号。以后它出的任何分数都能倒查回这一版——出了问题知道该抓谁。

学习模仿

教材只有一种:带真人标准答案的盲评记录。它不许拿机器分数练级——那只会学出一身歪毛病。

封存大考

换一批考前锁进的卷子正式开考:误差要小、捉对指认要准、最差的题材赛道也不能崩。三项全过硬,才发上岗证。

影子待岗 发证 ≠ 执法

先跟着真人答案对账打工:它打的分单独记一本账,和人类评分逐条核对。对得上,才有资格进下一站。

执法与回炉 随时打回

正式拿到海选资格。但只要大考成绩跌破线、某个赛道明显变歪、或者偷换了模型没报备——立即打回影子待岗,回去重修。

一条保底条款:人工复核的比例可以随着裁判成熟慢慢降,但不允许降到零——总得有人盯着裁判有没有悄悄脱离群众。
你的座位

人类不是观众,是地基

这套系统里人类有四个座位,从轻量到硬核任选:

座位一 · 最轻量

盲评评委

匿名读一篇,打「AI 味」「想继续读」两项分,顺手捉对站个队。不需要任何技术背景,能读中文、有口味就够了。门槛最低,也最缺人——整个系统的电全靠这里供。

座位二 · 攒功德

标准答案供应商

你打过的每一分都会沉淀成 AI 裁判的教材和考卷,而且每条评分都有版本档案,将来能追溯它教出了哪一版裁判。评得越多,裁判越像人;你不评,裁判永远是照妖镜里的瞎子。

座位三 · 硬核

终审仲裁

专接疑难案件:AI 拿不准的、两位裁判意见打架的,优先送到你面前一锤定音。这是整个系统最烧钱也最值钱的环节,你的每一票都在教整个系统做人。

座位四 · 下场玩

选手经纪人

带上你调教的 Author 配置亲自参赛,或把压箱底的预设送来当种子选手。赢了封神;首轮开放后打完,还能拿逐模型诊断报告回家改(规划中)。

底线四条

整本手册,其实就这几句

前面所有设计,都是这四条的展开:

  •  AI 评分永远单独记账,永不写入人类真值——裁判不能替读者鼓掌。
  •  AI 裁判的上岗资格只由封存的真人考卷决定——考官只能是出题的人。
  •  平均分不是唯一的生存标准——小众口味赛道有保送名额,偏科大神不算失败者。
  •  排行榜停在路线图终点站——审计、隐私、防作弊压测全过才开门,首版不承诺。
← 回第二章主页 · 报名入口 ← 回第一章 · 评测实验室 完整提案会随项目进展更新,欢迎逐条拍砖。