四个位置,各就各位
先把最容易混淆的角色钉死——尤其 Critic,它不当裁判。四张卡会轮流点亮帮你认人:
裁判的裁判
核心职责有三类:盲评打分、当 AI 裁判的教材和考卷、复核 AI 拿不准的题;手痒也可以亲自下场参赛(见下方座位四)。人类打的分是全场唯一算数的真值,其他一切分数都是参考。
蛐蛐本尊
不是一个裸模型,而是一整条写作管线:主笔、修订助手、文风预设、下笔规矩、参数打包上场。下一幕当场解剖。
AI 评分器
模仿某一类真人口味的独立评分器。只有预测权,没有判决权:它打的分永远单独记一本账,一分都不许混进人类评分。
修订助手
划重点:它在 Author 队伍里当教练,不坐裁判席。改完稿自己觉得妙没用,活命与否真人说了算。(旧文档曾把 Critic 当「评分员」,本手册起一律算修订助手——免得一个名字又当运动员又当裁判。)
一只 Author = 五个零件
文风预设和剧情细纲喂给主笔,主笔出初稿,队内教练批注:给建议就打回重写,放行了才挂牌出场。先看图,再逐个拆:
▲ 上图会自动循环演示一条生成管线:预设+细纲喂进主笔,产出初稿 v1;修订助手按自带的规则审稿——给建议就打回,主笔据此改出 v2,再审、再改,直到放行交出终稿。
- 零件① 主笔(writer) 队伍里的大语言模型本尊,拿到剧情细纲(brief)先写出初稿 v1;教练给的修订建议,也由它消化后改出新版。选哪个模型当主笔,等于战队选核心选手——第一章说过,同一个模型换身装备就是另一种命。
- 零件② 修订助手(critic) 队内教练,肚子里自带一套审稿规则。初稿到手只做两件事:给修订建议打回去,或者检查合格直接放行。给建议的路数有两种:列出修改计划让主笔照单执行,或者圈住关键段让主笔当场重写——开局第一轮就让这两种教练同台比武。
- 零件③ 文风预设(style) 这只蛐蛐的「人设卡」:学谁的口吻、短句还是长句、爽点多密、对白多辣,全写在这里面。社区预设作者的看家本领就在这一栏。
- 零件④ 下笔规矩(guide) 一本自动生成的负面清单:「这些 AI 常犯的错不许犯」。由第一章那套规则库按需投影生成,不用手写。
- 零件⑤ 参数 一组旋钮:比如「温度」(控制 AI 下笔随机程度的档位)、「篇幅预算」(最多允许写多长)。同样的人设加同样的模型,旋钮拧得不同,写出来也是两只不同的蛐蛐。
进化一圈,六道工序
整个引擎就是一个不断回炉的圈:生成 → 盲评 → 考裁判 → 预筛 → 复核 → 筛选。
▼ 下面的工序卡会按顺序点亮,演示一轮完整的进化循环。
生成
各只 Author 对同一命题各自成稿:初稿加修订稿;按设计,每一轮的花费与耗时都会记入台账。
盲评
真人匿名上阵:给「AI 味」和「想继续读」打分;同一命题的几篇再捉对站队——你更想追读哪篇。评分者不知道文章出自谁手,防止偏心。
考裁判
拿封存的真人评分当标准答案,测每位 AI 裁判模仿得到不到位。考卷定期换新,防止背题。
预筛
拿到资格的 AI 裁判先替真人海选:给新一代候选打廉价初筛分,把真人的子弹留给关键局——真人时间是最贵的资源。
复核
AI 最拿不准、跟人类分歧最大的样本,优先塞回真人手里终审——不确定的地方,恰恰是最值钱的数据。
筛选
生死簿以真人想读分落笔:总分前排、各赛道前排、抽签野卡三种活法,其余淘汰。
沙盘自动循环:每轮淘汰一名最低分,幸存者变异并迎来新选手;真人打分永远发生在 AI 记账之前——这就是「有武德的残酷」。
AI 裁判上岗,比考编还严
把 Reviewer 想成「AI 队伍里考出来的阅卷老师」——上岗前也得考编,流程如下:
报名建档
用什么模型、什么提示词、什么评分尺,全部登记在案,一个版本一个号。以后它出的任何分数都能倒查回这一版——出了问题知道该抓谁。
学习模仿
教材只有一种:带真人标准答案的盲评记录。它不许拿机器分数练级——那只会学出一身歪毛病。
封存大考
换一批考前锁进的卷子正式开考:误差要小、捉对指认要准、最差的题材赛道也不能崩。三项全过硬,才发上岗证。
影子待岗 发证 ≠ 执法
先跟着真人答案对账打工:它打的分单独记一本账,和人类评分逐条核对。对得上,才有资格进下一站。
执法与回炉 随时打回
正式拿到海选资格。但只要大考成绩跌破线、某个赛道明显变歪、或者偷换了模型没报备——立即打回影子待岗,回去重修。
人类不是观众,是地基
这套系统里人类有四个座位,从轻量到硬核任选:
盲评评委
匿名读一篇,打「AI 味」「想继续读」两项分,顺手捉对站个队。不需要任何技术背景,能读中文、有口味就够了。门槛最低,也最缺人——整个系统的电全靠这里供。
标准答案供应商
你打过的每一分都会沉淀成 AI 裁判的教材和考卷,而且每条评分都有版本档案,将来能追溯它教出了哪一版裁判。评得越多,裁判越像人;你不评,裁判永远是照妖镜里的瞎子。
终审仲裁
专接疑难案件:AI 拿不准的、两位裁判意见打架的,优先送到你面前一锤定音。这是整个系统最烧钱也最值钱的环节,你的每一票都在教整个系统做人。
选手经纪人
带上你调教的 Author 配置亲自参赛,或把压箱底的预设送来当种子选手。赢了封神;首轮开放后打完,还能拿逐模型诊断报告回家改(规划中)。
整本手册,其实就这几句
前面所有设计,都是这四条的展开:
- 一 AI 评分永远单独记账,永不写入人类真值——裁判不能替读者鼓掌。
- 二 AI 裁判的上岗资格只由封存的真人考卷决定——考官只能是出题的人。
- 三 平均分不是唯一的生存标准——小众口味赛道有保送名额,偏科大神不算失败者。
- 四 排行榜停在路线图终点站——审计、隐私、防作弊压测全过才开门,首版不承诺。