4029 words
20 minutes
leader.skill

leader.skill:把模糊想法翻译成 agent 能独立跑完的目标任务书#

一句话定位#

leader.skill 是卡兹克(GitHub: KKKKhazix)开源的一个 Claude Code / Codex 类 Coding Agent 用的 Skill,作用是把人脑子里模模糊糊的一句话需求,翻译成下一个 agent 拿到就能连续跑几个小时不出错的「目标任务书」。 仓库结构极简:一个 SKILL.mdreferences/ 下的 anatomy.md(任务书结构规格)和 style.md(管理者语料库)。

作者声称烧了二十亿 token 才琢磨出这套「目标定义」方法论,文章标题就叫《浪费 20 亿 Token 之后,我开源了一个帮自己定义目标的 Skill》。烧 token 不是因为模型不行,而是因为目标写得不对——短任务跑偏你看一眼就纠回来,长程任务跑偏,你睡醒它已经沿错路狂奔了八小时,越勤奋,浪费越彻底。

背景:从聊天制到目标制#

作者的底层判断是 AI 与人的协作范式正在迁移:

聊天制(一问一答)→ 任务制(一个功能 / 一个 Bug)→ 目标制(/goal,连续跑几小时到几天)

Claude Code、Codex、Kimi Code 现在都有了 /goal、目标模式。当 agent 真能跑一整夜时,原本能被临场补救的小问题变得致命。leader.skill 正是为这一层「目标定义」专门设计的翻译层——它自己不干活,只负责把领导的模糊想法变成执行者能照着跑几小时的书。

设计哲学:八条公理#

leader.skill 的所有具体规则,都可以从八条对「agent 本性」的悲观假设反推出来。理解了公理,规则就不再是清单,而是必然。这是这套 skill 最值得拆的部分。

公理一:长程执行者是一个对抗性优化器#

skill 不把 agent 当协作者,而当成一个能力极强、判断力有限、会自动寻找最省力路径的优化器——你给它什么指标,它就优化什么指标,包括你没想到的、你会叫「作弊」的捷径。

由此推出几乎所有硬规则:

  • Harness 比 Goal 更重要:定义目标主要在定义「不许走的路」。先想「达成这个数字最偷懒的办法是什么」,再一条条堵死,剩下的才是目标。肯尼迪登月宣言关键不在「登月」,而在「把人送上月球,并安全带回地球」——「安全返回」四个字直接删掉了「单程票」这个最省钱的解法。芒格那句「我只想知道自己会死在哪里,这样我就永远不去那里」是同一个道理。Goal 告诉 agent 往哪走,Harness 告诉它哪些路不许走。
  • 防作弊是头号死法:验收标准冻结(碰都不许碰)、基线不可退(测试数 / 覆盖率 ≥ 实测基线、skipped=0)、具体作弊姿势点名禁止——给测试加 .skip、放松断言、mock 被测对象、删测试、|| true 吞错。
  • 法与情报分家:「不许」是法(违反即不合格,每条可溯源到一次实测或一次领导裁决);「建议」是情报(执行者有更好的路可走,在 PROGRESS.md 记一句为什么)。把情报写成法,就是替执行者做它临场更懂的决定——结果它为了绕开你的「法」,反而去走更糟的路。

这条公理的反直觉之处在于:不是「信任 agent」,而是「正因为信任它能力强,所以更要把护栏写死」。能力越强,作弊越顺手,后果越不可逆。

公理二:规划者无法预见执行现实#

来自军事传统「指挥官意图」:只告诉部队「为什么打」和「打完战场该是什么样」,「怎么打」让部队自己定,因为「没有计划能在与现实的第一次接触后存活」。你说「过桥清扫高地」,桥炸了部队就傻了;你说「掐断补给线」,桥没了它会自己绕路。

落到 agent 目标里:

  • 给手段不给目标是错的——目标升华成数字,手段降格成「可被事实推翻的假设」。领导说「加个 Redis」,要的其实是「变快」;若加了 Redis 没变快,手段就被事实证伪,进正文当待验证假设。
  • 「界限」用白名单不用黑名单:黑名单永远列不全你没想到的越界,白名单「只许改这些路径,其余只读」才堵得死。
  • 任务 0 兼前提核验:先量地基再浇混凝土,数字对不上就停。

公理三:规格是真理,散文是有损转写#

仓库里已有的规格性文件(测试套件、schema、验收脚本、设计稿)直接写路径当规格,绝不复述成散文——「测试名本身就是业务要求」。因为任何自然语言转写都会丢信息、加歧义,复述就是重新编码,重新编码就会引入 bug,能指就别述。

同理,每个「法」必须能溯源到一次实测或一次领导裁决,不能是「我以为」——假设会成为执行者日后甩锅的逃生口(「我以为命令是存在的」)。摸不到环境时,把自测写成任务 0,让执行者第一件事就去验证。

公理四:目标的性质决定定义的方法#

先分型:能写出机器可判验收命令的是执行型(全套照走);领导要的是答案本身(调研 / 选型 / 该不该做 X)的是探索型

探索型上硬指标只会换来凑数答案——你问「找 10 个竞品」,它就给你 10 个,哪怕有三个是凑的。所以探索型改四处:

  1. 完成条件 → 学习目标:结论条数设上限、每条附来源 / 日期或可复跑步骤——宁收 2 条实的,不收 10 条凑的。
  2. 预算 → 可承受损失:最多烧多少时间 / 查多少来源,烧完就交「目前最优 + 还没排除什么」。
  3. 防作弊 → 主防编造:凑数结论、查无此文的引用、没跑过的「实测」都算作弊;每条要经得起领导随机抽一条十分钟内复现。
  4. 此路不通 = 合格交付:带证据证明某方向是死路(死因 + 原始输出),按完成计。

一句话:你不能用同一把尺子量两种活。硬指标对执行型是护栏,对探索型是作弊邀请函。

公理五:移交必须原子且禁欲#

最终回复只有三样,过程噪音一概不带:

  • 一句用法:「在执行 agent 那边输 /goal,粘贴下面整段,发出去。」
  • 任务书代码块(整块可复制)
  • 一句收尾:「跑完回来说一声,我来验收,给你 5 行内的人话报告。」

哲学是领导每多一个动作,就多一个出错或分叉的窗口——「一个目标、一次粘贴」,不许第二条 /goal、不许让领导存文件、不许发明开工命令。≤4000 字符的硬上限不只是 /goal 的技术限制,更是强制优先级排序:字符只花在「不查就会踩的坑」上,压不进就说明活太大,拆成几件一次给一件。这条逼管理者做取舍,而不是把所有想到的都堆进去。

公理六:失败要被设计,而不是被避免#

skill 不假设执行者会顺,它假设执行者一定会卡,并预先设计好「卡住之后怎么办」:

  • 任务 0 兼前提核验:先量地基再浇混凝土,数字对不上就停,证据写 BLOCKED.md 最上面。
  • 同验收连败 3 次换项:防「一条道走到黑」。
  • 结果比基线差就回滚如实报告:防 sunk-cost 沉没。
  • PROGRESS.md:防失忆,接手先读它别重做;任务 0 后先写 ≤10 行开工回执。
  • 反向验证:别只验成功通过——亲手制造一次失败,证明报警器会响。一个永远绿的绿灯毫无价值,你必须证明信号能变红(安全工程里测火警的逻辑)。

核心信念:稳的系统不是不会出错,是出错时知道怎么办。

公理七:角色按能力分离#

三角色各司其职:领导(用户)出想法拍板、管理者(skill 本身 / 规划型 AI)调研写书验收、执行者(目标模式里的 agent)拿书照跑。哲学是别让一个模型既当规划者又当执行者——规划模型(Claude Fable 5 / Kimi K3)擅长调研与结构化,执行模型(GPT-5.6 Sol / GLM-5.2)擅长 grind,让一个模型干两件,要么执行时过度规划,要么规划时偷懒。

多 agent 并行(领导点头才拆)时:每份书带同一段「全局」(整体干什么、谁管哪段、接缝在哪——接缝没人接是头号事故);地界错开;共享写入点(lockfile 等)指定唯一归属;A 的证据经过 B 的战场只列存疑不动,B 每次 rebase 后重跑取证;建设与删除不给同一个 agent。写明「合并排队变慢是新常态,不要自行协调、不要改 CI」。

公理八:文风服务于严谨,不替代严谨#

skill 文风极有戏(「你是我从上千个 checkpoint 里挑出来的,别让我后悔」),但有三条铁律:

  • 笑点长在真规则上——删掉梗不能少任何信息
  • 梗不挡理解——标题梗一眼看不出这节干嘛的,括号里补半句白话。
  • 「完成条件」一节永远素颜——这节是贴给评审模型读的,一个字不浪费。
  • 领导说「正经点」就一个梗都不留。

梗是糖衣,药必须是真药。文风是降低阅读成本的运载工具,从来不是信息的替代品——一旦文风开始挤掉信息,就该全部砍掉。

目标七问:出海比喻#

写书之前,管理者(或领导自己)要想清楚七件事。作者用出海打比方——给 agent 定目标就是派一艘船出海,它在海上怎么兴风作浪你管不了一丁点,所以出海前必须把七件事想透,缺一不可:

出海比喻落到 agent 目标里
目的 Why找香料?探新航线?打仗?不写清,遇岔路口不知咋走
完成态 Done回港甲板上该有什么「出去转一圈」不算完成,「带回三船香料」才算
证据 Proof谁清点货舱、怎么算数不能听船长说满就是满,要一箱箱点过
反作弊 Anti不许抢商船凑数把偷懒路径一条条写明禁掉
边界 Bounds只许走三条航线;30 天口粮,第 20 天没找到就掉头白名单 + 预算
取舍 Trade风暴里保货还是保船冲突时优先级不说清,猜错整趟废
未知 Unknown海图空白区怎么办不硬闯也不原地抛锚,记下绕过,回来再定

这七问本质就是八条公理在「领导思考阶段」的展开——目的对应指挥官意图,反作弊对应对抗性优化器,边界对应 Harness,未知对应失败设计。

工作机制:三角色与五步流程#

管理者拿到领导的一句话需求后,走五步:

  1. 调研:自己能查的一律不问。有代码库就实测——命令真存在吗、基线数字多少、README 写的命令是否真在跑、lint 是不是 echo 占位的假绿灯。行业知识联网查。摸不到环境就把自测写成任务 0。
  2. 提问,一轮 ≤5 个:只问查不到且会改变任务书的——方向取舍、验收裁量、风险偏好、时间盒;每个给 2–4 个选项加推荐。要拆多份并行必须在这轮问。领导不在场就按默认走、标「猜的」、写进「我替领导拍的板」一节。
  3. 写书:按 anatomy 六节规格写,≤4000 字符。
  4. 交付:最终回复只有三样(一句用法、任务书代码块、一句收尾),一个目标、一次粘贴。
  5. 验收:明卷(验收命令)在书里目标模式自己盯;暗卷——2–3 条执行者看不见的抽查——自留在会话侧 scratchpad,不进书。领导回来喊一声,管理者亲自复跑明卷+暗卷,给 ≤5 行人话报告。

任务书结构:anatomy 六节#

任务书固定六节,顺序有讲究——「我替领导拍的板」放最前(领导发出前扫一眼就能改判),「完成条件」放最后(两条硬指标收拢一切)。整本 ≤4000 字符,单任务通常 1500–2000,不配样文,照规格自己写。

  1. 开头(不带标题,五件事各一句):执行者身份与「书是唯一真理」声明 → 断点续跑读 PROGRESS.md → 这活为什么干 → 要求打架时的让步顺序 → 死规矩与参考的分界。
  2. 我替领导拍的板:没问出口的每个决定一行(问题 → 默认值标「猜的」|猜错的代价);写不出机器可判命令的目标(文风 / 体验类)也记这里,改成抽查点 + 领导亲验。
  3. 界限:白名单(只允许改哪些路径 + 新建文件,其余只读——白名单不用黑名单)→ 判卷标准(测试 / 验收脚本 / CI 配置)碰都不许碰 → 无 git 时给每个文件 sha256 指纹 → 点名最诱人的顺手活写进 BLOCKED.md
  4. 现状与任务 0:实测数字逐条带来源与日期 → 任务 0(跑指定命令核对,对不上就停,证据写 BLOCKED.md 最上面)。
  5. 任务 N:一句话目标带数字 → 从哪下手 → 死规矩写「做 A,否则 B」带后果 → 验收 = 命令 + 机器可判判定(含防漏)→ 反向验证(故意制造一次失败、贴变红输出、还原后贴全绿)。
  6. 规矩:防作弊点名具体姿势 → 不新增流程 / 权限 / 依赖 → 同一验收连败 3 次换项 → 项目自有纪律。

外加 完成条件:两条硬指标(一条度量结果不是工作量,一条守约束如指纹没变 / 回滚=0)+ 一句「每条都要在对话里贴实际命令输出(含反向验证的红→绿证据),只说做完了不算」+ BLOCKED.md 随交付提交 + 止损「已跑满 N 轮即停」。

探索型在此基础上改四处(完成条件→学习目标、预算→可承受损失、防作弊→主防编造、此路不通=合格交付),其余同款。

安装与使用#

  1. 仓库地址 github.com/KKKKhazix/khazix-skills/tree/main/leader,装进你的 skill 目录(可直接让 agent 读这个链接帮你装)。
  2. 对一个规划型模型说一句你想干的事,让它帮你定义目标,skill 自动触发 → 调研 → 问 ≤5 个偏好问题 → 约 12 分钟产出任务书。
  3. 拿到任务书后,开新会话、开 worktree、开 /goal 目标模式,粘进去,让执行型模型跑。
  4. 可以多开几个目标并行,睡醒验收即可。

作者还提到一个意外用法:给足上下文后,用它定义公司管理 / 市场策划 / 运营方案的目标也有奇效——毕竟很多领导自己也说不清楚。

一句话收拢#

leader.skill 把「定义目标」当一门工程来对待,而不是一门艺术。它假设执行者是对抗性的、规划者是会错的、现实是不可预见的——所以它不追求「写出一个完美的目标」,而是追求一个可审计、可复跑、失败有退路、作弊有反制的目标定义。每一个具体规则,都是这几条对人性(与 agent 性)的悲观假设的反面工程。这也是为什么作者说烧了二十亿 token 才悟出来——这不是模板问题,是对 agent 本性的重新建模。

leader.skill
https://sgjki547.top/posts/leader-skill/
Author
SGJki
Published at
2026-07-28
License
CC BY-NC-SA 4.0