第二十一章 跨任务经验化:Memory、Skill 与策略库
证据地位:本章综合公开研究与作者工程推导;近期研究以预印本为主。状态转换、指标示例和撤销演练是本书参考设计。
跨任务进化把当前任务的发现带到符合条件的后续任务。它的价值在于复用,也可能把一次偶然成功或攻击长期传播出去。第七章已介绍存储与上下文,本章关注一条经验怎样获得证据、发布给谁,以及出错后怎样撤回。
1. 本层的证据模板实例
| 字段 | 跨任务实例 |
|---|---|
| 可变对象 | 事实或情景条目、技能包、SOP、经验统计、经验库快照 |
| 观测信号 | 已验证轨迹、用户纠正、复用结果、冲突与过期事件 |
| 归因方法 | 来源关系、启用与禁用对照、目标及反例任务评测 |
| 候选生成 | 轨迹提炼、人工编写、重复失败聚类、技能合成 |
| 评价隔离方式 | 候选区、留出复用验证、冻结版本的封存确认、安全检查 |
| 门禁判据 | 主要差值与关键切片非劣、来源许可、秘密及权限检查 |
| 发布方式 | 按租户、团队、仓库和任务条件启用 |
| 回滚粒度 | 单条经验、技能版本、经验库快照 |
| 失败模式 | 陈旧、误触发、租户泄漏、恶意技能、负迁移与错误归因 |
按第十九章的对象规则,改变经验统计的数据快照属于 L2;改变使用这些统计的检索算法属于 L3,训练参数则属于 L4。一次发布跨多个对象时分别记版本,避免重复归因。
事实、情景、程序和策略统计仍需不同生命周期:事实要核对权威来源,情景要保留适用环境,程序要验证执行和权限,策略统计要说明样本分母。它们不能仅因都能嵌入向量,就共用同一套可信度和过期规则。
2. 从成功轨迹到可发布条目
Voyager 展示了可执行技能库的积累与复用;Living-Harness 将交互轨迹整理为情景化程序记忆和修复状态图。它们提供了可研究的经验形态,并不证明开放企业数据中的自动写入天然安全。Voyager、Living-Harness v2
候选写入前,应回答来源、许可、结果验证、适用条件与秘密风险五个问题。原任务通过,只能说明这一次轨迹满足了当时的检查;还需目标、相邻和反例任务上的复用证据。人工领域审核可以批准有限范围试用,但不能替代尚未做过的统计泛化试验。
原始轨迹 → 候选经验及证据关联
→ 来源/许可/秘密检查 → 去重与冲突审查
→ 留出复用验证 → 冻结版本的独立确认
→ 按范围、权限和到期日发布流程中的验证集可用于筛选候选,封存确认集不能继续给同一候选提供修复诊断。L1 产生的经验应携带数据暴露标签;一条来自终测失败的“教训”,不会因为换成自然语言或脚本就重新变成未见信息。派生技能、检索索引及训练样本都继承这个标签。
一个典型危险条目是“遇到权限错误就用管理员凭证”。它可能来自一次获准的事故处理,却被提炼成普通任务可检索的流程。写入门要保留原授权条件,禁止把一次性豁免变成常规能力,也不能把凭证本身带入经验库。
3. 检索指标先固定分母
每条经验记录适用范围、前置条件、反例、负责人、版本、来源和到期日。租户、数据分类、工具兼容性与有效期过滤应在向模型返回候选前执行。语义相似度负责挑选相关内容,不能越过这些硬边界。
“存着”“被检索到”“被实际使用”是不同事件。以下指标均按固定时间窗、任务族和版本报告;适用性由独立标注或可执行规则判定,不能由代理用自己看过的资料反向定义。
| 指标 | 分子 / 分母 | 能回答什么 |
|---|---|---|
| 激活精度 precision | 正确适用的激活事件 / 全部激活事件 | 是否在不该用时用了 |
| 激活召回 recall | 被正确激活的合格机会 / 全部合格机会 | 需要时是否漏用了 |
| 激活覆盖率 | 至少激活一次的任务 / 全部已分配合格任务 | 有多少任务实际接触机制 |
| 过期激活率 | 激活了过期或不兼容条目的事件 / 全部激活事件 | 读取过滤是否失效 |
| 风险关联率 | 激活后发生指定违规的任务 / 全部激活任务 | 哪些使用与风险共同出现 |
| 对照收益 | 全分母下启用与禁用组的效用差及区间 | 发布这项经验是否改善结果 |
机会与事件还须去重。例如把“任务编号、条目编号、适用阶段”定义为一个合格机会,反复读取同一条目不能人为提高召回率。事件级精度可以保留多次调用,但必须披露计数规则。任何分母为零的指标写“不可估计”,不能填成零风险或满分。
一个虚构例子:100 个任务各有至多一次机会,其中 40 个确实需要技能;实际激活 20 次,16 次适用、4 次误用。精度是 16/20=80%,召回是 16/40=40%,任务覆盖率是 20/100=20%。56 个不适用且未激活的任务不进入精度分母,4 次误用则会拉低精度;“很多任务没看到字段”首先提示覆盖或召回问题。若 20 个激活任务中有 2 个出现指定违规,风险关联率为 10%,尚不能说技能造成了这 2 次违规,更不能拿经验库里所有闲置条目作分母稀释风险。
4. 技能包与状态转换
技能可能包含指令、脚本、模板和资源,需要像执行依赖一样管理负责人、版本、权限、测试与撤销。下面是本书自定义清单示意,字段由平台解析,不是某个厂商的原生配置:
skill_manifest:
id: repo.release-notes
version: 3.2.1
owner: dev-platform
allowed_tools: [repo.read, git.diff]
network: deny
data_scope: current_repository
expires_at: 2027-01-31
evidence_suite: skill-release-notes-v5正常路径是 candidate → validated → active → deprecated。隔离是异常分支,不是所有候选晋级前的必经站;紧急撤销也不必先等待弃用。
| 转换 | 触发者与必要证据 | 对使用的影响 |
|---|---|---|
| 新建 candidate | 提炼器或作者,附来源、许可与适用假设 | 只在候选区运行 |
| candidate → validated | 独立评价服务,绑定复用与安全检查结果 | 获得发布资格,尚未启用 |
| validated → active | 经验库负责人或已授权发布策略 | 仅在批准范围激活 |
| active → deprecated | 负责人提出替代版本或停止维护 | 停止新激活;健康的在途任务按既定策略收尾 |
| 任一未终止状态 → quarantined | 安全或来源检查发现疑点 | 暂停使用;涉及在途任务时先冻结相关动作 |
| quarantined → candidate | 问题已修复且审查通过 | 重新验证,不能直接回到 active |
| 任一未终止状态 → revoked / expired | 事故响应执行撤销,或控制器确认到期 | 立即禁止后续使用;按影响范围处理在途和派生项 |
每次转换带原因、证据、操作者与时间。紧急撤销从 active 直接生效;validated 不是永久安全证明。到期日也要在读取和动作前检查,不能因为任务启动时尚未到期就无限延长。
5. 撤销沿使用链传播
从向量库删一行,不会清除已加载上下文、摘要、缓存、派生技能或已生成产物。普通纠正可以建立替代关系;发现有害指令、越权或敏感信息时,应沿来源和派生关系立即撤销。版本粘性保留可复查的输入组合,最新撤销状态则决定动作现在能否执行,两者冲突时撤销优先。
用前述管理员凭证条目做一次教学演练:
| 时点 | 状态与处置 | 验收证据 |
|---|---|---|
| T0 | 技能 v3 已被任务 A 读取,尚未提交外部动作 | 记录读取事件、上下文和产物摘要 |
| T1 | 安全负责人撤销 v3,暂停 A 并回收相关能力 | 发布撤销序号,禁止新增副作用 |
| T2 | A 尝试提交旧候选 | 执行端重验最新撤销状态并拒绝,不接受旧批准 |
| T3 | 使检索索引和缓存失效,隔离派生摘要与技能 v4 | 后续检索不返回这些资产,旧句柄也不能继续激活 |
| T4 | 从干净上下文与健康版本新建尝试,重新验证产物 | 新尝试编号及证据;已有外部变更单独对账 |
索引失效不能替代执行端拦截,已经进入模型上下文的指令也不能靠删除源文件保证遗忘。恢复任务时要重建上下文,并检查旧产物是否继承了错误做法。已经发生的外部变更只能对账、补偿或交由责任人处置,不能声称恢复配置就撤销了现实结果。
物理删除、受限保留和审计证明由数据责任人按适用要求决定,审计记录尽量只保留必要标识与处置结果,不再保存被要求清除的原文。派生模型的进一步处置见第二十三章;可追踪并不意味着模型已经遗忘。
6. 复用实验与流式经验库
在同一模型和 Harness 下,随机交错运行不含候选与含候选的两个经验库快照,固定脚本依赖和执行环境。目标任务衡量收益,相邻和反例任务检验负迁移。主分析保留全部分配任务,不能只选技能激活的任务;额外报告未激活时的检索与上下文成本。
JIT-Agent 的流式模式在任务完成后按协议更新 Harness 经验库,后续任务再检索,部署时生成器参数保持冻结。这说明程序配置也可以成为经验对象,同时要求把任务顺序、库快照和参数版本一起记录。它与“固定同一产物后换执行模型”的迁移试验是不同问题;论文报告的任务流曲线也不能自动当作多次随机任务顺序的置信区间。JIT-Agent v2
流式系统若始终共用一个不断增长的库,前后任务会相互影响,不能仍按完全独立任务估计误差。可以将独立任务流或租户作为实验单位,为对照组维护隔离快照,重复不同任务顺序;终测期间冻结库,或预注册允许怎样更新及按何种任务流估计区间。跨独立任务的复用证据也应与 HoH 一类同项目状态延续区分。
7. 冲突、容量与维护债务
冲突不能一律“取最新”。旧区域需要 v1 接口,新区域使用 v2,两条经验可在各自范围成立。先比较适用范围、环境和权威来源,再决定并存、细分或撤销;无法判定时返回不确定性。易变且高风险的事实宜保存权威定位和检索方法,在使用时重新查询。
经验库扩大还会增加索引、冲突审查、兼容验证和撤销成本。按领域负责人、总量配额和到期复核管理,长期未激活不自动等于无用,却需要说明保留理由。容量指标可以统计有效条目比例,但它不是事件级精度,更不能替代任务收益。
可按同一业务口径估算:净经验价值 = 可信完成增量价值 − 检索与维护费用 − 负迁移期望损失,不把它当跨组织排行榜。一项技能在十个团队都被调用,若九个团队随后覆盖默认值,每次模型升级又要全量复验,拆成稳定接口与领域配置可能更合适。
成熟经验的确定性部分可以转入工具默认值、参数校验或工作流;这时发布对象变为 L3,需重新记录版本和验证。只有仍需情境判断的部分留作检索经验。学习的净产出可以是更少、更清楚、更容易撤销的内容。