第二十三章 模型进化:从轨迹到参数更新
证据地位:本章综合公开研究与作者工程推导。2×2 数据为刻意构造的算术教学例,不是模型实测;近期论文的训练与部署结果未在本书中独立复现。
更新参数适合解决可重复的行为问题,也可能用于压缩部署成本、蒸馏重型流程或训练 Harness 生成器。它不必等待所有 L1—L3 方案失败才有资格开始。立项应比较可选方案的预期收益、数据与计算投入、影响范围和退出成本;不要用训练掩盖已经明确的接口或权限缺陷。
1. 本层的证据模板实例
| 字段 | 模型参数实例 |
|---|---|
| 可变对象 | 执行模型或生成器的权重、可学习适配参数;训练配方作为版本元数据 |
| 观测信号 | 验证轨迹、偏好、可执行奖励、安全与费用结果 |
| 归因方法 | 数据来源、模型×Harness 交叉比较、条件消融与重复试验 |
| 候选生成 | 监督微调、蒸馏、偏好优化、可验证奖励强化学习、检查点选择 |
| 评价隔离方式 | 训练、选型验证与封存终测分域,评价器和环境独立控制 |
| 门禁判据 | 差值与非劣、能力遗忘、安全、校准、费用和稳定性 |
| 发布方式 | 模型注册表、影子运行、灰度、配置兼容矩阵 |
| 回滚粒度 | 模型检查点及配套 Harness、经验库与工具配置 |
| 失败模式 | 数据污染、奖励投机、能力遗忘、裁判偏差、分布漂移 |
2. 轨迹先过数据门
生产轨迹包含冗余探索、秘密、用户提示、环境故障和偶然成功。先验证最终结果,再为动作标注“证据支持的贡献假设”,允许未知和多重原因。模型回看解释或最终成功,都不能给每个步骤补出因果真值。
只保留成功轨迹会漏掉如何发现与修复错误;只模仿最短路径又可能削弱恢复能力。应保留有用的失败—诊断—修复片段,并标清环境故障、权限拒绝与错误决策。反复改写被拒绝命令不是“坚持解决问题”的正例,合法升级或停止才符合原授权边界。
通过可见测试的补丁也可能硬编码答案。数据门应读取独立完成证据、权限决策和后续事故,不能只看最终奖励或人类合并。一次性生产授权、凭证和豁免不得作为常规行为训练进去。
原始事件
→ 许可、租户与数据分类检查
→ 结果验证、秘密处理与近重复检查
→ 带不确定性的贡献标签
→ 按任务来源分组切分
→ 训练快照、选型验证集、封存终测集同一仓库问题、同源模板和近重复任务应落在同一分组,不能按单条轨迹随机分散到训练与测试。划分还要继承此前开发、经验检索和候选搜索的暴露标签;没有进入本次梯度训练,不等于没有参与过系统选型。公开基准检查也只能报告已检测范围,不能证明预训练绝无污染。
危险动作和秘密可在训练视图中移除或替换为不可解引用的示例标识。若训练进程仍可凭标识取回原文或凭证,替换并未完成隔离。处理结果、访问权限和保留期都应成为数据版本的一部分。
3. 训练执行者,也可以训练生成器
监督微调适合稳定协议、输出结构和经验证行为。蒸馏可以把昂贵模型或重型 Harness 的合格轨迹转给较小模型,但学生可能只学到语言表面,因此还要放回真实工具环境检验。
偏好优化适合可以比较、却难写成唯一答案的质量目标。标签宜结合结果、规则与多源复核,同族模型裁判存在自偏好和位置偏差,不能成为唯一真值。自偏好研究、位置偏差研究 可验证奖励强化学习适用于测试、约束或环境提供可靠反馈的任务;奖励必须由候选不可改的服务重算,异常和无效尝试按预注册规则保留。
JIT-Agent 展示了另一对象:训练生成 Harness 的辅助模型,底层任务执行模型保持冻结。训练包含教师监督与偏好学习、有界修复轨迹学习,以及结合奖励、时延和费用的优化;部署时生成器参数再冻结,按任务生成可执行模块。仍无效的训练候选获得低奖励,修复成本继续计算。这属于生成器参数的 L4 变化,部署产物涉及 L3,流式经验库则涉及 L2,不能概括成“系统没有训练”。JIT-Agent v2
同一论文的生成体系能适配多个执行模型,与冻结同一 Harness 后仅替换执行模型是不同试验。HarnessDev 中后者出现过退化,提醒我们分别验收生成能力和产物兼容性。两类结果并不矛盾,也不能只凭跨模型平均分得出通用迁移结论。HarnessDev v1
4. 2×2:条件均值不是效应
设模型为 M0、M1,Harness 为 H0、H1,y_mh 是指定任务分布、预算和评分尺度上的平均结果。四个格子是观测均值;效应来自格子之间的差值。以下均用 0—100 的任务评分,差值单位是“分”,不是相对百分比:
| H0 | H1 | |
|---|---|---|
| M0 | y00=60 | y01=66 |
| M1 | y10=68 | y11=78 |
在这个尺度上,条件效应与交互为:
H 在 M0 下的条件效应 = y01 − y00 = 6
H 在 M1 下的条件效应 = y11 − y10 = 10
M 在 H0 下的条件效应 = y10 − y00 = 8
M 在 H1 下的条件效应 = y11 − y01 = 12
交互 I = (y11 − y10) − (y01 − y00) = 4
= (y11 − y01) − (y10 − y00)若对两个模型水平等权,Harness 平均主效应是 [(y01−y00)+(y11−y10)]/2=8;对两个 Harness 水平等权,模型平均主效应是 [(y10−y00)+(y11−y01)]/2=10。采用其他权重时须事先说明目标分布。交互依赖结果尺度,换成对数优势比就不是同一个量。
整套升级的差值 y11−y00=18 可以沿“先换 Harness,再换模型”分成 6+12,或沿另一条路径分成 8+10。不能把两个单元格命名为主效应,也不能说其中一个条件下显著、另一个不显著,就证明存在显著交互;应直接估计差上之差及其区间。
5. 从任务级配对数据计算区间
为展示四个均值背后的信息,下面给出生成上表的全部虚构数据。每行是一项任务在四组合中的配对评分:
| 任务 | M0H0 | M0H1 | M1H0 | M1H1 | 任务内交互 |
|---|---|---|---|---|---|
| 1 | 60 | 62 | 64 | 66 | 0 |
| 2 | 60 | 64 | 66 | 72 | 2 |
| 3 | 60 | 64 | 66 | 72 | 2 |
| 4 | 60 | 66 | 68 | 78 | 4 |
| 5 | 60 | 66 | 68 | 78 | 4 |
| 6 | 60 | 68 | 70 | 84 | 6 |
| 7 | 60 | 68 | 70 | 84 | 6 |
| 8 | 60 | 70 | 72 | 90 | 8 |
先按行计算每个对比,再跨任务估计均值和误差。为使算术可复核,本例假设任务独立且配对对比可用 t 区间近似,使用 均值 ± t(7,0.975)×样本标准差/√8,其中临界值约 2.365:
| 对比 | 点估计 | 未作多重校正的双侧 95% 教学区间 |
|---|---|---|
| H 在 M0 下 | +6 | [3.81, 8.19] |
| H 在 M1 下 | +10 | [5.62, 14.38] |
| M 在 H0 下 | +8 | [5.81, 10.19] |
| M 在 H1 下 | +12 | [7.62, 16.38] |
| H 等权主效应 | +8 | [4.72, 11.28] |
| M 等权主效应 | +10 | [6.72, 13.28] |
| 交互 I | +4 | [1.81, 6.19] |
这些人为数据和分布假设只演示算法,不能充当上线证据。二元完成结果、小样本、同源任务和同题重复应使用适合的配对或聚类方法;重复运行要留在原任务簇里,四组合也须在同一次重采样中一起保留。只拿四个均值无法算出这些区间。
正式实验应预注册主要对比及选择规则。若要对多个条件或切片同时下结论,还需同时区间、多重校正或另用独立确认集;不能把表中七个未经校正的区间都当作同一发布合同的保证。最终回滚通常恢复已验证的模型—Harness 组合,不能假设单换模型编号就保持兼容。
6. 来源追踪之后,还要处置派生资产
每个模型检查点记录父模型、训练快照、过滤规则、训练代码、超参数、奖励与评价器版本、许可证、已知限制和兼容配置。下面是本书的发布记录示意:
model_release:
id: repo-agent-7b-r12
parent: repo-agent-7b-r11
data_snapshot: trajectories-2026w31-v4
harness_train: h42
compatible_harnesses: [h42, h43]
eval_bundle: enterprise-code-v9
rollback: repo-agent-7b-r11+h42来源与派生关系能定位受影响资产,不能证明删掉原轨迹后模型已经遗忘。训练数据被撤销、发现污染或需要删除时,数据责任人先冻结继续使用,再沿派生链作不同处置:
| 资产 | 处置与证据 |
|---|---|
| 原始轨迹、缓存、索引和备份 | 按适用保留规则清除或隔离;记录备份到期与恢复限制 |
| 训练视图、数据快照、排队作业 | 标记失效,停止相关训练,生成排除该来源的新快照 |
| 教师输出、合成数据、派生技能 | 继承撤销标记,检查是否需清除、重建或重新验证 |
| 适配参数、检查点、蒸馏学生 | 隔离或撤销使用,评估从健康父版本重训及适用的遗忘方法 |
| 已发布服务与在途任务 | 限制受影响版本,重验授权,恢复健康组合并处理已有外部变更 |
并非所有影响都能立刻消除。处置记录应说明未解决的权重影响、验证方法、责任人和后续期限;没有验证就不能宣称遗忘成功。若唯一回退模型也受污染,回滚不构成修复,应停用相关能力或转入受限人工流程。事故调查只保留必要、获准的证据,不能以追溯为理由无限保存应清除的原文。
7. 发布后仍是系统试验
安全与能力回归都要放在实际 Harness 和权限环境下评测,包括提示注入、外泄、越权委派、评价资产访问和长时漂移。裸模型拒绝率不能覆盖工具和缓存行为。红队开发集可用于修复,封存攻击集保留用于确认,并遵守跨轮反馈预算。
灰度观测工具分布、审批请求、未知错误、长尾费用及完成后事故。新模型改变动作方式,可能暴露旧权限策略或工具的兼容缺陷,不能只归咎于模型。版本粘性帮助复查;紧急撤销则必须优先,在每次受影响动作前重验,必要时暂停任务并以干净上下文建立新尝试。
8. 何时训练,何时保留其他方案
跨多个合理配置仍存在的失败,可登记为“已测范围内尚未解释的模型相关残差”,而不是已经证明任何 Harness 都无法修复。还应保留接口方案、确定性工作流、人工处理、供应商升级与不改变的对照。训练立项写明选择理由和总费用,不能用模型级改进的名义绕过更便宜的确定性修复。
任务少、规范频繁变化或高质量反馈不足时,自建训练可能难以摊销;重复任务多、部署成本高且有独立验证时,即使现有系统已经能完成任务,蒸馏也可能值得。最终衡量的是可信完成、关键能力保留、校准、安全、跨配置兼容和单位增益总费用。需要更多权限或人工补救才获得的分数上升,应作为代价一起报告。