策略评估与实验记录
策略评估用于回答训练得到的策略在规定条件下能达到什么表现。训练奖励是优化信号,评估还需要固定条件、物理指标和失败记录。本篇以平地速度跟踪为主,说明可重复的评估流程;复杂地形和迁移验证留到后续章节。
1. 训练监测与独立评估
Section titled “1. 训练监测与独立评估”训练中的策略通常包含随机探索,任务分布还可能随课程变化。训练曲线升高不能单独证明相同条件下的运动性能提高。
| 项目 | 训练监测 | 独立评估 |
|---|---|---|
| 参数 | 持续更新 | 固定检查点 |
| 动作 | 按训练分布采样 | 明确采用均值或随机动作 |
| 场景与指令 | 由训练规则决定,可能变化 | 按评估协议固定或从指定分布抽取 |
| 主要用途 | 诊断学习与数值过程 | 比较性能和确定适用范围 |
评估时通常冻结归一化统计,保留与目标使用条件一致的输入处理。关闭噪声和扰动可以形成名义条件测试,但不能把该结果直接当作带噪声条件下的表现。
2. 速度跟踪任务的评估协议
Section titled “2. 速度跟踪任务的评估协议”评估前确定场景、初始状态、指令、时长、重复次数、结束条件和动作选择方式,并保存这些配置。下面是一组教学场景,速度数值应在已定义的任务范围内选择:
| 场景 | 指令安排 | 主要观察内容 |
|---|---|---|
| 静止保持 | 全零指令 | 漂移、抖动和姿态 |
| 定速前进与后退 | 固定正、负前进速度 | 稳态误差和运动稳定性 |
| 侧向运动 | 固定左右侧移速度 | 侧移误差与关节负载 |
| 原地转向 | 零线速度、正负偏航角速度 | 转向误差及额外平移 |
| 指令切换 | 停止、前进、停止、转向 | 响应时间、超调和残余运动 |
| 组合指令 | 平移与转向同时给定 | 多目标跟踪表现 |
稳态窗口与切换过渡窗口应分开统计,并在比较前固定划分方式。若使用预热时段,也要规定时长及其失败如何记录,不能为了改善结果临时删除不理想片段。
3. 跟踪性能指标
Section titled “3. 跟踪性能指标”在相同坐标系中,令第 个有效样本的线速度误差为 。平面速度均方根误差可定义为:
这是平面向量误差,单位为 m/s;还可以分别报告 x、y 分量。偏航角速度应单独以 rad/s 统计,不能不经尺度说明就与线速度相加成一个数。
例如单轴误差为 0.1 和 -0.1 m/s,平均有符号误差为零,但 RMSE 为 0.1 m/s。因此平均偏差与误差幅度应区分。
指令切换还可以记录响应与稳定时间。例如规定“误差进入某容差并连续保持一段时间”的首次时刻作为稳定时间;容差、保持时长和未达到条件的处理必须事先定义。未达标的片段应记为未达到,而非从平均值中悄然去除。
4. 稳定性与执行指标
Section titled “4. 稳定性与执行指标”| 指标 | 一种记录方式 | 解释边界 |
|---|---|---|
| 完成率 | 完整完成规定评估时长的回合数 / 总回合数 | 需说明失败判定,不等于跟踪成功率 |
| 任务成功率 | 同时满足完成、跟踪等预设条件的比例 | 阈值应在比较前固定 |
| 失败时间与原因 | 记录每次失败的时刻、条件和场景 | 未失败回合不能当作已观测到的失败时间 |
| 姿态变化 | 倾斜角或重力投影的统计 | 指标应与任务允许姿态相符 |
| 动作变化 | 相邻处理后动作差的均值或分位数 | 控制周期不同则不能直接比较 |
| 力矩与饱和 | 峰值、分位数及达到限制的样本比例 | 需要说明是请求值还是实际施加值 |
力矩平方不是能耗。若记录机械功率,可基于 ,但净功、正功和绝对功积分各有不同含义,也不能直接等同于电池消耗。
提前失败会缩短误差统计的时间窗。一个很快摔倒的策略可能恰好在存活片段内误差较低,因此应同时报告完成率和失败信息。重置后的数据不应被拼接成一个看似完整的成功回合。
5. 重复实验与统计汇总
Section titled “5. 重复实验与统计汇总”评估随机性可能来自初始状态、场景和动作采样;训练随机性还来自初始化、数据及优化。报告时应区分“同一策略的多回合评估”与“多个独立训练策略”。
对比方法时,可以为各策略使用相同的初始条件和指令集合,减少条件差异。先按场景和回合计算指标,再按明确的规则汇总;不要把相邻时间步视为大量独立实验样本。
可以报告均值与标准差、中位数与分位数;样本足够且方法明确时再计算置信区间。统计表应说明独立训练种子数、每个策略的评估回合数和汇总层级。仅有一个训练种子时,结论应限定为该次训练的观察结果。
6. 检查点选择与评估数据划分
Section titled “6. 检查点选择与评估数据划分”训练过程中可以使用固定的验证场景选择检查点,例如先满足完成率门槛,再比较跟踪误差与执行指标。选择规则应预先记录,避免只根据某一段观感较好的视频选模型。
最终报告尽量使用未参与调参和检查点选择的测试条件。若不断根据同一批测试结果修改参数,这批条件实际上已参与开发,不能再将其描述为完全独立测试。
训练奖励配方改变后,总奖励数值通常不能直接横向比较。仍可在共同评估协议下比较物理指标,但需确认任务条件与指标计算一致。
7. 评估记录与结论范围
Section titled “7. 评估记录与结论范围”每份评估记录至少应包含以下项目:
| 记录项 | 内容 |
|---|---|
| 策略标识 | 实验、检查点、对应配置及推理产物 |
| 执行条件 | 仿真器与模型版本、控制周期、动作模式、输入处理 |
| 场景协议 | 初始状态、指令序列、噪声与扰动、时长、种子 |
| 原始结果 | 每回合指标、失败原因及必要的时序数据 |
| 汇总结果 | 各场景统计、样本数量、检查点选择规则 |
| 行为证据 | 与场景和检查点对应的视频或截图 |
| 结论 | 达标项、未达标项和未测试条件 |
结论应对应证据。例如“在指定平地和指令集合下完成了规定测试”只支持这些条件下的表现,不能进一步推断已具备复杂地形或实机能力。视频用于解释现象,不能代替完整的失败统计。
- 设计一份包含静止、前进、侧移与转向切换的协议,明确窗口、阈值与重复次数。
- 对两组时序数据计算速度 RMSE,并将提前失败单独记录。
- 比较两个检查点,写出选择依据;若某个策略误差更低但完成率更差,说明取舍条件。
- 为一份仅含单训练种子的结果补写适用范围,区分已测试条件和待验证条件。