跳转到内容

策略评估与实验记录

策略评估用于回答训练得到的策略在规定条件下能达到什么表现。训练奖励是优化信号,评估还需要固定条件、物理指标和失败记录。本篇以平地速度跟踪为主,说明可重复的评估流程;复杂地形和迁移验证留到后续章节。

训练中的策略通常包含随机探索,任务分布还可能随课程变化。训练曲线升高不能单独证明相同条件下的运动性能提高。

项目训练监测独立评估
参数持续更新固定检查点
动作按训练分布采样明确采用均值或随机动作
场景与指令由训练规则决定,可能变化按评估协议固定或从指定分布抽取
主要用途诊断学习与数值过程比较性能和确定适用范围

评估时通常冻结归一化统计,保留与目标使用条件一致的输入处理。关闭噪声和扰动可以形成名义条件测试,但不能把该结果直接当作带噪声条件下的表现。

评估前确定场景、初始状态、指令、时长、重复次数、结束条件和动作选择方式,并保存这些配置。下面是一组教学场景,速度数值应在已定义的任务范围内选择:

场景指令安排主要观察内容
静止保持全零指令漂移、抖动和姿态
定速前进与后退固定正、负前进速度稳态误差和运动稳定性
侧向运动固定左右侧移速度侧移误差与关节负载
原地转向零线速度、正负偏航角速度转向误差及额外平移
指令切换停止、前进、停止、转向响应时间、超调和残余运动
组合指令平移与转向同时给定多目标跟踪表现

稳态窗口与切换过渡窗口应分开统计,并在比较前固定划分方式。若使用预热时段,也要规定时长及其失败如何记录,不能为了改善结果临时删除不理想片段。

在相同坐标系中,令第 kk 个有效样本的线速度误差为 ek=vxy,kvxy,kcmde_k=v_{xy,k}-v_{xy,k}^{cmd}。平面速度均方根误差可定义为:

RMSExy=1Kk=1Kek2\mathrm{RMSE}_{xy}=\sqrt{\frac{1}{K}\sum_{k=1}^{K}\|e_k\|^2}

这是平面向量误差,单位为 m/s;还可以分别报告 x、y 分量。偏航角速度应单独以 rad/s 统计,不能不经尺度说明就与线速度相加成一个数。

例如单轴误差为 0.1 和 -0.1 m/s,平均有符号误差为零,但 RMSE 为 0.1 m/s。因此平均偏差与误差幅度应区分。

指令切换还可以记录响应与稳定时间。例如规定“误差进入某容差并连续保持一段时间”的首次时刻作为稳定时间;容差、保持时长和未达到条件的处理必须事先定义。未达标的片段应记为未达到,而非从平均值中悄然去除。

指标一种记录方式解释边界
完成率完整完成规定评估时长的回合数 / 总回合数需说明失败判定,不等于跟踪成功率
任务成功率同时满足完成、跟踪等预设条件的比例阈值应在比较前固定
失败时间与原因记录每次失败的时刻、条件和场景未失败回合不能当作已观测到的失败时间
姿态变化倾斜角或重力投影的统计指标应与任务允许姿态相符
动作变化相邻处理后动作差的均值或分位数控制周期不同则不能直接比较
力矩与饱和峰值、分位数及达到限制的样本比例需要说明是请求值还是实际施加值

力矩平方不是能耗。若记录机械功率,可基于 P=jτjq˙jP=\sum_j\tau_j\dot q_j,但净功、正功和绝对功积分各有不同含义,也不能直接等同于电池消耗。

提前失败会缩短误差统计的时间窗。一个很快摔倒的策略可能恰好在存活片段内误差较低,因此应同时报告完成率和失败信息。重置后的数据不应被拼接成一个看似完整的成功回合。

评估随机性可能来自初始状态、场景和动作采样;训练随机性还来自初始化、数据及优化。报告时应区分“同一策略的多回合评估”与“多个独立训练策略”。

对比方法时,可以为各策略使用相同的初始条件和指令集合,减少条件差异。先按场景和回合计算指标,再按明确的规则汇总;不要把相邻时间步视为大量独立实验样本。

可以报告均值与标准差、中位数与分位数;样本足够且方法明确时再计算置信区间。统计表应说明独立训练种子数、每个策略的评估回合数和汇总层级。仅有一个训练种子时,结论应限定为该次训练的观察结果。

训练过程中可以使用固定的验证场景选择检查点,例如先满足完成率门槛,再比较跟踪误差与执行指标。选择规则应预先记录,避免只根据某一段观感较好的视频选模型。

最终报告尽量使用未参与调参和检查点选择的测试条件。若不断根据同一批测试结果修改参数,这批条件实际上已参与开发,不能再将其描述为完全独立测试。

训练奖励配方改变后,总奖励数值通常不能直接横向比较。仍可在共同评估协议下比较物理指标,但需确认任务条件与指标计算一致。

每份评估记录至少应包含以下项目:

记录项内容
策略标识实验、检查点、对应配置及推理产物
执行条件仿真器与模型版本、控制周期、动作模式、输入处理
场景协议初始状态、指令序列、噪声与扰动、时长、种子
原始结果每回合指标、失败原因及必要的时序数据
汇总结果各场景统计、样本数量、检查点选择规则
行为证据与场景和检查点对应的视频或截图
结论达标项、未达标项和未测试条件

结论应对应证据。例如“在指定平地和指令集合下完成了规定测试”只支持这些条件下的表现,不能进一步推断已具备复杂地形或实机能力。视频用于解释现象,不能代替完整的失败统计。

  1. 设计一份包含静止、前进、侧移与转向切换的协议,明确窗口、阈值与重复次数。
  2. 对两组时序数据计算速度 RMSE,并将提前失败单独记录。
  3. 比较两个检查点,写出选择依据;若某个策略误差更低但完成率更差,说明取舍条件。
  4. 为一份仅含单训练种子的结果补写适用范围,区分已测试条件和待验证条件。