言情小说网 > 其他类型 > 豪门千金带娃上门,觉醒奶爸系统 > 第622章 行人识别的准确率达到了设计目标(3/3)
些边界情况交给强化学习模型去泛化。

但是奖励函数的设计怎么定?如果奖励函数偏重通行效率,模型可能倾向于激进的变道策略;

如果偏重舒适性,又可能在需要快速响应的时候动作太慢。”

陈峰调出奖励函数的设计文档,翻到中间那一页。

“奖励函数分了三个维度——安全性权重最高,占零点六;通行效率零点三;舒适性零点一。

安全性维度以碰撞时间的倒数为惩罚项,通行效率以平均速度为奖励项,舒适性以加加速度的绝对值作为惩罚项。

三个维度加权求和,权重比暂时不动,后面仿真跑起来之后再根据结果调。”

他说完在流程图旁边补充了几行注释,把奖励函数的计算公式写清楚,然后交给何晋去搭建模型框架。